前言
当前,大模型、大算力成为科技前沿热点。在大模型训练与应用方面,大算力的需求成为业界的难点。英伟达的H100等芯片显露出超强算力,在大模型训练与应用中形成了一家独大的优势,甚至出现H100芯片供不应求的局面。在GPU成功应用的同时,其高功耗、高价位等问题也彰显无遗。单块GPU板卡高达700W的功耗引发了业界强烈的担忧,GPU的低功耗替代方案也成为业界重要的研究方向。
人工智能(AI)芯片从研制到应用,都展现出蓬勃发展的强劲生命力。随着AI芯片算力的大幅提升,其在大模型的训练和应用中也拥有一席之地。
冯·诺依曼架构存在“内存墙”问题,存算一体、算存算一体、感存算一体计算架构应运而生。这些新型计算架构彰显出存储体的重要性,而克服“内存墙”的影响则是新型计算架构的优势所在。
苏光大教授主持的清华大学图像识别与高速图像处理实验室在1997年研制成功了NIPC1邻域图像并行计算机。该项研究成果在并行处理技术的学术研究热潮中,独树一帜地研究了存储体的新型结构并于1999年在《电子学报》上发表了《邻域图像帧存储体的理论及其实现》的学术论文。该论文明确指出: “图像帧存的数据流是影响高速图像处理的瓶颈这个结论已不尽正确。”该论文从理论和方法上率先解决了“内存墙”问题。2008年1月,清华大学图像识别与高速图像处理实验室研制成功的NIPC3邻域图像并行计算机通过了科技成果鉴定。该成果在大邻域图像核和邻域图像处理的速度上达到国际领先水平,并推动了对算存算一体计算理论和方法的研究。
飞诺门阵(北京)科技有限公司是全域人工智能领域的国家级重点“小巨人”企业,公司创始人沈寓实博士及其团队,在非冯诺依曼架构领域深耕已逾十年,其撰写的《非冯诺依曼网络计算体系》是该领域的代表性著作,其提出的非诺体系打破了传统网络架构,建立了统一的、面向连接的流水线结构,实现了存储、计算、通信的深度融合,突破了算力瓶颈,并以“算力并网”为关键抓手,通过“意图感知”来匹配算力供给与场景需求,将存算一体的高效能计算能力与垂直行业应用深度结合,具有低延迟、高能效及强大的并行处理等优势。
创新无终点,探索无止境。我们沿着算存算一体计算的方向前行,又提出了算存算一体的二维计算、三维计算的流水线处理方法,展现出算存算一体计算的有效算力优势和应用前景。算存算一体计算的研究从猜想到实践,一路走来,已有40余年。
本书旨在总结多年的算存算一体计算研究成果,为算力的发展贡献自己的微薄之力。
感谢科技部、公安部、工业和信息化部给予的信任,感谢清华大学多部门及电子工程系各级领导的支持与帮助。
感谢吴佑寿院士对苏光大教授的悉心指导和提携,感谢邬贺铨院士、沈昌祥院士、郑纬民院士、陆建华院士、张亚勤院士、吴麒教授、朱雪龙教授、林行刚教授、吴国威教授对苏光大教授和沈寓实博士的真诚帮助,感谢与我们一起从事科研工作的师生和其他工作人员,同时也感谢与我们合作的单位。
感谢业界同仁的支持和帮助。
我们愿意与同行进行深入的交流,以促进科技发展。
本书不足之处,望得到批评指正。
作者2026年5月
