芯东西9月21日消息,2026全球AI芯片峰会近日在上海顺利闭幕。
本次大会由智东西发起,其旗下智猩猩主办,芯东西协办,主题为“芯路求索 聚力致远”,全面展示了从TOPS到Token的AI算力关键链路。
在为期两天的活动中,超过60位重要嘉宾在1场开幕式、3场论坛和5场闭门研讨会上密集分享了技术创新、落地实践和产业趋势的干货。多位演讲者还在会上预告了重磅新品。
会议聚焦AI芯片前沿,涉及架构创新、3D堆叠、超节点、KV Cache、新型存储、Token工厂异构混训混推、大模型推理、智能体推理、具身智能推理等热点议题。来自超过100家AI芯片生态企业的专业观众到场参会交流。
在展区,奎芯科技、芯来科技、Imagination、进迭时空、奇异摩尔、星融元、启芯宸光、科华数据、博伦智汇、硅芯科技、先进编译、恒瀚微电子、焱融科技等企业展示了最新的技术产品和解决方案。
“九年前,我们在上海举办了第一届全球AI芯片峰会。九年来,全球AI芯片峰会的足迹已遍布北京、深圳和上海。”智东西联合创始人兼CEO龚伦常在致辞中表示,“这是我们持续关注整个AI领域的一个缩影。”
智东西联合创始人兼CEO龚伦常
我们对开幕式及3场高峰论坛(大模型AI芯片、Agent推理芯片、具身智能芯片)中30位嘉宾的分享内容进行了梳理总结,重点如下:
随着智能体的爆发,全球AI芯片产业格局持续演变,头部模型厂商深度参与芯片架构定制,几乎每家云计算巨头都在自研AI芯片,国产AI加速卡持续放量,算力运营重心从不计成本抢占高端算力,转向以token成本和算力利用率为核心的精细化运营。
如何通过技术创新提高大模型训推效率?为什么智能体时代呼唤“六边形”CPU?突破算力、内存、网络瓶颈有哪些新解法?大模型怎么辅助提高芯片设计效率?5位演讲嘉宾在开幕式上妙语连珠,分享了他们的成果与思考。
中山大学集成电路学院院长、IEEE/AAIA Fellow王中风分享了大模型时代下AI芯片的设计挑战与演进方向。当前如何将硬件峰值算力转化为模型部署的有效算力成为关键问题,为了实现高效部署,其团队通过压缩与量化技术创新降低数据开销,基于软硬件协同提升推理效率。
模型驱动芯片设计方面,王中风团队通过视觉Mamba高效加速器、超低BitLLM推理加速器、多层次稀疏Transformer加速器设计,解决算子适配、存储调度、稀疏利用等挑战;面向大模型辅助芯片设计自动化,提出性能感知GEMM Verilog生成设计、GEMM图-码转换多模态框架等创新。
王中风认为,提升AI有效算力的演进方向将是模型、硬件与系统设计的协同创新,包括探索更低比特的模型压缩与精度适配、联合优化算子融合与数据重用、用部署反馈驱动模型迭代。
中山大学集成电路学院院长、IEEE/AAIA Fellow王中风
英特尔中国区技术部总经理高宇说,智能体爆发带动CPU、内存、SSD和隐私需求,让CPU告别过去给GPU“打辅助”的角色,重回AI算力体系的C位。
智能体的运行是一个循环过程,其主线程主要运行在CPU上。CPU需要负责上下文处理、调用大模型、权限检查、工具调用以及结果处理等环节。
适合智能体的CPU不能只追求单点性能,而要成为“六边形战士”,同时具备更高的沙箱并发度、IPC和频率、更大的内存容量,以及硬件加速和安全能力。
高宇预告说,英特尔将在两天后的英特尔技术创新与产业生态大会(Intel Connection)上展示内置128张或192张Granite Rapids处理器的高密度CPU机柜设计,单机柜可承载5万个Agent同时并发运行。
英特尔中国区技术部总经理高宇
清华大学集成电路学院副教授胡杨指出,AI基础设施的价值不能仅以单芯片峰值算力衡量,还应同时考虑有效Token产出与设备、网络、供电冷却等全生命周期投入。其团队围绕Token经济性,开展从计算芯粒、晶圆级芯片到集群的全系统协同设计。
针对通信、功耗和集成密度三大瓶颈,团队根据任务需求与面积、功耗约束,优化计算、存储和通信资源配比。在系统层面,将高带宽通信转入晶圆内部,联合设计晶圆内外互连及供电冷却,减少通信等待与外围设备投入。
报告介绍了模型部署、专家布局和集群组网等研究进展。通过协同优化Token映射与专家负载均衡,MoE推理方案在4毫秒输出Token间隔约束下,单芯粒吞吐达到对照方案的1.84倍。晶圆间组网方案在所评估配置中的电力成本较基线降低46%。相关研究分别从提高有效产出和减少系统投入两方面探索晶圆级的经济性。
胡杨强调,性能收益需要与制造、运行代价共同评估。团队已将热致翘曲、制造与装配良率、容错和散热约束纳入设计,联合清微智能研制了国产晶圆级芯片样机,形成大尺寸硅基板设计PDK、芯粒集成与系统验证能力。并联合清微智能与浦江实验室构建了软件基础设施。
清华大学集成电路学院副教授胡杨
后摩智能联合创始人、产品副总裁信晓旭分享说,应对AI芯片提升算力和访存的两大挑战,后摩智能作为存算一体的先行者,过去六年沿着基于SRAM的存算一体路线迭代,成功将存算一体架构从学术界带入产业界。其旗舰产品M50量产半年,产品定点已达到150+,形成商业闭环。
针对行业主流3D堆叠技术算力受限、散热不佳等难题,后摩智能自研3D CIM架构,实现同等面积下算力翻倍,功耗与散热压力显著优化。信晓旭表示,后摩智能将围绕端侧AI对算力、能效和存储带宽提出的新需求进行技术演进,并加速推进3D CIM架构的芯片产业化探索。
后摩智能联合创始人、产品副总裁信晓旭
在奎芯科技联合创始人兼副总裁王晓阳看来,AI芯片设计逐渐走向定制化、异构化、专用化,给内存架构创新带来新机会,HBM Base Die定制化和HBF分层存储成为新趋势。
HBM内存已从标准单品发展成小型子系统,需针对不同工作负载深度定制。HBF采用NAND Flash定制化堆叠,达到HBM级带宽但容量高一个数量级。未来AI芯片可能采用NAND Flash(HBF)+HBM混合架构,将KV Cache、Attention等延迟敏感数据留HBM,可预测的专家权重卸到HBF。
奎芯科技拥有全栈内存与接口IP,在UCIe,HBM,LPDDR,ONFI/NAND等接口方面积累深厚,能够为定制内存+标准互联架构提供接口底座技术。目前奎芯M2 UCIe接口底座的标准封装32G已完成硅验证,其打造的Chiplet产品ML100 IO Die能实现HBM与xPU解耦,已流片交付客户。
奎芯科技联合创始人兼副总裁王晓阳
经纬圆桌由经纬创投合伙人童倜主持,晰见科技创始人杨哲宇、安纳智芯首席科学家孙仲、芯词元创始人詹翊、后摩智能AI系统总工陈仲铭四位嘉宾围绕“AI的平民化及端侧模拟计算的未来”主题进行分享。
经纬创投合伙人童倜给本场圆桌划出两大重点:一是AI平民化,AI服务面向富人是阶段性的中间过程,未来肯定会有大量产品和服务面向普通人;二是在端侧,传统GPU、数字NPU是“老登”,未来需要用更多新技术解决现在的问题。
计算芯片公司有了水,还需要配套的管子,这里的水管代表芯片能够支撑的模型规格能力。童倜认为,企业具备核心计算能力是前提,而存储架构的选型,则是根据不同应用场景,基于对应模型的参数规模及系统需要,来决定。
从左到右:经纬创投合伙人童倜,晰见科技创始人杨哲宇,安纳智芯首席科学家孙仲,芯词元创始人詹翊,后摩智能AI系统总工陈仲铭
晰见科技创始人杨哲宇说,端侧智能或者更大的范畴Physical AGI是比肩AI Coding的下一个机会,晰见科技要让AI拥有看世界的眼睛。其感存算传一体的3D IC芯片天眸芯是一颗能直接输出token的芯片,相关论文登上国际顶刊Nature封面。
天眸芯的结构是基于3D堆叠技术,在感光阵列下方堆叠高密度存储阵列与运算单元,通过模拟计算降低ADC的转换频次,功耗仅为对应同规格芯片的几十分之一。
据杨哲宇透露,目前头部具身智能企业打网球、踢足球、打乒乓球的视觉方案都直接来自天眸或进入深度评估阶段,具身运动人形机器人未来都会在3-6个月内,采用晰见科技的天眸芯或Token Camera。
今年11月,晰见科技将发布基于天眸芯的多模态大模型。内部测试显示,基于天眸芯的稀疏Token该模型的首token延迟(TTFT)仅为传统基础模型的二十分之一,性能可直接对标国内外头部多模态大模型,且率先支持主动感知与视觉注意力,是未来Physical AGI时刻的基座模型。
安纳智芯成立不到一年,专注于模拟计算芯片设计。安纳智芯首席科学家孙仲谈道,模拟计算芯片有希望将相关应用的时延从百毫秒级降到几毫秒,人可感知的延迟为几十毫秒,机器人延迟在几毫秒运动会更流畅。
端侧大模型的数据量很大,处理这一问题的自然方法是做3D堆叠。安纳智芯擅长做矩阵计算,在面对如端侧设备微调等具体应用时,数据存储就可以使用DRAM或HBM,再利用模拟计算芯片进行数据处理、微调,这也是安纳智芯将后续探索的方向。
孙仲透露说,其工程样片即将回片,下一步会联合银河通用等具身智能公司做运动规划和实时控制Demo,与科大讯飞等端侧AI企业打造信号处理、大模型微调等相关应用。
芯词元创始人詹翊认为,AI平民化分为AI是否值得用、用不用得起、能否显著提高生产力三个维度:第一个维度和基座模型有关,第二、第三个维度反映在硬件上,就是降成本和提升推理速度。
芯词元将基于全新一代存算架构打造速度更快、成本更低的AI推理芯片与推理算力集群,预计明年上半年发布MO-I1,展示近万tokens/s的端到端推理速度,联合小米等产业伙伴实现超高速AI推理硬件在现实应用场景中的实际落地。
詹翊判断,未来AI推理硬件会是集各种存储介质所长的综合系统。其中芯词元的eDRAM负责片内高带宽和高速计算需求;片外3D DRAM和HBF互有带宽和密度优势,都会有他们各自适配的场景。所以AI推理硬件会在不同场景下采用不同的搭配方案,但芯词元的eDRAM存算一定是片内方案的最优解。
在后摩智能AI系统总工陈仲铭看来,3D堆叠能把内存带宽做大,实现极高的数据吞吐,尤其在物理AI场景下,有机会实现实时交互,不过现阶段相关供应链还未成熟。
HBF是应对HBM高昂成本的一条技术思路。陈仲铭认为,HBF无法完全替代HBM,更多是作为互补方案,未来3D堆叠技术可能将出现HBM+HBF等混合堆叠架构。
后摩智能采用3D CIM(存算+3D DRAM)的下一代旗舰芯片A20已流片,具备端侧超实时思考和互动能力。
该公司也在关注模拟存算,可能会在下一代或下下一代产品实现大规模生产。
随着大模型参数向万亿级膨胀,峰值算力不再是衡量AI芯片能力的唯一标尺,制约系统效率的要素还包括数据搬得动、存得下、连得快,以及芯片能否以可接受的功耗和成本真正落地。访存带宽、互联效率、软件生态和工程化能力,正在共同影响一颗AI芯片的有效算力。
AI芯片创新正从单点提升计算性能,转向计算、存储、互联、软件与设计工具的系统级重构。如何打通从架构创新到规模量产、从理论性能到真实应用的漫长链条?在大模型AI芯片高峰论坛上,8位嘉宾给出了他们的答案。有人以软件定义、3D堆叠和近存计算突破内存墙,有人押注存算一体、HBF与现代模拟计算,也有人将战场推向融合GPU、STCO和AI赋能EDA。
东方算芯董事长特别助理彭贵强谈道,“更聪明的模型”需要大算力和高访存带宽,“更低成本的应用”需要高访存带宽和低成本推理,算力评价标尺正从峰值算力变为有效算力。芯片性能不仅取决于计算单元本身,更受限于访存带宽、互联延迟、调度效率等系统因素。
东方算芯聚焦软件定义芯片,从计算、存储和互联架构三大方面进行创新:(1)软件定义Tile,提升硬件利用率,降低编程复杂度;(2)采用逻辑-存储三维匹配的3D IC设计,提供极致带宽并突破内存墙,这一过程需要应对应力与晶圆翘曲控制、热管理和良率成本损失三大工程化挑战;(3)通过Infinity Chiplet 3.5D,实现更强算力和更大互连规模。
东方算芯董事长特别助理彭贵强
亿铸科技创始人、董事长兼CEO熊大鹏认为,通用存算一体是突破AI芯片算力与内存瓶颈的关键。对此,他提出三大核心定律,为行业落地提供理论支撑。
(1)搬运代价定律:AI数据搬运功耗与延时远高于计算本身,存算一体核心是尽可能消除数据搬运频次与距离。
(2)通用边界定律:通用存算一体需兼容CUDA主流生态,全覆盖通用GPU算力,适配各类模型迭代。
(3)异构终局定律:存算一体与GPU架构逻辑不同,二者融合能力直接决定芯片商业化成败。
熊大鹏强调,存算一体的核心在于存储,亿铸科技选定大容量、高成熟度、低成本的3D DRAM技术路线,未来将推出多形态全栈算力产品,覆盖云边端各类算力场景。
亿铸科技创始人、董事长兼CEO熊大鹏
深圳迈特芯科技芯片产品经理李凯博士分享了横亘在端侧大模型推理面前的“三座大山”:一是功耗、算力与成本的“不可能三角”,二是内存墙限制,三是通用方案与专用芯片之间的场景适配难题。
迈特芯采用张量脉动架构叠加3D近存计算来打破“内存墙”,将带宽利用率提升至80%左右。经测算,同样实现600GB/s带宽,传统2D方案功耗约为3050W,而3D方案可将功耗降至37W。
据李凯博士透露,迈特芯3D TPU芯片已于今年流片,预计今年11月回片并点亮,首批将适配2B至9B模型,平均功耗约6W,预计推理速度可达80tokens/s。
深圳迈特芯科技芯片产品经理李凯博士
Imagination应用工程总监艾克观察到,端侧芯片已经开始同时承担感知、计算、推理与图形渲染等任务,传统异构架构暴露出数据搬运、内存吞吐、任务调度与软件适配等短板,如何应对5-10年生命周期中不断变化的模型与应用需求,成为端侧芯片设计的新挑战。
产业正探索更灵活的异构融合计算架构,趋势是让GPU从单纯的图形处理向通用计算与AI计算中心演进。Imagination E系列GPU IP通过矩阵乘法直接嵌入GPU核心来提高GPU利用率,AI计算、通用计算与图形处理由固件统一调度并隔离多任务,再通过算子库、图优化与多格式量化支持轻量化部署,减少计算单元间的数据搬运与调度成本。
Imagination应用工程总监艾克
硅芯科技创始人兼总经理赵毅博士指出,3D IC EDA领域被视为“无人区”——2D时代积累的设计方法学与工具链在三维堆叠场景下面临比较大的变革,需要重构工具链与设计范式。当前3D DRAM多层堆叠与存算芯片企业亟需一套全新工具链,信号、电源、热等多物理场仿真也需从单点后置转向协同前置。
芯片设计正从传统单芯片时代的DTCO(芯片设计与硅工艺协同),向端到端深度协同的STCO(系统-工艺协同优化)升级。硅芯科技STCO闭环协同流程贯通架构、设计、工艺与制造,将翘曲、电源完整性等量产风险前置管控。
同时,AI将赋能EDA新范式。硅芯科技推出了3Sheng Integration平台,核心AI Agent“Chips Z”实现自动迭代、闭环寻优等功能,显著压缩研发周期,