智筑制造有限公司

从单颗芯片到万卡集群,AI算力竞争正在转向系统与生态协同

发布日期:2026-07-21 15:16点击次数:80

从单颗芯片到万卡集群,AI算力竞争正在转向系统与生态协同

7月18日,云天励飞在2026天下东谈主工智能大会(WAIC)上公布畴昔两年多的AI推理芯片路子图。公司计议推出DeepVerse100P、DeepVerse100D、DeepVerse100L三款云霄大算力芯片,分别面向大模子推理中的Prefill、Decode以及Decode FFN措施进行专用优化,并协同部署于万卡级异构集群。

这一起线图反馈出AI算力竞争正在发生变化。跟着长高下文、深度推理和智能体应用快速发展,不同推理阶段对诡计、内存带宽和通讯才能的需求加速分化。评价推理恶果的中枢机划,也正从单颗芯片的峰值算力,转向Token笼统、响应延迟、集群诓骗率和单元生成资本。

从三款专用芯片、超节点互联到IFWA软件栈及产业协同计议,云天励飞试图将优化范围从单芯片延长至无缺推理系统。南都湾财社记者戒备到,这背后是AI算力竞争正在转向系统与生态协同,发展重点由“有莫得”进一步转向“恶果高不高、部署难不难、资本降不降”。

推理负载执续分化,芯片联想走向专用化

大模子推理正在从相对单一的对话问答,参预长高下文、复杂推理和多智能体协同并存的新阶段。通用AI助手强调响应速率和并发才能,编程、数学等深度推理任务需要更长的推理链路,Agentic Coding和多Agent系统则要求模子执续调用用具、交换信息并及时反馈。任务形态越复杂,推理系统濒临的笼统、延迟和资本压力越大。

在这一布景下,峰值算力已难以无缺算计芯片的践诺推理才能。一次Token生成不仅触及矩阵诡计,还受到内存读写、节点通讯、资源诊治等措施影响。算力弥散但带宽不及,或单卡性能较高但跨卡通讯拥塞,都可能导致诡计资源恭候,拉低集群举座恶果。

不同推理阶段之间的相反也在扩大。Prefill阶段需要一次性惩处输入高下文,诡计密度较高;Decode阶段汲取逐Token生成形态,更依赖内存带宽和数据窥察恶果。在MoE模子中,Decode里面的Attention与FFN又分别偏向访存密集和诡计密集,不竭共用并吞套通用硬件,容易出现资源错配。

针对这一趋势,云天励飞计议了三款专用芯片。DeepVerse100P面向百万级高下文的Prefill场景,重点承载长文本输入惩处,幸免Prefill与Decode混部时争夺算力和带宽,影响执续生成笼统。

DeepVerse100D主要职业Decode措施,强化内存带宽,并复古1024卡Scale-up和光互研究统架构。其想路是笔据任务需要树立芯片间光路直连,并动态重构运动关系,减少传统多跳交换带来的列队、拥塞和中间转发支出,戒指大限制集群中的通讯袭击和尾延迟。

DeepVerse100L则面向Decode阶段诡计密集型的FFN措施,汲取3D Memory架构,进步内存带宽,并通过低延迟芯片互联,加速激活数据传输。三款芯片不再追求由单一架构遮蔽统共负载,而是按照不同推理阶段进行单干。

这种变化意味着,AI推理芯片正参预愈加细腻的架构竞争阶段。往日,厂商通常通过提高算力、带宽和存储容量得回详尽性能进步;跟着推理限制扩大,围绕具体负载进行专用联想,电车痴汉+磁力链接正在成为镌汰资源损失、提高Token产出恶果的新旅途。

从单卡性能转向集群恶果,国产算力补皆软件与生态短板

专用芯片只好参预大限制集群并达成高效协同,才能转念为践诺算力产出。在万卡级推理系统中,举座性能并不是单卡才能的浮浅叠加。集群限制越大,通讯恭候、负载不均、拓荒闲置和尾延迟等问题越超越,系统诊治才能对最终恶果的影响也越显着。

云天励飞计议将DeepVerse100P、DeepVerse100D和DeepVerse100L分离部署于不同资源池,分别惩处Prefill、Decode Attention和Decode FFN负载,再通过高速互联构成异构集群。其中枢逻辑,是把无缺推理过程拆解为多个资源需求不同的措施,并为每个措施匹配相应芯片,减少通用算力混部产生的资源竞争。

这也符号着AI芯片厂商的竞争界限束缚外扩。芯片联想不再只围绕单颗器件,而是需要同步琢磨互联架构、节点组织、任务诊治和模子开动形态。优化对象也从每秒大略完成些许次诡计,转向每套集群大略厚实生成些许Token,以及为此耗尽些许硬件、电力和运维资本。

硬件异构化同期提高了软件适配难度。不同芯片承担不同任务后,模子拆分、算子诊治、数据传输和故障惩处都会愈加复杂。若松懈训导的软件栈,硬件表面性能难以充分开释,开发者还可能濒临模子迁徙周期长、算子一样开发等问题。

围绕这一短板,云天励飞正在建造IFWA软件栈,遮蔽模子开发、编程、编译和系统部署等措施。一方面,IFWA执续适配PyTorch ATen算子,并加强对vLLM、SGLang等主流推理框架的复古,尽量沿用现存开发接口和开源组件,镌汰模子迁徙资本;另一方面,公司通过模子量化、压缩、编译和部署用具链,提高从模子到芯片的适配恶果。

云天励飞此前还开源了Houmao多Agent异构编程框架,由不同Agent协同完成模子开发、算子开发、性能优化和测考考据。这一尝试的价值不单在于引入AI缓助编程,更在于将部分依赖工程师老师的适配过程转念为可自动扩充和执续考据的法式化过程,以应付模子快速迭代带来的软件开发压力。

此外,云天励飞将Triton算子才能融入FlagOS,但愿通过社永别享减少不同国产硬件平台之间的一样适配。关于国产算力产业而言,软件生态的敞开性和兼容性,正成为决定硬件能否限制应用的紧迫条款。芯片具备基础性能仅仅第一步,能否快速接入主流模子和框架、镌汰开发与迁徙门槛,胜利影响践诺部署速率。

本年5月,云天励飞还皆集30余家单元发起“1001计议”,试图买通芯片、IP与EDA、封装测试、系统互联、软件平台、模子及应用等措施。其观点是让下流模子和应用需求更早参预芯片与系统联想过程,同期加速训导软件才能复用和新芯片场景考据。

从行业趋势看,跟着AI应用参预限制化阶段,算力供给的中枢矛盾正由完全数目不及,缓缓转向有用算力诓骗率不高、软硬件适配资本偏高以及Token价钱仍然较高。云天励飞建议“百亿Token一分钱”的恒久观点,能否达成仍取决于芯片量产、集群厚实性、软件训导度和应用限制,但这一标的所反馈的变化照旧明确:AI算力竞争正在从参数竞赛,转入以系统恶果和单元资本为中枢的新阶段。

采写:南都·湾财社记者 程洋