云栖大会释放万亿算力信号,阿里能跑赢吗?
2026-09-24 23:35:17
  • 0
  • 0
  • 0

“机器思考总量或将超人类千倍。

9月22日,2026杭州云栖大会开幕。阿里巴巴集团CEO吴泳铭在演讲中提出了一个颇具想象力的判断:机器正在成为思考的主力,未来机器思考总量将达到人类思考总量的1000倍以上。

在吴泳铭看来,上一次相似的变革发生在工业革命时期。蒸汽机、内燃机与电力,将“动力”从稀缺资源变成了可规模化供给的商品;而AI带来的变化,则可能是让“思考”也走向规模化供给。今天,机器承担了绝大多数物理工作,未来,大量重复、复杂甚至专业化的脑力工作,也可能被机器智能接过一部分。

这个判断并不只是一次关于未来的宏大表述。围绕“机器智能”时代,阿里在本届云栖大会上密集公布了模型、芯片、云和智能体基础设施的最新进展:Qwen计划训练5万亿到10万亿参数模型;平头哥发布新一代AI芯片真武V900;阿里云提出面向Model、Harness和Context构建Agentic Cloud,并推出AgentCore、Agent Sandbox、新一代高性能存储CPFS等产品。

从这些动作来看,阿里试图回答的并不只是“如何训练出更强的大模型”,而是一个更长期的问题:当AI从聊天、写作、编程等单点工具,进一步进入长程任务、自主决策和企业生产流程后,什么样的基础设施才能支撑机器智能被真正大规模使用?

这也是当前整个行业共同面对的命题。大模型能力快速进步,模型生成内容已不再稀缺;真正稀缺的,是如何让AI在复杂场景中稳定运行、调用数据、连接工具、完成任务,并对结果负责。

全栈底座布局:从模型自我进化到芯模协同的基础设施突围

如果说大模型是机器智能的“大脑”,那么模型能力依然是整套体系最基础的一环。

本届云栖大会上,阿里集中展示了Qwen大模型在递归式自我改进,即RSI方面的探索。这项技术的背后,其实对应着Qwen试图突破的第一个行业痛点:摆脱传统模式下大模型迭代对于人力的高度依赖,追求更高智能并加速自我进化。

所谓RSI,可以理解为让模型不再完全依赖人工发现问题、人工准备训练数据、人工设计实验,而是在一定范围内自主发现短板、构造训练数据、验证结果,再将这些反馈用于下一轮优化。

在最新的Artificial Analysis全球大模型排行榜上,Qwen3.8-Max从40提升到45分

按照阿里披露的信息,Qwen3.8‑Max已能够自主搭建训练流程、构造训练数据,并设计实验、定位缺陷。在人类“零参与”的情况下,模型持续迭代超过1个月,完成33轮有效迭代。基于RSI与后训练等技术优化,Qwen3.8‑Max在Artificial Analysis上的得分从40分提升至45分,进入与Claude、GPT等前沿模型相近的梯队。

模型不断变大,多模态数据不断增加,Agent任务越来越长,都在快速推高算力、网络和存储的需求。

吴泳铭将Token比作AI时代的“电”,将芯片比作“发电机”。这种表述背后,是一个很直观的产业逻辑:模型能力再强,如果没有足够的芯片供给、集群能力和云服务,智能就难以从实验室和少数头部用户,走向更广泛的企业与终端。

本届云栖大会上,平头哥发布新一代AI芯片真武V900。阿里披露,真武V900的性能达到真武M890的3倍,基于该芯片构建的单一集群可扩展至50万卡,可支撑前沿模型训练和推理。平头哥目前的产品布局还包括真武系列GPU、倚天系列CPU、磐脉系列智能网卡及ICN互联芯片,覆盖组建超大规模AI集群所需的多个核心环节。

在超节点层面,阿里自研的M890 AI超节点已支撑超过2万亿参数大模型的高效推理,并实现规模化供给。即将在明年推出的灵骏真武V900超节点,性能将进一步提升,支持千卡Scale-Up互连,单集群扩展至50万卡规模。

对于大模型厂商和云服务商来说,芯片性能并不等同于最终可用的AI生产力。模型训练和推理是高度系统化的工程:芯片、服务器、网络、存储、软件框架、推理引擎和模型架构之间,任何一个环节出现瓶颈,都会影响整体利用率。

因此,阿里此次反复提及“芯模协同”和“全栈联合调优”。例如,在存储层面,阿里云发布新一代高性能存储CPFS,称其吞吐可达百TB/s级、IOPS达到亿级,单文件系统规模提升至100PiB,并可将模型启动平均耗时降低50%、峰值算力利用率提升30%、AI存储成本降低69%。

推理环节的优化同样重要。随着大模型上下文变长、Agent多轮任务增多,KVCache的规模快速膨胀。阿里云推出Tair KVCM和KV CacheStore等产品,围绕缓存管理、存储和调度进行优化。阿里披露,Tair KVCM缓存命中率可达99%,每Token成本下降50%;KV CacheStore在客户生产环境中实现缓存覆盖时间窗口扩大900%、吞吐提升20%、首Token延迟降低54%。

这些数据均来自阿里云披露,实际效果仍会受到模型类型、任务复杂度、客户系统和使用方式等因素影响。但它们也说明,AI基础设施的竞争已不再只是“拥有多少张卡”,而是如何让每一张卡、每一份缓存、每一次网络传输发挥更高效率。

面向企业级业务:Agentic Cloud试图解答商业化落地难题

一个通用模型可以回答公开知识,也可以生成报告、代码和表格。但当它进入企业时,企业真正需要的往往不是通用回答,而是基于内部制度、客户资料、业务数据、实时状态和操作反馈做出正确行动。

为了与企业级客户的深度适配,阿里云推出企业级Agent构建治理平台AgentCore,将企业级Agent基础设施标准化、托管化,支持长任务、失败重试、断点恢复和异步执行;提供安全执行环境、资源隔离、身份权限和全链路审计,统一管理模型、MCP Server、Skill等资产,可提升任务完成率99%,TCO成本降低70%。

阿里云还推出了Agent Sandbox,能够为Agent提供开箱即用、极致弹性、安全可靠的执行环境,创建吞吐10万/分钟,深休眠唤醒<600ms,兼容E2B和 K8s,满足从开发者到企业级Agent的规模化运行需求;Agentic OS,Agent 原生操作系统,可节省Token消耗30%以上,沙箱部署密度提升3倍;Agentic Computer,为智能体提供统一、长期在线的专属云电脑工位,兼容主流Agent框架,具备Computer Use和GUI操作能力,权限可控、操作可审计

从产品定义看,阿里云希望把企业部署Agent所需的基础能力托管化、标准化。企业无需从零搭建复杂的运行、监控、安全和治理体系,而是可以在云上组合模型、工具、技能和数据。

决定Agent能力上限的不只是模型参数,还包括能否持续理解企业知识、业务状态和执行反馈,因此上下文不再是应用侧的一段缓存,而正在成为企业需要统一建设和治理的新型数据资产。

围绕这一变化,阿里云提出了“存储—计算处理—上下文工程”三位一体的引擎——Context Engine,将企业全域数据转化为实时上下文,让Agent从“知道什么”进一步走向“此刻应该做什么”:底层以多模态数据存储承接对话、视频帧、点云、轨迹和Agent反馈;中间层覆盖数据集成、转换、治理、质量和建模;上层通过全域知识库、多模态语义整合、持续记忆管理和实时上下文装配,把分散数据组织成Agent可以按需调用、动态更新的上下文。

从面向Model的模型生产,到面向Harness的自主运行与持续进化,再到面向Context的实时智能决策,阿里云正在把算力、网络、存储、运行环境、身份安全和企业数据组织成统一的Agentic Cloud。

这些产品的共同指向是,AI云的核心价值早已不止于算力供给,而是一整套配套能力,帮助企业管理数据、沉淀业务知识、搭建持续记忆体系,让企业的数据资产可以高效流动,支撑智能体深度融入真实的业务流程。

AI竞争进入系统战
阿里的挑战也刚刚开始

从本届云栖大会释放出的完整信号不难看出,阿里巴巴的AI布局,已经彻底跳出单点产品的竞争逻辑,不只单纯追求一款大模型的榜单成绩或是单一云产品的功能迭代,转而构建一套打通模型、自研芯片、算力集群、高速网络、分布式存储、智能体运行平台与企业上下文引擎的完整技术闭环。

这套体系的优势在于,阿里同时拥有Qwen模型、平头哥芯片、阿里云基础设施,以及面向开发者和企业的产品能力。模型可以推动芯片和推理系统优化,云可以承接模型训练、推理与智能体运行,企业数据和应用需求又能反过来为模型迭代提供真实反馈。

但一套完整的技术体系,并不代表商业价值能够自动兑现,全栈布局的背后,是多重现实约束与待解的产业命题。

首先,AI基础设施需要长期、持续且高强度的投入。模型参数扩张、数据中心建设和芯片研发都意味着巨大的资源消耗。阿里提出2032年全球数据中心规模超过20GW的目标,反映了其对需求的信心,但市场需求释放速度、供应链条件、技术路线变化和投资回报周期,都将影响这一目标的实际推进。

同时,还需要注意的是,随着多款智能体产品同步推向市场,产品线之间的边界日渐模糊:今年8月,千问办公整合钉钉相关能力,主攻办公知识协同场景;Qoder垂直切入代码开发赛道。经过多轮调整之后,阿里多条智能体产品线,仍然存在用户群体、应用场景互相重叠的情况。

此外,企业级AI的竞争早已不止局限于技术能力,最终的较量落脚于两大现实命题:使用成本与数据安全。

在成本端,Token消耗的失控已经成为企业普遍的痛点。硅谷企业内部曾经流行过AI使用排行榜,员工无节制地调用最高规格大模型能力,个别员工单月Token消耗成本甚至达到50万美元。放到现实的企业经营场景当中,如果员工不加节制地调用高阶模型能力,带来的成本压力是绝大多数企业管理者都无法承受的。

而安全层面的约束则更加刚性,绝大多数企业风控部门都会严格限制员工使用公共版本AI工具,核心顾虑就是内部经营数据泄露的风险。对企业风控负责人而言,智能体的安全边界,是一切业务落地的前置条件。

对于阿里而言,如何将基础模型、云服务和行业场景更紧密地连接起来,形成可复用、可交付、可持续的商业模式,仍然需要持续的实践摸索。

AI竞赛加速
智能机器时代的资本博弈

吴泳铭在云栖大会宣布,到2032年阿里云运营的全球数据中心规模将超过20GW。

黄仁勋曾估算,建设1GW级AI数据中心需500亿至600亿美元。瑞银的测算口径更保守:新增1GW仅IT设备资本开支就约1000亿元人民币。

巨额投入的可持续性,首先取决于企业自身的资金底盘。高盛测算,阿里年度资本开支约2000亿至3000亿元人民币,资金来源包括电商业务稳定的EBITA、云业务利润增长、账面现金及融资。

资本市场也对这套长期投入给出了乐观的收益预期。瑞银预计2032年阿里云对外收入约1700亿美元,花旗测算约1600亿美元,摩根士丹利则给出约2400亿美元的总收入产能路径。三家机构均隐含约40%的年复合增速。

阿里自身的说法更直接。吴泳铭曾在分析师电话会上表态:“AI算力Capex投资回报确定性非常高,Capex投入可三年内回本”。逻辑是用前两三年的现金流净流出,换取五年后每年数百亿美元的云收入。

当然,大规模AI布局并非阿里一家的单独行动,一场全行业的智能竞速已经全面展开。腾讯2026年二季度资本开支升至528亿元,同比翻了近三倍,绝大部分投向数据中心和GPU服务器。字节跳动2026年AI资本开支规划约2000亿元,力度甚至超过阿里。BAT三家二季度资本开支合计超过1260亿元,同比增长105%。算力基础设施的大规模投入,已经成为头部互联网厂商的共同选择,这场军备竞赛几乎没有退路。

巨额资本持续涌入算力赛道,本质上是行业正在押注一套全新智能基础设施的建成。

吴泳铭将机器智能比作新的电力系统,或许正是在表达这一层含义。电力改变世界,并不只因为它可以点亮一盏灯,而是因为发电站、电网、插座和无数电器共同构成了一张社会基础网络。

AI也正在走向类似的过程。模型是大脑,芯片是发电机,云是电网,Agent则可能成为未来连接智能与具体任务的“电器”。时至今日,机器智能时代最终的产品形态尚未形成统一答案,所有行业参与者,仍然处在一条漫长的探索之路上。

文:几重山月 / 数据猿

责编:凝视深空 / 数据猿

 
最新文章
相关阅读