“当AI的“胃口”越来越大,存储如何跟上?走进数据猿联合同有科技、西部数据的线上技术研讨会,解锁新思路。
如果说GPT-3作为早期具有代表性的通用大模型,其1750亿参数规模还可以被想象成一间不断扩建的“大厨房”,那么今天已经能够实际运行的万亿参数模型,更像是一座持续运转的“食品加工厂”。
厨房时代,决定效率的可能更多是厨师的手速;但当规模进入工厂时代,仅仅让“厨师”变得更快已经不够了,原材料能不能及时运进来、生产线能不能持续运转、仓储和运输能不能跟上,都会成为决定最终产能的关键。
这恰恰是今天AI基础设施正在面对的变化。
今天我们所处的,正是这样一个关键节点:一边是大模型参数规模不断扩大,另一边是AI应用开始从实验性探索走向更大范围的实际部署。当计算能力持续向前推进,存储能否同步演进,已经成为决定AI基础设施效率的重要变量。
8月25日,数据猿联合同有科技与西部数据,以“万亿参数大模型时代:AI存储的容量、性能与存算协同新挑战”为主题,邀请两位长期深耕存储领域的一线技术专家做客直播间,从存储介质、存储架构到AI大模型落地等多个维度,重新审视AI时代的存储问题。
同有科技是国内较早进入企业级专业存储领域的上市企业之一,长期聚焦闪存、自主可控、云计算以及企业级存储解决方案。此次参与讨论的同有科技解决方案总经理王刚,长期深耕存储系统与解决方案,对自主可控全闪存、分布式存储架构以及AI大模型存储落地拥有丰富实战经验。
另一位嘉宾则来自西部数据。作为全球存储基础设施领域的领先厂商,西部数据在大容量存储领域拥有深厚技术积累,并持续通过HDD和存储平台创新支持AI时代不断增长的数据基础设施需求。
在数据猿联合创始人、总编辑张艳飞的主持下,两位来自存储产业一线的专家围绕一个越来越无法回避的问题展开讨论:当AI的“胃口”越来越大,存储究竟要如何跟上算力增长的速度?
模型开源之后
企业真的用得起吗?
尽管万亿参数模型开始开源,企业也能够下载模型。但这并不意味着企业已经具备了将它部署、训练和应用起来的条件。
万亿参数模型的权重文件可能达到TB级,训练数据集则可能进入PB级。训练过程会生成 Checkpoint 检查点、训练日志与各类数据集缓存;而推理服务阶段会产出推理日志、会话历史对话以及推理缓存数据。模型规模越大,企业需要准备的就越不只是GPU算力,还包括能够承载这些数据的存储容量、并发带宽和数据调度能力。
因此,开源模型带来的并不是一个简单的“低门槛时代”,而是把企业过去不容易看到的基础设施成本更加直接地暴露出来。
对于企业而言,如果只是希望将大模型用于代码编写、文档处理、客服问答等场景,可以选择直接调用成熟的API服务,往往已经可以满足需求。王刚在访谈中提到,一些企业每月投入几千元,就有可能获得较为明确的效率收益。企业不需要自建完整的模型和存储基础设施,也不必承担大规模运维成本。
如果通用模型与企业自身业务之间仍然存在距离,企业可以围绕具体工作流程训练相应的skills(技能)。例如,将企业常用的文档处理方式、客服话术、知识库检索或代码规范固化下来,让模型更贴近实际工作,而不是一开始就追求完整的大模型本地化部署。
对于确实需要深度使用模型的企业,云上租赁则提供了另一种选择。企业可以租用算力和存储资源,先在真实业务中验证模型效果,再根据使用规模决定是否建设自己的平台。相比一次性投入数百万元甚至更高成本,这种方式更适合仍在探索阶段、但又希望尽快进入AI应用的企业。
而当企业拥有稳定的业务需求、较高的数据敏感度,或者已经确定要长期运行自己的模型时,本地部署才更有现实意义。此时,存储的容量、性能、可靠性和扩展方式,都需要在方案设计阶段一并考虑。
云上还是本地
数据安全如何得到保障?
当企业开始把代码、文档、客户资料和业务知识交给模型处理,数据安全就不再只是部署方式的选择,而会进一步影响存储架构、访问权限和数据流动方式。
王刚在访谈中提到,对于涉及知识产权和核心业务数据的场景,一些企业愿意投入约30万至50万元建设本地环境,让模型和数据都留在企业内部。这种方式可以最大限度地减少核心数据离开企业控制范围的可能,但相应地,企业也需要承担硬件采购、模型部署、系统运维和后续升级的成本。
对于暂时没有条件完整本地部署的企业,也可以采用更具弹性的方式。一部分核心知识库和共享工作目录保留在本地,经过筛选和脱敏的数据再交给模型处理;对于一般性工作,则通过企业级API完成调用,并依靠服务协议、账号权限和数据隔离机制降低风险。
但无论采用哪种方式,数据安全都不能简单理解为“数据放在本地就安全,放在云上就不安全”。真正的安全能力,还包括数据分类、身份认证、权限控制、传输加密、存储加密、操作审计以及数据生命周期管理。
尤其在AI场景中,同一份数据在不同阶段的安全要求并不相同。正在参与训练的数据需要高频访问,模型权重和Checkpoint需要可靠保存,历史日志和归档数据则可能更多承担审计和追溯作用。它们既不能被无差别地放在同一存储层,也不应当拥有完全相同的访问权限。
从这个角度看,本地部署只是安全体系的一部分。企业真正需要建设的,是一套能够让数据被看见、被管理、被追踪的基础设施。模型在哪里运行固然重要,但数据如何进入模型、如何离开模型、如何被调度和保存,同样决定了安全边界能否成立。
冷热数据不断变化
硬盘如何成为AI基础设施的一部分?
AI数据并不是静止不变的。不同阶段的数据有着截然不同的访问特征与存储需求——从紧贴GPU的HBM/DRAM高速内存层、KV缓存层,到承载向量数据库与RAG检索的语义数据层,再到HDD大容量持久化存储层。每一层数据的访问频率、性能要求和成本考量各不相同,需要以差异化的存储策略来匹配数据生命周期中不同阶段的需求。
数据的热度也并不是固定的。当模型正在训练时,训练样本可能是最需要被快速访问的数据;模型上线后,近期对话热点知识会不断被调用;随着时间推移,旧版本模型、历史日志和训练数据的访问频率下降,却仍然需要被保存。
因此,所谓热数据、温数据和冷数据,并不存在一套可以适用于所有企业的固定时间标准。一份数据可能在一个月内没有被访问,但随着新的业务任务出现,它又会重新变成高频数据。冷热数据之间会随着业务变化不断迁移,具体策略应当由企业自身的数据访问频率和业务流程决定。
同有科技的解决方案,正是围绕不同数据层级进行针对性设计。在数据存储底座层面,同有科技采用了西部数据的高密度存储产品——包括Ultrastar系列企业级大容量硬盘。
西部数据的硬盘产品覆盖UltraSMR等技术路线,为上层存储系统提供大容量、高经济性的存储介质支撑,帮助客户提升存储密度并优化单位容量经济性与整体TCO。其中,SMR技术通过部分重叠数据磁道提升面密度;在此基础上,西部数据UltraSMR进一步结合硬件、控制器、读通道技术以及专有固件和算法,进一步扩大SMR相较CMR的容量优势,可实现20%以上的容量提升
在更大容量方向上,西部数据还介绍了基于HAMR的硬盘技术,通过磁头上激光二极管瞬间在颗粒位增加热量,使得单个颗粒位实现磁极性完成反转,从而完成数据的写入过程。该技术可大幅提升磁盘面密度,未来单碟可达到10TB,单个磁盘可容纳14张碟片。未来向单盘容量100TB迈进。
存储系统如何适配AI?
一个超大规模的部署方案给出了答案
王刚在直播中提到,AI存储不能只从某一块硬盘、某一种协议或某一个接口出发,而必须同时考虑硬件、软件、网络、文件系统和数据调度。
同有科技面向超算与智算场景打造的大规模存储解决方案,正是这一理念的落地实践。方案广泛适配于高校科研、生物医药、高端制造、科学计算、人工智能算力中心等多元业务场景;存储平台容量可达数百PB及以上,单集群最大聚合读写带宽不低于800GB/s。
同时针对机房空间约束进行了架构优化,整套存储系统部署大量西部数据高密度JBOD——Ultrastar Data60和Data102高密度存储平台,在有限空间内实现海量数据高吞吐存储,兼顾大容量高性能空间集约化部署,充分满足各类算力中心严苛的存储需求。
此外,西部数据JBOD搭载IsoVibe震动隔离和ArcticFlow热分区冷却两项专利技术。IsoVibe通过底板上的精密切割结构为硬盘提供悬挂和振动隔离,;ArcticFlow将冷风从机箱中央导入,冷气流分为两路独立供给盘柜前后两个硬盘区域,避免前区热风串入后区,两项技术加持硬盘返修率降低62%左右。对于包含数十甚至上百块硬盘的高密度存储环境来说,减少振动、降低温度,不仅意味着单块硬盘更稳定,也意味着整个系统的维护频率和运维成本显著下降。
方案拓扑如下图:
这个联合解决方案的意义在于,它不是简单堆容量,而是在有限空间里同时解决容量、吞吐和并发访问问题。单一文件系统可满足大于800GB/s的吞吐要求,并支撑流体力学、有限元分析等双精度任务,以及10亿至100亿参数模型训练和高并发推理。对于AI训练来说,数据需要在采集、清洗、训练、校验和保存之间反复流动,只有存储系统持续供给数据,GPU集群的效率才不会被后端拖住。
这也解释了同有科技与西部数据合作的价值:西部数据提供从高容量HDD、Ultrastar高密度JBOD,到OpenFlex NVMe-oF等存储平台与基础设施能力;同有科技则通过并行文件系统、GPU Direct Storage、NVMe-oF、RDMA和数据调度,打通算力集群、高速网络、分级存储、统一调度、数据治理全链路,以解决算力喂不饱、IO 瓶颈、高并发带宽压力、容量成本失衡四大问题,实现存算协同、弹性伸缩、全栈可观测、TCO优化。双方讨论中反复出现的关键词,并不是单一产品参数,而是“容量、性能与存算协同”如何在真实项目中落地。
开源模型到底利好谁?
中小企业如何避免掉队?
万亿参数模型开源之后,最先受益的往往是已经拥有数据、算力、存储和工程团队的头部云厂商。对于这类企业而言,模型只是基础能力的一部分。它们通常已经积累了海量数据,也具备训练、微调、部署和持续运营模型的条件。模型开源之后,它们能够更快完成适配,并将模型进一步转化为行业服务。
提前布局AI基础设施的厂商,也会从中受益。存储、网络、服务器、加速卡和数据中心设备,都在模型训练和推理过程中承担着实际功能。随着模型规模扩大,基础设施的价值不再只体现在设备参数上,而体现在能否支撑模型稳定运行。
但这并不意味着中小企业天然处于不利位置。王刚认为,开源模型带来的更多是风险和机遇并存,而不是简单的“头部受益、小公司受损”。
真正的问题在于,中小企业是否能够找到适合自己的进入方式。规模较小的企业没有必要复制头部厂商的基础设施投入,可以从具体业务场景入手,通过API、云资源或轻量化模型验证需求;拥有一定技术和数据基础的企业,则可以采用模块化、资源池化的方式逐步扩展。
对于处于中间规模的企业,可以先对现有的算力、存力和网络架构进行梳理,判断真正的瓶颈在哪里,再决定设备和容量如何增加。系统一开始不必拥有全部容量,但架构需要具备后续扩展能力。
这意味着,企业可以先建设一个规模较小、但层次完整的存储系统,随着训练数据、模型版本和推理请求增加,再逐步增加SSD资源池、高密度硬盘盘柜或其他存储模块。容量可以增长,架构则不必反复推倒重来。
正如同有科技和西部数据所共同强调的——AI不只是计算系统,更是数据系统。计算周期可以重复利用,而数据会持续累积。每一次模型训练、推理交互都会产生新的数据,这些数据可被存储、重新纳入训练并用于改进后续模型,使存储需求呈现持续性和累积性。因此,数据如何被存储、管理与长期保留,已成为决定AI能否实现可持续、经济高效规模化发展的关键因素。
这场围绕“万亿参数大模型时代:AI存储的容量、性能与存算协同新挑战”的讨论,最终指向的并不是某一种单一产品,而是一套需要持续演进的基础设施能力:容量要承载不断增长的数据,性能要保证模型训练与推理高效运行,存算协同则要让算力、网络、存储和数据调度真正形成合力。
当大模型加速进入更多行业,AI存储也将从幕后支撑走向基础能力本身。如何以更合理的成本构建存储底座,如何在高性能与大容量之间取得平衡,如何让数据在不同存储层级之间高效流动,仍将是企业落地AI时必须持续面对的问题。
关于万亿参数大模型时代的存储挑战,你所在的行业正在经历怎样的变化?欢迎在评论区留言,分享你的观察与实践,也欢迎就AI存储的容量、性能和存算协同问题继续交流。
文中提及的性能数据均基于特定测试环境,实际性能可能因主机设备、使用环境及其他因素而异。用于表示存储容量时,1TB = 1,000,000,000,000 字节,实际用户可用容量可能较少。
文:几重山月 / 数据猿
责编:凝视深空 / 数据猿
红包分享
钱包管理

