信阳新闻网欢迎您!

从黄仁勋的 AI Factory 到 WAIC 203 亿采购:企业 AI 的下一笔账该怎么算

2026-08-24 13:55:31 来源: 信阳新闻网
欢迎订阅《信阳手机报》移动用户发送短信 XYSJB10658300即可开通 3元/月 不收GPRS流量费

给 CXO与 AI 业务负责人的算力经营观察

摘要:企业采购GPU之后,如何在vGPU、整卡和整机集群之间分配资源?为什么GPU持续运行,业务仍感觉算力不足?睿思智联集中回答企业AI算力管理的六个关键问题。

导言

一家金融机构的 AI 项目进入规模化阶段后,问题很快从“模型能不能跑起来”,变成了“模型为什么还不够用”。

业务部门希望上线更多智能客服、投研助手、风控分析和内部知识问答;模型团队希望支持更长上下文、更高并发和更复杂的推理任务。基础设施团队回头一看:GPU 已经采购,服务器也上架,但新的大模型部署或者服务申请还是排不上。

作为一家专注企业级 AI 算力管理与调度的公司,睿思智联看到的,正是企业从模型试点走向规模化部署后的算力运营问题。睿思智联把这个矛盾概括为:算力建设的速度赶不上业务需求的速度,Token 的产生速度也赶不上应用需要 Token 的速度。

买卡只是第一笔账,怎么把卡变成稳定、低成本、可衡量的业务产能,才是企业 AI 的下一笔账。

一、AI Factory 不是机房,而是生产线

2026 年 3 月,在美国圣何塞举行的 NVIDIA GTC 2026 主题演讲中,黄仁勋再次系统阐述 AI Factory:AI 数据中心输入电力、数据和计算资源,输出 Token,衡量重点也从设备和峰值算力转向 Token 产出与成本。

这套逻辑放到国内还需要场景化的诠释。云厂商出售 Token,提供To C,To B的各种场景化工具,如创意写作、图片生成、AI视频制作等;金融、制造和央国企则要用 Token 完成客服、风险识别、文档审核、研发辅助和业务决策。

睿思智联认为,企业不能只看 Token 的生产速度。“性能一定是第一考虑的要素,但可靠性和质量其实也同样重要。”一个模型首字响应很快,但服务不稳定、结果质量不达标,就无法成为业务能力。

对企业来说,Token 的生产速度不是唯一指标,能够支撑业务的有效 Token,才是 AI Factory 的真正产出。

图 1|AI Factory 的企业语境:从资源到有效 Token

设备不是终点,企业真正要经营的是“资源 → Token → 业务结果”的连续链路

二、WAIC 的超节点热,说明企业自建产能走向深水区

今年 WAIC 上,超节点并不是一种统一规格:华为昇腾 950 由 16 个计算柜、1024 颗芯片组成;曙光 8000 以单机柜 640 卡的超节点组网;沐曦曦景 S600 则以单柜 64 卡为基础单元。大会还发布 212 项采购需求,预计意向采购约 203.6 亿元。从 64 卡到 1024 卡,企业面对的问题不是“越大越好”,而是多大规模适合自己的负载。

有国产芯片厂商CTO在接受南方都市报采访时表示,对客户而言,规模继续增加后,实时监控每张卡、定位和恢复通信链路故障,以及软硬件协同都会更复杂,超节点是GPU厂商给出的解决方案之一。

睿思智联表示他们正在和华为昇腾 950等多个厂家的超节点做适配,超节点是企业核心算力的支撑,但不会是唯一,不同参数量模型适合采用不同规格的GPU服务器,如何形成有效的高低搭配,如何发挥各自强项是方案建设时就需要考虑的。

超节点让企业更容易把算力买回来,但不能替企业把算力运营起来。

三、证券客户的关键问题:H100 之后,算力中心拿什么建?

睿思智联提到,他们服务过一家证券客户,客户早期采购了英伟达 H100 服务器,但业务扩展后,“现有算力的模型 Token 输出量已经不能支撑业务的要求了”。各部门持续向 IT 申请模型、Token 和更多服务,导致IT部门需要购买更多算力资源。然而,这已不只是一次 IT 采购:新增投入能产出多少有效 Token,又能为业务增长提供多大支撑,是否通过采购SaaS的Token服务来代替自建算力中心,需要从公司经营层面判断。

问题最后被提交到董事会。管理层判断,AI 已经成为金融业务竞争的一部分;如果算力供给跟不上,影响的不只是 IT 项目进度,更是商业竞争力。董事会因此批准建设新的私有算力中心。

是否自建算力,不能只按企业规模判断。睿思智联总结了三个条件:数据安全是否构成红线;长期使用时,自建推理是否比购买外部 Token 更划算;通用模型是否能满足行业化和个性化需求。

自建算力并非与公有云二选一。核心业务、敏感数据和稳定负载可更多留在本地,弹性峰值和低敏感任务仍可使用外部服务。

客户没有简单“继续堆Nvidia卡”,而是评估国产算力,并选择两家 GPU 厂商服务不同负载:有的首 Token 响应更快,有的更适合长上下文和大文件分析。证券时报在 WAIC 报道中也提到,已有国内知名芯片公司分别针对处理输入的 Prefill、持续生成的 Decode 等推理负载规划专用芯片。两者说明的是同一件事:企业需要的不是参数表上最强的卡,而是让不同任务匹配更合适的算力。

目前,该证券客户基于国产算力搭建的算力平台,不仅支撑内部 AI 场景的研发和生产应用,应用小程序内嵌Token 服务,让 AI 能力直接参与业务处理。白天业务高峰期,平台 GPU 长时间保持高负载,部分非核心非生产请求会被动态分流至外部 Token SaaS 服务,为业务让路;夜间需求回落后,全部任务再切回自有平台,充分利用内部算力。通过统一管理内外部 Token 服务,平台可以根据需求变化灵活调配资源,在保障业务响应的同时提高自有算力的利用率。

这正是企业开始“重新对账”的原因:基础设施团队看卡数、卡时、显存和利用率;业务团队看 Token、响应速度和模型效果;管理层看成本、效率和风险变化。三套指标如果不能打通,IT 看到设备在运行,业务感受到的仍是服务不够用。

图 2|企业 AI 要算清的三本账

卡数是资源单位,Token 是生产单位,业务结果才是价值单位

建算力中心的意义,不仅仅是再买一批卡,而是让算力真正跟上业务需求的同时,兼顾ROI和长期发展路线。

四、从设备采购到算力经营

当企业同时拥有英伟达 GPU、国产 GPU、超节点、不同架构服务器和外部 Token 服务时,新的问题产生了:谁来统一管理这套异构资源?

客户往往自己说得也很直接:“不能是 A 系统管 A 厂商,B 系统管 B 厂商。”否则,业务申请资源要在多个平台之间手工配置,管理层也无法从全局判断哪些资源真正支撑了业务。

这也是睿思智联切入企业 AI Infra 的价值所在:通过异构算力统一纳管、GPU 资源切分与调度、通用GPU服务器和超节点,推理服务治理,以及内部算力和外部 Token 的统一计量,帮助企业把分散硬件组织成可调度、可监控、可核算的算力池。

比如在上面的证券客户场景中,核心业务优先使用自建算力,非核心或低敏感任务按策略接入外部 Token;按人员、应用和时间段配置权限,每次调用可追踪、可审计。睿思解决的不是“再增加几张卡”,而是帮助客户把 GPU、模型、Token 服务和合规要求放进同一套运营规则。

图 4|混合算力运营闭环

闭环的关键不是接入更多算力,而是让算力适配业务负载:小任务按需使用 vGPU,稳定负载分配整卡,复杂任务再调度整机集群,并用计量与反馈持续优化

统一运营才能把算力变成企业产能。

五、203 亿之后,企业真正要买的是运营能力

WAIC 现场从 64 卡到 1024 卡的超节点,以及按 Prefill、Decode 分工的芯片路线,已经说明未来不会有一张卡、一个模型或一种集群适合所有业务。

对企业 CXO 来说,所谓开放性不是“多兼容几个品牌”,而是下一种 GPU、下一个模型进入机房时,不必重新建设一座孤岛。平台要能根据任务变化,重新分配 vGPU、整卡、整机集群和外部 Token 服务,并持续比较成本、质量与稳定性。

上文中证券客户的例子给出了一条具体路径:先看业务需要,再把任务分给不同国产 GPU、自建算力或外部 Token 服务;用统一平台管理权限、路由、成本和审计。新增设备不再形成孤岛,已有算力也能继续释放产能。

6 月 1 日,黄仁勋在台北举行的 GTC主题演讲中把这件事说得更直白:客户不是仅仅想买GPU算力,而是要建设 AI Factory。

对企业而言,答案也不是继续堆设备,而是让小任务不占整卡、复杂任务能调动集群,并把每次模型服务的成本、质量和业务结果算清;这样买回来的才不是一批 GPU,而是一条真正跑得起来的 AI 生产线。

文章投诉热线:156 0057 2229 文章投诉邮箱:291 3236@qq.com

标签:

  • 报晓风
  • 信阳日报微信信阳日报微信
  • 掌上信阳微信
  • 信阳日报新浪微博
  • 信阳日报腾讯微博

请您文明上网、理性发言,并遵守相关规定。网友评论

验证码:

网友评论仅供其表达个人看法,并不表明信阳新闻网立场。

评论列表
还没有评论,快来抢沙发吧!
回到顶部

工信部备案:豫ICP备09044067号

河南省互联网新闻信息服务许可证 编号:01201517001

信息网络传播视听节目许可证 编号:1910522

豫公网安备:41159002000089号

河南省违法和不良信息举报中心

违法和不良信息举报受理和处置管理办法