信阳新闻网欢迎您!

芯展速产品VP许玮WAIC世博馆演讲,深度解读 AI90软硬一体化推理加速方案

2026-07-20 14:17:22 来源:信阳新闻网
欢迎订阅《信阳手机报》移动用户发送短信 XYSJB10658300即可开通 3元/月 不收GPRS流量费


芯展速产品VP - 许玮于2026 WAIC 发表重要内容

7月18日,2026世界人工智能大会(WAIC)世博中心,芯展速产品副总裁许玮发表主题演讲,正式发布 AI90 ——FaaS (Flash as a Service) for AI 架构,引发全场高度关注。


「显存墙」已成为制约AI推理效率与成本的关键瓶颈

芯展速产品VP-许玮 于 WAIC 2026 发表重要内容

许玮指出:近二十年 GPU 算力提升约60,000倍,而显存容量仅增长16倍,算存严重失衡导致 GPU 有效算力利用率仅30%-60%

更严峻的是,随着大模型从短上下文向长上下文、多轮对话演进,KV Cache 急剧膨胀。「显存墙」 已成为制约 AI 推理效率与成本的关键瓶颈


AI90 以「存算协同」重构推理路径

许玮详解了AI90 解决方案的破局逻辑:通过将 KV Cache 从 HBM 卸载至高性能 SSD,构建 HBM + DRAM + SSD 三级存储体系。智能 P2P 互联技术优化了GPU间数据通路,跨卡数据传输时无须 CPU 和主机内存搬运,实现 GPU 间高效直连

支撑该架构的 PT200Z AI SSD 采用 PCIe Gen5 与 pSLC 介质,DWPD 最高达100,专为 KV Cache 高频写入场景优化。


50倍性能跃升用消费级显卡跑大模型

许玮公布现场演示数据:

• Llama 3 70B模型推理,4卡5090集群吞吐量从120 tk/s跃升至610 tk/s提升5.1倍

• 64K上下文首 Token 延迟从27.99秒降至0.564秒,提升近50倍

• 显存利用率从30%-40%提升至85%-95%提升2-3倍

• AI90 支持上下文从约 8K 扩展至 128K+,且输入序列越长加速效果越明显。


从「算力独大」到「存算协同

芯展速产品VP-许玮 接受现场媒体深度访谈

许玮表示,AI 推理正从以算力为中心」进入「效能为核心」的新阶段。推理成本的优化已从单纯堆叠算力,转向数据和存储存算协同的系统级效率提升。

芯展速 AI90 的本质,是通过重构存储路径,将存储变为算力的放大器」——这不仅是技术选择,更是 AI 基础设施走向普惠的必然路径。

芯展速产品VP-许玮 接受媒体专访

会后,钛媒体、DOIT 等科技媒体就 AI90 的部署场景、兼容性及落地路径对许玮芯展速团队进行了深度专访。

专访全文于芯展速公众号发布,敬请关注。


|关于芯展速

芯展速(GENSTORAIGE)致力于为智能世界构建数据基座,是国内唯一同时提供企业级SSD、PCIe Retimer/Redriver连接芯片及AI训推一体方案的“存-连-管”全栈厂商。公司成立于2023年,核心团队拥有20余年存储与服务器行业深厚积淀,已快速切入多家头部互联网及OEM厂商供应链。2026年WAIC,芯展速首发AI90——FaaS for AI架构,以创新性的“存算协同”方案,让消费级GPU释放大模型潜能,推动AI算力走向普惠。

文章投诉热线:156 0057 2229 文章投诉邮箱:291 3236@qq.com

标签:

  • 报晓风
  • 信阳日报微信信阳日报微信
  • 掌上信阳微信
  • 信阳日报新浪微博
  • 信阳日报腾讯微博

请您文明上网、理性发言,并遵守相关规定。网友评论

验证码:

网友评论仅供其表达个人看法,并不表明信阳新闻网立场。

评论列表
还没有评论,快来抢沙发吧!
回到顶部

工信部备案:豫ICP备09044067号

河南省互联网新闻信息服务许可证 编号:01201517001

信息网络传播视听节目许可证 编号:1910522

豫公网安备:41159002000089号

河南省违法和不良信息举报中心

违法和不良信息举报受理和处置管理办法