核心 要点

  1. 英伟达宣布 Groq 3 LPX 芯 片已进入全面量产,标志着这笔公司史上最大收购所获得的技术 正式实现商业化落地。
  2. 英伟达加紧 生产该芯片并交付客户,凸显低 延迟推理的重要性 —— 只有低延迟,AI 智能 体才能给用户反应灵敏的使用体验。
  3. 这家芯片厂商在去年 12 月斥资 200 亿美元收购了 G roq 的相关资产 。
2026 年 3 月 18 日,加州圣何塞英伟达 GTC 大会上展出的英伟达 Groq 3 LPU 芯片2026 年 3 月 18 日,加州圣何塞英伟达 GTC 大会上展出的英伟达 Groq 3 LPU 芯片

  英伟达周一宣布,Groq 3 LPX 机柜已经全面量 产,这 代表该公司史上最大一笔收购所获取的技术正式 走向商用。

  英伟达高级总监迪翁・哈里斯向媒体透露,Groq 机柜将与 Ve ra 中 央处理器、Rubin 图形处理器一 同部署在 Nebius(NBIS,新型云服务商)的数据中心 ,将于今年晚 些 时候正式上线。

  英伟达全力赶工生产 Groq 芯片、尽快交付客户,反映出低延迟推理的地位愈发关键。想要让 AI 智能体做到响应迅速、不给用户带来明显等待时延(尤 其是代码开发场景),低延迟推理必不可少。英伟达表示,云服务商可以为这类高速 Token 输出服务收取更高 费用。

  哈里斯在电话会议 中表示:“对于提供 Token 输出服务的厂商而言,该产品让他们可以面向对 延迟极度敏感的客 户,推出高端增值服务套餐。”

  去年 12 月,英伟达斥资 200 亿美元收购 Groq 资产,这是该公司有史以来规模最大的一笔收购。

  Groq 芯片架构在芯片裸片内置 500MB 高速静态随机存储器(SRAM),以此缓解内存带来的性能瓶颈。Groq 芯片由三星代工生产;而英伟达 GPU 则由(TSM)制造。

  英伟达在单台 LPX 机柜内集成 256 颗 Groq 3 芯片。引用 Artifi cial Analysis 的基准测试数据,Groq 3 LPX 机柜每秒可输出 3 400 个 Token。

  该赛道竞争激烈。规模相对较小的 GPU 厂商 今年早些时候宣布,会将自家机柜级系统与近期完成上市的 Cereb ras(CBRS)芯片结合,主打低延迟推理场景。OpenAI 新推出的 “极速模式(Ultraf ast)” 正是由 Cerebras 硬件提供算力,每秒输出 750 个 Tok en。

  低延迟芯片并不会取代 GPU。GPU 是 AI 领域的主力芯片,同时兼顾训练与推理任务,灵活性强,能够适配新技术与各类大模型。Groq 这类低延迟芯 片,主要专门负责模型服务流程里的解码阶段(decode phase)

  哈里斯称:“这并不是要取代 GPU。而是针对不同业务负载,选用最合适、性价比最优的处理器。”

  英伟达目前正在扩大 Vera Rubin 系统的出货量,该系统于今年启动生产。在今年 3 月的 GTC 大会主题演讲上,英伟达 CEO 黄仁勋预测,到 2027 年,当前一代 Blackwell 芯片加上全新 Vera Rubin 系统,累计订单规模将达到 1 万亿美元。

  黄仁勋当时表示,计划把面向代码开发业务的数据中心四分之一的机柜空 间分 配给 Groq 芯片。 “数据中心其余 全部机柜,100% 部署 Vera Rubin。” 黄仁勋说道。

  英 伟达将于本周三发布财报。