IT之家 8 月 25 日消息,英伟达当地时间周一宣布,Groq 3 LPX 机架已进入全面量产阶段,这标志着该公司史上最大规模收购所获得的技术正式实现商业化。
英伟达高级总监迪翁 · 哈里斯(Dion Harris)告诉记者,Groq 机架将与 Vera 中央处理器和 Rubin 图形处理器一起部署在新型云服务商 Nebius 的平台,并将于今年晚些时候上线。
英伟达正在加速生产 Groq 芯片并向客户提供该产品,这凸显出低延迟推理的重要性日益提升。低延迟推理对于让人工智能智能体能够快速响应、避免用户遭遇长时间等待至关重要,尤其是在编程场景中。英伟达表示,云计算公司可以针对这类 Token 收取更高的费用。
哈里斯表示:“对于那些提供 Token 服务的人来说,这让他们能够为那些真正要求对延迟高度敏感的服务协议的用户和客户,提供高级服务等级。”
去年 12 月,英伟达以 200 亿美元(IT之家注:现汇率约合 1,347.74 亿元人民币)收购了芯片初创公司 Groq 的相关资产,这是该公司有史以来规模最大的一笔收购。
Groq 的架构在芯片裸片本身集成了 500MB 高速 SRAM,以减少与内存相关的瓶颈。Groq 芯片由三星制造,而英伟达的 GPU 则由台积电生产。
英伟达将 256 颗独立的 Groq 3 芯片封装到其 LPX 机架中。英伟达表示,根据 Artificial Analysis 的一项基准测试,其 Groq 3 LPX 机架能够达到每秒 3,400 个 Token 的处理速度。
这是一个竞争激烈的领域。今年早些时候,AMD 宣布,将把其机架级系统与 Cerebras 的芯片进行整合。Cerebras 最近上市,并将低延迟推理作为重点。OpenAI 新近宣布的“Ultrafast”模式目前承诺可达到每秒 750 个 Token,并由 Cerebras 提供支持。
低延迟芯片并不会取代 GPU,后者仍然是 AI 芯片领域的主力。GPU 既可以执行训练,也可以执行推理,同时具备足够的灵活性,能够适应新技术和新模型。Groq 这类低延迟芯片主要专注于模型服务过程中的一个环节,即所谓的“解码”(decode)阶段。
哈里斯表示:“这并不是要取代 GPU,而是要针对工作负载的不同部分,使用价格合适、处理能力合适的处理器。”
目前,英伟达正在逐步增加 Vera Rubin 系统的出货量,该系统已于今年早些时候开始生产。在 3 月份发布 Vera Rubin 和 Groq 3 LPX 时,英伟达首席执行官黄仁勋预计,到 2027 年,当前一代 Blackwell 芯片与全新 Vera Rubin 系统的累计销售额将达到 1 万亿美元(现汇率约合 6.74 万亿元人民币)。
黄仁勋当时表示,他计划将数据中心中用于编程应用的空间的四分之一分配给 Groq 芯片。黄仁勋说:“我的数据中心其余部分将全部采用 Vera Rubin。”
英伟达计划于当地时间周三公布财报。
广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家包含外链的文章均包含本声明。