当前位置：首页 » 资讯 » 新零售 » 正文

英伟达Blackwell GPU突破AI算力瓶颈，实现 1000 TPS/User里程碑

IP属地中国·北京 编辑：柳晴雪 IT之家 时间：2025-05-24 13:01:46

5 月 24 日消息，当地时间周四，英伟达宣布其 Blackwell GPU 在 4000 亿参数的 meta Llama 4 Maverick 模型上成功打破了 LLM 推理速度世界纪录。
据介绍，AI 基准测试机构 Artificial Analysis 通过配置 8 块 Blackwell GPU 的 DGX B200 节点，首次实现每用户每秒生成 1000 个 token（TPS）的性能里程碑。
英伟达表示，技术团队通过 TensorRT-LLM 软件栈实施深度优化，并采用 EAGLE-3 技术训练推测解码草稿模型，使其性能较优化前基准提升 4 倍。整套服务器系统在峰值吞吐配置下可达每秒 72,000 token。
英伟达解释称：“推测解码是通过小型快速草稿模型预测 token 序列，再由大型目标 LLM 并行验证的加速技术。其优势在于单次迭代可能生成多个 token，代价是额外的草稿模型计算开销。”
为实现该突破，工程师团队采用基于 EAGLE3 的软件架构。该架构专为大型语言模型推理加速设计，与 GPU 硬件架构形成协同效应。注意到，测试结果显示 Blackwell 架构已完全适配 Llama 4 Maverick 级别的超大规模语言模型。
英伟达还表示，他们在保持响应准确性的同时大幅提高了性能。在许多指标上，使用 FP8 数据格式的准确性与人工分析 BF16 相当。
参考资料：

免责声明：本网信息来自于互联网，目的在于传递更多信息，并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益，请及时联系我们，本站将会在24小时内处理完毕。

同类资讯

放弃吧！“高速全面取消收费”根本没戏，免费只会更痛苦

八部门：进一步加大力度促进汽车消费促进汽车梯次消费、更新消费

新车难用满十年：技术短板、消费文化与行业策略如何共同“缩短”寿命

山东青岛：“微醺巴士”开拓文旅消费新场景

牛市就到这了？

拉布布暑期降温，中国潮玩出海弯道超车，谁是下一个顶流IP

全站最新

当 ChatGPT 要开始「搞黄色」，我都不敢想......

打造区块链应用蓬勃生态，上海启动“申城·数聚行”系列活动

本周外盘看点丨美国CPI姗姗来迟，特斯拉、奈飞发布财报

国家奖技术守护14亿人笑容！这款牙膏让牙齿自己“长”回来？

热门推荐

放弃吧！“高速全面取消收费”根本没戏，免费只会更痛苦

八部门：进一步加大力度促进汽车消费促进汽车梯次消费、更新消费

新车难用满十年：技术短板、消费文化与行业策略如何共同“缩短”寿命

山东青岛：“微醺巴士”开拓文旅消费新场景

牛市就到这了？

拉布布暑期降温，中国潮玩出海弯道超车，谁是下一个顶流IP

南城香创始人汪国玉：平台消费券激发消费热情，门店收入利润均提升

通信企业：“推销热售后冷”消磨用户信任

盛银消金 25% 股权再被冻结！新董事长年初刚上任

伊利出席第八届中澳工商界首席执行官圆桌会助力中澳经贸合作提速升级

商查平台企业信息查询新范式：水滴信用企业查询MCP

从“闪购”到“观望”：Prime Day被拉长的背后，是消费者与平台的“双重博弈”

澎湃漫评｜通信企业为何“推销热售后冷”

“电商西进”助力豫企破浪：一枚鱼油的3000公里“暖心”之旅

京东外卖取消超时免单，改为“准时宝”服务