返回开源社区
经验分享

黄仁勋出手了!RTX 5090 跑 Meta 30B 模型超过200 token/s

zZz4 分钟阅读1 次阅读

英伟达这次同时摆出了两组很容易让人心动的数字。RTX 5090运行Meta的300亿参数模型,速度超过每秒200个token;NeMo Switchyard模型路由库则在内部测试中把智能体任务成本压低约67%。它们都属于这轮AI更新,但衡量的是两件不同的事。

第一组成绩来自Meta开源的Muse Glimmer。这是一个300亿参数稠密模型,针对英伟达平台做过深度优化,在RTX 5090上的推理速度达到每秒超过200个token。

这个速度很亮眼,尤其容易让人产生一种印象,仿佛RTX 5090跑30B模型都能达到这个水平。真正需要记住的限定词却是Muse Glimmer和定向优化。现有成绩能说明这张卡运行该模型的速度上限很高,不能直接平移到其他30B模型,更不能把模型大小相近当成性能相近。

这个速度很亮眼,尤其容易让人产生一种印象,仿佛RTX 5090跑30B模型都能达到这个水平。真正需要记住的限定词却是Muse Glimmer和定向优化。现有成绩能说明这张卡运行该模型的速度上限很高,不能直接平移到其他30B模型,更不能把模型大小相近当成性能相近。

640  1
640 1

7月18日我们关注过另一项RTX 5090测试。玩家用llama.cpp运行DeepSeek V4 Flash,在百万token上下文配置下,预填充速度约为每秒650至700个token,生成速度约为每秒17个token。两次测试用了不同模型、配置和任务,连速度所处的阶段都不一样。放在一起看,最有用的结论恰恰是同一张卡换了模型和优化路径,数字可以差得很远。

至于约67%的降本,主角已经换成NeMo Switchyard。它会根据任务复杂度、成本和延迟,为智能体工作流的每一步动态选择模型。英伟达内部测试称,在保持前沿水平准确性的情况下,任务成本降至单独使用Opus 4.8的近三分之一,换算下来就是降低约67%。LangChain还报告称,在145个多轮Deep Agent任务中实现了74%的成本降低。

这组数据衡量的是模型路由带来的任务成本变化,比较基准是单独使用Opus 4.8。它没有被描述为RTX 5090单卡测试,也没有与Muse Glimmer的每秒200多个token组成一套软硬件基准。任务类型、候选模型和路由策略变了,最终降幅也会跟着变。

英伟达把两项更新放在同一轮发布里,意图倒是很清楚。一边用针对RTX优化的开源模型展示本地推理速度,另一边用模型路由减少智能体工作流的调用成本,再把RTX PC、DGX和Jetson纳入同一套AI生态。对硬件玩家来说,这套布局值得关注;对准备掏钱的人来说,两组数字仍然要分开算账。

当前价格记录中,NVIDIA GeForce RTX 5090 32G为30500元。这个价位能否成立,关键在于你的实际任务能不能吃到类似Muse Glimmer的定向优化,以及本地推理速度能不能持续转化成工作收益。若只是被67%的数字打动,这部分收益不能记到显卡回本账上,因为现有材料没有把它绑定到RTX 5090。

已有RTX 5090的用户,可以继续关注这些优化模型什么时候覆盖自己的任务。准备买卡的人,则应等目标模型、目标工作流在相近条件下给出成绩,再决定是否为这张32G旗舰卡付30500元。此次更新证明了RTX 5090在特定模型上的速度,也展示了模型路由的降本空间,还没有把两者合成一条足够完整的购买理由。

讨论与补充

0

还没有讨论

分享一条可复现的补充、问题或使用经验。

登录后参与回复一起补充步骤、结果和注意事项。