

英伟达于8月11日发布名为Nemotron 3.5 Lightning的300亿参数开源模型,强调其在同等规模下运行速度提升四倍,并将智能体任务执行成本压缩至Anthropic Opus 4.8的三分之一左右。尽管部分性能指标已获得外部机构初步验证,其余核心主张仍依赖英伟达自身测试,缺乏独立可复现证据。
该模型的推广方式与7月发布的Nemotron 3 Ultra如出一辙——均通过联合第三方机构进行成本与效率宣传,当时宣称可实现74%的资源节约。然而,在无外部独立审计的情况下,企业难以判断其真实效益,只能依赖供应商提供的基准数据作为决策依据。
独立测试平台Artificial Analysis对Nemotron 3.5 Lightning进行了非依赖性评估:其智能指数得分为24,较前代模型提升9分;在深度推理任务中表现接近四倍规模的OpenAI gpt-oss-120b。同时,基于DeepInfra预发布接口的测速显示,中位输出速率接近每秒670个token,显著优于同类模型的平均水平。
Ramp Labs将英伟达新推出的NeMo Switchyard路由系统集成至内部编程基准Ramp SWE-Bench,发现使用该工具的智能体可在保持性能不变的前提下降低运行开销。尽管其官方博文未披露具体削减比例,但英伟达博客称实现了58%的成本下降和33%的延迟减少——该数据尚未获得Ramp自身的公开证实。
英伟达博客列出五家合作方反馈:Boomi报告100%路由准确率并转移59%流量至声称快五倍的微调模型;Classmethod称节省27%成本;LangChain实现74%成本优化但准确率下降6%;CodeRabbit与Harvey分别针对代码审查及法律场景定制模型。截至目前,上述机构均未发布与其声称数据一致的独立报告,其中Harvey仅确认曾参与早期模型训练,未涉及本次发布的Lightning版本。
合作方 | 英伟达主张 | 是否获独立验证 | Artifical Analysis | 智能指数24,约670 tok/s | 已确认 | Ramp Labs | 58%成本削减,33%运行时间缩短 | 方向被认可,但数值未由自身公布 | Boomi | 100%路由准确率,59%流量转移 | 未见公开回应 | Classmethod | 27%成本削减 | 未发布 | LangChain | 74%成本削减,6%准确率折损 | 未针对Lightning发表 | CodeRabbit | 定制化代码审查模型 | 未披露 | Harvey | 专精法律任务模型 | 确认早期模型,非Lightning | Lila Sciences | 提升科学推理能力 | 为英伟达投资方,但未在发布稿中说明关系
Lila Sciences在英伟达发布中被提及增强Nemotron 3.5 Lightning在科学推理任务中的表现。根据其自身公告,该公司已完成3.5亿美元A轮融资,其中部分资金来自英伟达旗下风险投资部门NVentures。然而,英伟达的官方文案并未披露这一股权关联,可能影响其评价的客观性。
随模型一同发布的卡片显示,其基准测试结果由英伟达在统一框架下完成,且可能与其他厂商自报数据存在差异。该文档进一步揭示其架构融合Mamba-2、混合专家(MoE)与注意力机制,比社交媒体描述更为精确。此外,文档指出部分合成训练数据源自OpenAI等平台,包含政治与民族主义倾向,已被过滤;在人口统计相关子集上,训练语料偏向男性与白人编码者指代。
值得注意的是,英伟达此前因隐瞒加密货币矿机销售信息而卷入联邦集体诉讼,该案已进入庭审阶段。虽然此事件与本次发布无关,但凸显其信息披露模式一贯存在透明度争议。
若未来能开展全面第三方横向对比,或有合作方正式发布与英伟达所提数字相符的实证报告,特别是当NeMo Switchyard在生产环境中稳定运行并达到预期效果时,才能真正支撑其性能主张。
声明:文章不代表币圈网立场和观点,不构成本站任何投资建议。内容仅供参考!
免责声明:本站所有内容仅供用户学习和研究,不构成任何投资建议.不对任何信息而导致的任何损失负责.谨慎使用相关数据和内容,并自行承担所带来的一切风险.