Signal YCurated AI News
更新于 8/20 09:5261 个信源

NVIDIA Nemotron 3.5 Lightning 现已在 Amazon SageMaker JumpStart 中提供

通用 AI8/18 02:06AWS 机器学习博客查看原文 ↗
摘要

NVIDIA 发布开源模型 Nemotron 3.5 Lightning,专为高频智能体工作负载设计,现可通过 Amazon SageMaker JumpStart 一键部署。

核心要点
  • Nemotron 3.5 Lightning 采用混合专家(MoE)架构,总参数 30B,每个前向过程仅激活 3B,可在单张 GPU 上运行。
  • 上下文窗口达 1M token,支持多轮智能体会话携带长期状态,并集成 DFlash 投机解码以降低每 token 延迟。
  • 相比同类模型,官方称吞吐量最高提升 4 倍,高频智能体任务完成速度提升 30%。
  • 该模型从 NVIDIA 前沿模型 Nemotron 3 Ultra 蒸馏而来,基于开放数据集训练,以开放模型形式发布。
  • 在基准测试中,BF16 与 NVFP4 变体在 MMLU Pro 上分别得到 81.94 和 81.62,在 GPQA Diamond 上为 75.44 和 75.57。
原文佐证
  • NVIDIA describes Lightning as the fastest open model in its class for powering always-on agents.
  • It delivers up to 4x higher throughput and up to 30% faster task completion on high-volume agentic workloads.
  • At 30B total parameters with only 3B active, it can run on a single supported GPU.
AI 洞察
Nemotron 3.5 Lightning 的出现表明,智能体工作负载正在向“系统化模型路由”演进:高频简单步骤由小模型处理,复杂推理才调用前沿模型,从而显著降低推理成本。NVIDIA 通过将小激活参数模型与云平台集成,既巩固了其在推理生态中的地位,也可能加速开源模型在金融、安全等对延迟和成本敏感行业的落地。未来,模型的选择将更依赖负载特征而非单一基准分数。