Signal YCurated AI News
更新于 8/20 09:5261 个信源

Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差

通用 AI8/4 14:3236氪查看原文 ↗
摘要

本文围绕Kimi K3与DeepSeek V4-Flash的对比,分析了原生多模态能力在Agent长链任务中的必要性、训练代价及行业路线选择。核心指出,视觉反馈能降低代码迭代误差,但原生多模态会争夺模型容量并增加算力开销,头部基模厂商在是否优先集成视觉上出现明显分化。

核心要点
  • Kimi K3总参数2.8万亿,支持100万token上下文,采用MoE架构,每个token激活约1040亿参数,以原生多模态和Coding能力为主要卖点。
  • K3发布后以1679分登顶Arena Frontend Code榜单,该榜单由用户盲选模型生成的可交互网页评分,考察页面最终效果而不仅是代码正确性。
  • K3在Puter测试中对照目标页与运行页截图,找出全部5处视觉偏差且无误报,验证了其视觉辅助代码迭代的能力。
  • DeepSeek V4-Flash正式版总参数2840亿,每个token激活130亿,专注于后训练优化,在多项Coding评测中超过K3等对手,未加入视觉输入。
  • 多位研究员指出,原生多模态训练中视觉数据会与文本、数学等任务争夺模型容量,可能短暂削弱语言能力,需要更精细的融合策略和更大算力。
原文佐证
  • “长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。”谈及原生多模态的意义,一位多模态研究员表示,“视觉是一种更准确的反馈,也更贴近用户意图。”
  • K3发布后曾以1679分登顶Arena Frontend Code榜单。该榜单由用户盲选模型生成的可交互网页进行排名,评判的不只是代码能否运行,也包括页面的最终效果。
  • 浏览器开发平台Puter曾在测试网页中制造5处视觉偏差,K3对照目标页与运行页截图,全部找出且没有误报。
AI 洞察
原生多模态的争议本质是时机与资源分配问题:在Coding能力仍快速增长的红利期,提前储备视觉能力可能牺牲短期效率,但长期看,视觉反馈是模型自主执行复杂任务的必要条件。K3与V4的分化预示着未来中国大模型赛道可能走向‘全栈模型’与‘极致文本模型’两条路线,而猎头在月之暗面附近的身影暗示人才争夺已提前押注多模态方向。