这些初创公司正在追逐LLM的下一个重大突破
摘要
本文指出,Transformer虽统治LLM领域九年,但稠密注意力机制带来的计算成本与上下文窗口限制日益凸显,一批初创公司正尝试用新架构取代它。
核心要点
- Transformer架构源自2017年论文“Attention Is All You Need”,现为所有主流大语言模型的核心引擎。
- 稠密注意力要求每个token与所有其他token进行乘法比较,计算量随文本长度近似平方增长。
- 处理一篇1万词的文档,Transformer可能需要执行5000万次乘法运算。
- OpenAI总裁Greg Brockman称,公司今年将在计算上投入500亿美元;国际能源署预测数据中心耗电量到2030年将翻倍。
- 近期推理模型和超长上下文等进展被视为对Transformer缺陷的权宜性修补,而非自然延伸。
原文佐证
- “The entire AI industry is built on transformers,” says Justin Dangel, cofounder and CEO of the AI startup Subquadratic.
- A document 10,000 words long might require a transformer to perform 50 million multiplications.
AI 洞察
Transformer的算力瓶颈正在催生新的架构竞赛。若初创公司能够突破稠密注意力的限制,可能从根本上降低大模型的训练与推理成本,使AI能力从少数巨头下沉到更多参与者;同时,现有巨头在Transformer上的海量投资也可能形成路径依赖,成为转型中的掣肘。