新发布 LanguageAI Voice — 实时多语言语音翻译现已上线 LanguageAI API 现已支持更多语言 → 观看网络研讨会:AI 翻译的未来 → 新发布 LanguageAI Voice — 实时多语言语音翻译现已上线 LanguageAI API 现已支持更多语言 → 观看网络研讨会:AI 翻译的未来 →

DeepL 下一代语言模型的技术突破

2025年9月30日 · DeepL Engineering Team

← 返回博客首页

大规模深度学习模型的训练和部署始终面临两道无法忽视的门槛:训练阶段天文数字般的计算成本,以及推理阶段对响应延迟的严苛要求。在翻译这样的实时交互场景中,每增加10毫秒的延迟都会直接影响用户体验。DeepL工程团队最近分享了利用FP8(8位浮点)精度训练下一代大语言模型的关键经验,这可能是翻译AI领域近年最值得关注的基础设施突破之一。

FP8如何破局:从FP16到更精益的数值精度

传统深度学习训练普遍使用FP16(16位浮点)甚至BF16精度。FP8将每个参数的数值位宽减半,带来的改变是连锁性的:GPU显存占用直接砍半,意味着同样一块H100可以在内存中容纳两倍大的模型或者两倍大的批次;训练吞吐量实测提升约40%,原本需要训练一周的模型现在不到五天即可收敛;推理延迟降低超过30%,对于需要毫秒级响应的实时翻译API调用,这是从一个数量级到另一个数量级的跨越。

混合精度训练:不止于"降低精度"

精度的降低并非没有代价。直接将所有层从FP16切换到FP8,数值稳定性会急剧恶化,导致训练发散。DeepL团队的解法是混合精度策略:对梯度传播影响最大的注意力机制层和LayerNorm层保留FP16精度,确保关键路径的计算不受精度损失影响;权重矩阵乘法和前馈网络等计算密集型层则完全使用FP8加速。配合NVIDIA H100 GPU内置的Transformer Engine——它能在FP8和FP16之间进行硬件级的即时格式转换——这套混合方案实现了训练速度与模型质量的双重最优。

推理端的质变:低延迟打开新场景

如果说训练端的收益主要在成本优化上,那么推理端的提升则直接关系到产品形态的可能性。FP8推理将单次翻译的端到端延迟从约50毫秒压缩到30毫秒左右——翻译质量保持不变。30毫秒是什么概念?实时语音对话中,这个级别的延迟已经低于人耳感知的"卡顿"阈值。这意味着实时语音翻译、同声传译、视频会议即时字幕等低延迟场景不再是遥不可及的远景,而是可以提上产品路线图的能力。

下一步:FP4和稀疏化

FP8不是终点。DeepL工程团队已经在探索FP4精度训练——将数值位宽进一步压缩到4位,以及模型稀疏化技术——将冗余的神经元连接剪枝掉但保持推理精度。这些技术的组合目标是:在FP8的基础上,将翻译成本再降低50%。如果这个目标达成,大规模多语言实时翻译将变得像发送短信一样便宜、一样快速、一样普及。

语言的本质是连接。而技术在做的就是不断降低连接的物理成本——从纸质书信到电报,从越洋电话到即时通讯。FP8和后续的低精度技术正在把"打破语言障碍"的成本曲线继续往下拽,直到它逼近零点。

想体验最快的 AI 翻译技术吗?

立即试用 DeepL,感受下一代语言模型带来的翻译速度与质量