97AI.PRO
2026-08-27 · AI 资讯

腾讯混元翻译模型极低比特压缩技术助力B站直播

腾讯混元翻译模型极低比特压缩技术助力B站直播
腾讯混元翻译模型极低比特压缩技术助力B站直播

腾讯混元团队近期取得重大技术突破,成功将1.8B翻译模型压缩至440MB,并实现了近乎无损的翻译质量。该成果已成功落地哔哩哔哩(B站),在直播弹幕实时翻译业务中发挥了重要作用,实现了从实验室研究到高并发商业场景的落地。

为了在移动端和边缘设备上运行大模型,腾讯团队推出了两套量化方案。针对中高端设备,通过拉伸弹性量化(SEQ)及量化感知蒸馏(QAD)将模型压缩至574MB;针对更广泛的设备,则利用Sherry稀疏高效三值量化技术,将模型进一步压缩至440MB,该技术已被ACL2026会议收录为Oral。

此外,为了提升运行效率,英特尔团队对x86生态进行了深度优化,适配了向量化与VNNI指令,显著提升了模型在主流处理器上的推理速度。目前该模型在B站直播间的应用,使得单条弹幕翻译延迟控制在500-800毫秒内,且在保障隐私的同时降低了云端服务器的调用压力。