EMNLP 2026 Oral|HOMURA:面向时间受限场景的 LLM 翻译强化学习优化

发布时间:2026/10/11 8:24:07
EMNLP 2026 Oral|HOMURA:面向时间受限场景的 LLM 翻译强化学习优化
1. 概述大语言模型LLMs在多语言翻译领域取得了显著进展但普遍存在系统性的“跨语言冗长偏差”Verbosity Bias导致译文往往过于啰嗦难以满足字幕翻译、视频配音等对时间预算Time Budget有严格要求的场景。现有的提示工程等难以在语义忠实度与长度约束之间取得平衡。为此本研究首先提出了Sand-Glass基准测试专门用于评估音节级长度约束下的翻译表现。随后我们提出了HOMURA强化学习框架通过 KL 正则化目标函数结合创新的“动态音节比例奖励”显式优化语义保留与时间合规性之间的权衡。实验结果表明HOMURA 能够精准“驯服”输出长度在尊重不同语言密度差异的同时显著优于主流 LLM 基线模型实现了高质量、高合规性的时间受限翻译。当前HOMURA已经大规模应用于bilibili视频原声翻译场景中为实现高质量、高合规性的时间受限翻译提供了可行的技术路径。论文链接https://arxiv.org/pdf/2601.10187HOMURA 已被 EMNLP 2026 接收为 Oral口头报告HOMURA 的音节控制方法也应用于哔哩哔哩 Index LLM 团队推出的 Index-Translate 系列。该系列的文本翻译模型覆盖 150 种语言提供 2B、9B 和 35B-A3Bpreview三种规模支持术语、格式、风格与上下文指令并扩展出语音翻译模型 Index-Echo、音节控制模型 Index-Homura 和长文档翻译模型 Index-NativeLong。其中Index-Homura 根据指定音节数调整译文为字幕和配音等时间受限场景提供长度控制能力。在线 Demo https://index-translate.bilibili.com/GitHubhttps://github.com/bilibili/Index-TranslateHugging Facehttps://huggingface.co/collections/IndexTeam/index-translate免费 APIhttps://github.com/bilibili/Index-Translate#option-1-free-online-api-zero-gpu-setupIndex-Translate 技术报告https://arxiv.org/abs/2609.401812. 研究背景与挑战 (Background Challenges)随着大语言模型LLMs的飞速发展其在神经机器翻译NMT中表现出了卓越的语义准确性。然而这种语言能力伴随着一种系统性的**“跨语言冗长偏差”**。如上图所示论文提出的**回环膨胀率Roundtrip Expansion Ratio揭示了一个关键问题即使语义内容保持不变LLM 生成的译文往往比源话语显著更长。传统的评估指标往往忽略了这一点但这种“喋喋不休”的特性在时间受限Time-Constrained**的场景如字幕翻译、视频配音及同声传译中是致命的。在这些场景下译文长度构成了一个刚性的“时间预算”直接决定了输出内容能否与画面或原声同步。从信息论的角度来看时间预算充当了严格的“速率约束”。模型必须在有限的音节配额内通过词汇整合和句法重构将最大化的信息密度压缩进最短的长度中。然而现有的 LLM 很难自发实现这种平衡。这不仅是因为语言间的密度差异如德语、西班牙语天然比中文占空间更深层的原因在于 LLM 的对齐过程——现有的奖励模型往往存在“长度偏差”倾向于给更长、更详细的回答打高分。因此如何“驯服”模型的长度使其在不损失核心语义的前提下满足严苛的时间约束成为了多语言本地化领域亟待解决的建模挑战。本文核心贡献总结诊断分析系统量化了 LLM 翻译中的冗长偏差并提出了回环膨胀率等跨语言诊断指标。基准构建引入了 Sand-Glass 数据集通过音节级预算模拟真实的配音与字幕约束场景。方法创新提出了 HOMURA 强化学习框架有效平衡了严苛的长度约束与语义保留。3.基准测试与冗长偏差分析 (Pilot Study)为了量化时间受限场景下的翻译挑战本研究构建了Sand-Glass 基准测试并对大语言模型的冗长偏差进行了深入诊断。3.1 Sand-Glass 基准与音节度量Sand-Glass 是一个源自真实视频语料的翻译基准。不同于通用翻译数据集它引入了**音节Syllable**作为时间的代理指标。等信息量原则Iso-Information Principle科学研究表明虽然不同语言的音节速率SR差异巨大如西班牙语极快汉语较慢但全人类的信息传输速率恒定在约 39 bits/s。语言密度差异如下表所示汉语的信息密度0.94远高于西班牙语0.63。这意味着从汉语翻译到西班牙语时为了保持语义完整译文长度天然需要膨胀约 1.49 倍。3.2 诊断指标回环膨胀率传统的“正向膨胀率”无法区分译文变长是因为“语言本身的密度差异”还是因为“模型废话多”。为此论文提出了回环膨胀率Roundtrip Expansion Ratio1.将源文翻译为译文。2.将译文回译为源语言。3.计算膨胀率结论在理想状态下同语言对比的回环膨胀率应接近 1.0。但在 Sand-Glass 上的测试显示见下图主流模型的 $\rho_{rtp}$ 普遍大于 1。这证明了 LLM 存在系统性的、与语言种类无关的冗长倾向。上图展示了大模型翻译下的语言膨胀分布图3.3 校准目标区间为了打破这种偏差本研究对比了“理论膨胀率”与“LLM 实际膨胀率”发现 LLM 普遍存在 30%-40%的额外冗余Bias。基于此HOMURA 框架设定了严苛的目标音节区间Target Bounds英语 (En)设定为 [0.8, 0.9]强制模型进行摘要式精简。德语 (De)设定为 [0.9, 1.0]。西班牙语 (Es)将原本1.84倍的音节比大幅压低至 [1.0, 1.1]。这种设定强制模型通过改写Rewriting而非简单删减在极短的时间预算内实现信息的最大化对齐。4. HOMURA 框架设计 (Methodology)本研究将音节级控制建模为“可控文本生成”任务目标是在满足严格音节比例约束的同时最大化翻译质量。4.1 KL 正则化目标与 GRPO 优化为了实现精准控制HOMURA 采用了基于KL 正则化的强化学习目标。其核心思想是通过一个奖励函数 R(x,c,y) 鼓励模型满足长度约束同时最大化模型翻译的生成质量。优化算法采用GRPOGroup Relative Policy Optimization算法。该算法无需额外的 Critic 网络通过在同一组样本内进行归一化来计算优势Advantage极大降低了计算开销适合序列级别的奖励优化。4.2 奖励机制设计 (Reward Design)这是 HOMURA 能够精准“驯服”长度的关键。奖励函数由长度合规奖励和质量奖励两部分加权组成1. 动态音节比例奖励动态区间设定基于前述的语言密度分级设定基础目标区间 [L_0, R_0]。短句平滑处理针对短句子音节数少微小的长度变化会导致比例剧烈波动离散噪声。本研究引入了动态缩放因子对短句适度放宽下限。平滑奖励函数采用平方指数衰减函数而非简单的 0/1 判定为优化过程提供连续的梯度引导使模型逐渐向目标区间收敛。2. 质量奖励为了确保压缩长度不会导致语义丢失或语句破碎研究设计了两种质量评估路径基于准则的评估 (Rubric-based)语义忠实度利用回译Back-translation机制将生成的译文重新翻译回源语言通过计算其与原句的**嵌入向量相似度Embedding Similarity**来衡量语义保留程度。语言流利度使用大模型作为裁判针对语法、可读性和语言一致性进行打分。基于推理的评估 (Reason-based / GenRM)通过训练一个专门的生成式奖励模型GenRM使其能够产生思维链CoT推理。该模型会先在内部进行回译和语义对比再对流畅度做出判断最后给出一个具备可解释性的二进制奖励信号。这种“先推理、后打分”的方式显著提升了奖励的鲁棒性。5. 实验结果与分析 (Experimental Results)本研究在 Sand-Glass 基准测试上对 HOMURA 进行了全面评估并与 GPT-5、Claude-4.1 及 Gemini-pro-2.5 等主流模型进行了对比。5.1 长度合规性与质量的权衡实验结果表明HOMURA 在满足严苛时间预算方面表现出显著优势。精准的长度控制相比于仅依靠提示词的模型HOMURA 能够极高比例地将译文压缩在目标区间内。在英语、德语和西班牙语等多个语向中HOMURA 的超限率Over-length rate远低于基线模型。语义密度的提升论文引入了语义密度指标用于衡量单位音节内的语义价值。结果显示HOMURA 在压缩长度的同时保持了极高的语义保留率。这证明模型并非通过简单“删减”来缩短长度而是通过**语义巩固Semantic Consolidation**实现了更高的信息密度。5.2 强化学习过程中的行为分析通过对训练过程的监控我们观察到了模型策略的显著演变打破冗长先验beta参数的影响实验中一个重要的发现是当 KL 惩罚系数 beta 0 时模型往往会陷入“保守陷阱”不敢大幅度重构句子。而当 beta 0 时模型能够彻底摆脱基座模型的啰嗦倾向学会更激进且高效的表达方式。梯度范数与优化动量监控曲线显示HOMURA 在优化过程中保持了稳定的梯度更新能够有效地向“率失真Rate-Distortion”的前沿边界移动。5.3 “压缩墙”的发现(The Compression Wall)研究进一步探测了语义压缩的物理极限我们基于设计自动压缩寻找最低极限。实验发现对于语言对存在一个“有效压缩阈值”如中英翻译约为 0.49。一旦压缩要求低于这个阈值语义准确性会发生非线性崩塌。HOMURA 的优势在于它能够极其接近这一极限而依然保持译文的流利度。5.4 质量-压缩权衡分析(Quality-Compression Trade-off)为了深入探讨模型在不同长度限制下的表现本研究从“率失真Rate-Distortion”视角分析了翻译质量与输出长度之间的权衡关系。基线模型的局限性如图所示未经约束的基线模型通常聚集在“高质量、长文本”区域。虽然可以通过提示词迫使 LLM 缩短译文但其翻译质量会随着压缩率的增加而剧烈下降。这表明普通 LLM 在降低“音节速率”时效率较低难以在极短的预算内识别并保留核心语义信息。HOMURA 的高效权衡相比之下HOMURA 展示了显著更高的率失真效率。在相同的音节预算下HOMURA 的语义保真度显著优于基线或者说在保持相同质量水平的前提下HOMURA 能实现更短的译文长度。6. 结论 (Conclusion)本研究深入探讨并解决了大语言模型LLM翻译中普遍存在的系统性“跨语言冗长偏差”这一偏差是实现字幕翻译、视频配音等时间受限任务的主要障碍。基准构建本研究引入了Sand-Glass基准测试。该基准基于“等信息量原则Iso-Information Principle”利用音节预算模拟真实世界的时间约束为量化评价翻译的“时间可行性”提供了科学工具。方法突破提出了HOMURA强化学习框架。通过结合 KL 正则化目标函数与创新的“动态音节比例奖励”该框架在无需参考译文的情况下实现了极其严格的长度合规性并显著提升了单位长度内的信息密度。本研究不仅在工程上实现了精准的长度控制更在理论上界定了语义压缩的边界例如中英翻译中0.49的可行性阈值。未来的工作将进一步验证该压缩边界在更多语言对中的普适性并计划将 HOMURA 扩展至端到端语音翻译领域探索语义与时长联合优化的更多可能性。7. B站原声翻译效果展示该功能依托 HOMURA 对时长的精准把控生成了与原视频时间轴严格对齐的译文从根本上解决了机器配音中‘音画不同步’或‘语速异常’的行业痛点为用户带来了如同原生般的沉浸式视听体验。https://www.bilibili.com/video/BV111BeBPEaD/?spm_id_from333.337.search-card.all.clickvd_sourcee946351224816c78650f22c3d26579ad8. HOMURA 入选 EMNLP 2026 Oral 现场见如果你也会参加 EMNLP欢迎来听我们的oral、到poster现场交流一起聊聊翻译、强化学习和多语言内容生产。HOMURA 已被 EMNLP 2026 接收为 Oral口头报告。报告已安排在2026 年 10 月 27 日 09:00–10:30的 Machine Translation and Semantics session地点F9-10。我们也会参加Poster Session D10 月 26 日 11:00–12:30Hall H以及WMT poster session欢迎到现场交流。以上时间均为布达佩斯当地时间具体安排请以 EMNLP 官方日程https://2026.emnlp.org/program/和 WMT 官方日程https://www2.statmt.org/wmt26/program.html为准。现场还会发放精美谷子欢迎来交流技术与使用体验把喜欢的周边带回去。我们 EMNLP 见团队周边展示-End-作者丨Index LLM Team