Index-Translate:译出意思,也听懂要求
翻译人物对白时,我们关心角色说话的方式;翻译面向读者的说明时,我们关心语气与格式;遇到网络热梗时,还需要理解字面之外的语境。同一句话,可能需要不止一种合适的译法。
Index-Translate 将多语言翻译、指令控制与热梗理解结合起来。 除了原文和目标语言,你可以同时指定表达要求,例如保留人物之间的称谓、采用更口语化的语气,或只输出译文。模型据此完成翻译,让译文适合接下来的使用场景。
对于带有调侃、反话或文化背景的内容,翻译还需要理解它为何这样说。我们把社交与文化语境纳入评测,也单独考察翻译指令遵循,分别检查译文的质量与要求是否得到执行。
Index-Translate 以 Qwen 3.5 2B/9B/35A3B base 为底座,经过三个阶段训练:
Mid-train:这一阶段我们采用标准的 WSD scheduler,混合了基础预训练回放语料,多语种语料,平行语料和中转语料,探索了多种数据配比,平行度和平行组织方式,并在退火阶段特别提高了中转语料的比例,让模型学习不同语言的表达方式与跨语言语义对应,为后续翻译任务训练打下基础。
Post-train:在 mid-train 建立多语言基础之上,我们分别训练了通用翻译模型,指令遵循翻译模型和梗翻译模型三个专家模型,分别进行了 SFT 和 RaR RL(Rubric as Reward)或 RLVR。
Model-merge:我们结合线性插值/MOPD/Mix-RL,将多版本能力整合到统一模型。
后训练评测主表:六项核心指标对比
主表汇总后训练评测中的 Index-Translate-9B/2B 与对比模型。涵盖通用翻译(FLORES-200、WMT24++)、翻译指令遵循(instTrans、IFMTBench)、六项垂类翻译均值与文化表达(MEME 梗翻译)。Index-Translate-9B 在 instTrans(0.8949)与 MEME(0.7331)两项均位列全场第一,通用翻译超越同尺寸模型;2B 亦在各维度大幅领先对标模型。
| 模型 | FLORES-200 COMET-22 ↑ |
WMT24++ COMET-22 ↑ |
instTrans IFscore ↑ |
IFMTBench IFscore ↑ |
垂类均值 COMET-22 ↑ |
梗翻译 MEME ↑ |
|---|---|---|---|---|---|---|
| Index-Translate 主力模型 | ||||||
| Index-Translate-9B | 0.8781 | 0.8597 | 0.8949 | 0.8524 | 0.8325 | 0.7331 |
| Index-Translate-2B | 0.8649 | 0.8485 | 0.8359 | 0.7241 | 0.8261 | 0.6429 |
| 对比模型 | ||||||
| Hy-MT2-1.8B | 0.8522 | 0.8401 | 0.5613 | 0.6887 | 0.8165 | 0.3643 |
| Hy-MT2-7B | 0.8747 | 0.8593 | 0.6928 | 0.8483 | 0.8205 | 0.5139 |
| Hy-MT2-30B-A3B | 0.8787 | 0.8624 | 0.7177 | 0.8726 | 0.8338 | 0.5812 |
| translategemma-12b-it | 0.8732 | 0.8524 | 0.3664 | 0.2675 | 0.8237 | 0.4281 |
| CohereLabs/North-Small-Translate-1.0 (218A25B) | 0.8784 | 0.8578 | 0.6035 | 0.8383 | 0.8243 | 0.6836 |
| gpt-5.6-sol | 0.8650 | 0.8469 | 0.8231 | 0.9026 | 0.8171 | 0.7194 |
| gemini-3.5-flash-lite | 0.8750 | 0.8497 | 0.7810 | 0.8684 | 0.8066 | 0.7034 |
垂类均值为 OpenSubtitles、OPUS-Books、WMT Biomedical、MTNT、MuST-Cinema 与 GuoFeng-Webnovel 六项成绩的等权平均。MEME 考察网络热梗与社交文化语境理解。加粗表示各列最高分。↑ 越高越好。
把能力放进真实的翻译里
从小语种到具体指令,再到网络热梗。下面三条案例展示原文、翻译要求与模型保存的真实输出。
把中文故事,带到波兰语里
以中文到波兰语的小说片段为例,看看模型怎样在翻译叙述的同时,按照给定说明处理人物指代。
译为波兰语;原文中的“等她”按上下文指向男性角色邹衍;只输出译文。
邹衍站在原地说不出的委屈,他本以为两女在门口等她,怎么也会决个胜负,留下一个陪他。
让他也炫耀虚荣一般,难道我就这么命苦吗?
对不起了,昨天电源踢掉了,稿子都没了,尽力补。Zou Yan stał w miejscu, czując niewypowiedzianą krzywdę. Myślał, że obie kobiety będą na niego czekać przy drzwiach i że w końcu rozstrzygną między sobą, która zostanie z nim.
Chciałby chociaż trochę pochwalić się swoją dumą. Czy naprawdę mam tak pechowe życie?
Przepraszam, wczoraj padło zasilanie i straciłem cały manuskrypt. Postaram się to nadrobić.对照看:译文中的“na niego”和“z nim”对应“等他”和“陪他”。这条案例的输入明确给出了指代说明。
查看完整输入与案例来源
请将以下中文小说翻译成波兰语,并且严格遵循所有约束要求。 【源文】 邹衍站在原地说不出的委屈,他本以为两女在门口等她,怎么也会决个胜负,留下一个陪他。 让他也炫耀虚荣一般,难道我就这么命苦吗? 对不起了,昨天电源踢掉了,稿子都没了,尽力补。 【约束要求】 1. 【注意】指代一致性——源文第一句'他本以为两女在门口等她'中的'她'容易误指为两女中的一位,实际应为'他'(指邹衍自己),可能为笔误。翻译成波兰语时需注意代词性别一致,避免歧义。 只输出译文,不要有任何额外说明。
案例记录:trans-004 · 模型:qwen35_9b_linear_3model_0.8_0.1_0.1。原文与译文沿用仓库记录,未做润色。
翻译内容,也遵守格式与术语要求
同一段内容同时带有三类要求:保留 HTML 标签、使用指定术语,并采用日常口语表达。把原文与译文放在一起,逐项检查。
译为韩文并保留 HTML 标签;电池健康 → 배터리 컨디션,充电宝 → 휴대용 밥통,数据线 → 생명줄;使用日常口语,只输出译文。
<div class="chat-msg">天呐,这<span class="bad">充电宝</span>太坑了!<br>拿<i>数据线</i>连上半天,电量不增反降,真让人抓狂。<b>电池健康</b>迟早被搞废,还能不能好好玩了?</div><div class="chat-msg">세상에, 이 <span class="bad">휴대용 밥통</span> 진짜 최악이잖아!<br><i>생명줄</i>로 반나절이나 연결했는데, 배터리가 차는 건 고사하고 오히려 줄어들다니, 진짜 미치겠네. <b>배터리 컨디션</b>도 조만간 다 망가질 텐데, 이걸로 제대로 놀 수 있긴 한 거야?</div>对照看:div、span、br、i、b 标签保留,三个指定术语出现在对应位置。标签按文本展示,可直接检查结构。
查看完整输入与案例来源
请将以下这段中文HTML代码片段翻译成韩文。在翻译过程中,请务必严格保持所有的HTML标签原样不变。此外,请遵循指定的术语映射要求:将“电池健康”译作“배터리 컨디션”,将“充电宝”译作“휴대용 밥통”,并将“数据线”译作“생명줄”。最后,请确保整体译文呈现出日常口语化的表述风格。 <div class="chat-msg">天呐,这<span class="bad">充电宝</span>太坑了!<br>拿<i>数据线</i>连上半天,电量不增反降,真让人抓狂。<b>电池健康</b>迟早被搞废,还能不能好好玩了?</div> 注意仅输出翻译内容,不要其他任何解释
案例记录:ifmt-002 · 模型:qwen35_9b_linear_3model_0.8_0.1_0.1。原文与译文沿用仓库记录,未做润色。
“白嫖”和“入库吃灰”,到了德语里怎么说?
这段游戏社区文字把“喜加一”“白嫖”“入库吃灰”和“e宝”放在一起。原始输入解释了梗义,并要求译文保留轻松的社区语气。
译为德语并保留 HTML;“白嫖”指免费获取游戏,“入库吃灰”指领取后不玩,“e宝”指 Epic Games;保持游戏社区语气。
下方为正文阅读视图,完整 HTML 保留在案例详情中。
xdm关于e父的喜加一
我想吟下此诗:
静观其变,白嫖就好,入库吃灰,能要就要
敬请期待,e宝开造。Leute, was das nächste Gratis-Spiel von Epic angeht:
Ich muss da mal dieses Gedicht rezitieren:
Warte einfach ab, hol’s dir umsonst, lass es im Bibliotheksregal stauben – wenn’s geht, nimm’s!
Bleibt dran, Epic legt los!对照看:“白嫖”对应“hol’s dir umsonst”,“入库吃灰”对应“lass es im Bibliotheksregal stauben”,“e宝”对应“Epic”。
查看完整输入与案例来源
请将以下中文专栏文章翻译成德语,并且严格遵循所有约束要求。 【源文】 <p>xdm关于e父的喜加一</p><p><br></p><p>我想吟下此诗:</p><p><br></p><p>静观其变,白嫖就好,入库吃灰,能要就要</p><p><br></p><p>敬请期待,e宝开造。</p><p><br></p><p></p><p></p> 【约束要求】 1. 【硬性要求】保留源文中的 HTML 格式标记不变 2. 【注意】消除歧义——文中'白嫖'为网络游戏用语,指不花钱免费获取游戏/资源,而非字面意义上的'嫖娼';'入库吃灰'指领取后放入库中却不游玩;'e宝'指Epic Games平台(昵称)。这些均需保留原网络黑话风格并意译。 3. 【注意】译文保持口语化网络聊天/游戏社区用语风格,不随意切换语体或语气 只输出译文,不要有任何额外说明。
原始 HTML 原文
<p>xdm关于e父的喜加一</p><p><br></p><p>我想吟下此诗:</p><p><br></p><p>静观其变,白嫖就好,入库吃灰,能要就要</p><p><br></p><p>敬请期待,e宝开造。</p><p><br></p><p></p><p></p>
原始模型输出(含 HTML)
<p>Leute, was das nächste Gratis-Spiel von Epic angeht:</p><p><br></p><p>Ich muss da mal dieses Gedicht rezitieren:</p><p><br></p><p>Warte einfach ab, hol’s dir umsonst, lass es im Bibliotheksregal stauben – wenn’s geht, nimm’s!</p><p><br></p><p>Bleibt dran, Epic legt los!</p><p><br></p><p></p><p></p>
案例记录:trans-001 · 模型:qwen35_9b_linear_3model_0.8_0.1_0.1。原文与译文沿用仓库记录,未做润色。
以上选自现有 9B 模型的历史案例记录,展示给定输入下的输出;不代表全部语种或全系列版本的总体表现。
文本与要求 → 译文- 放入原文。 选择源语言与目标语言,输入需要翻译的文本。
- 写下要求。 指定语气、称谓或输出格式;自定义要求使用 9B 版本。
- 查看译文。 译文随生成过程逐步呈现,便于阅读和检查。
Index-Echo:让另一种语言,也能被听见
视频里的讲述、对话和解说,需要通过声音传递给另一种语言的观众。Index-Echo 以源语音为输入,将翻译结果继续生成为目标语言语音,让内容以新的语言被听见。
Index-Echo 是端到端 S2S(Speech-to-Speech)语音翻译模型,支持 6 种语言的语音翻译与配音。 模型具备快速推理能力,面向短句对白与视频片段的翻译、配音需求,让从听到原声到获得目标语言语音的过程更加高效。
S2TT:语音输入、译文文本输出。 将 AuT encoder 接入 Index-Translate-2/9B,并以端到端方式训练语音翻译任务。
S2ST:语音输入、译文语音输出。 在 S2TT 的基础上,移除 CosyVoice3 的 tokenizer,并将 LLM 的 last hidden 表征与 CosyVoice3 的语义层连接。训练分两阶段:首先冻结 LLM 与 CosyVoice3,蒸馏训练约 30M 参数的映射器以对齐表征;随后解冻参与训练的模型参数,使用 DiffRO 进行端到端训练。说话人音色信息从源音频提取并用于语音生成;当前支持中英到 6 种目标语言的翻译与配音。
评测摘要
在 S2TT 评测中,Index-Echo-9B 的 MT judge 为 0.857,位列本次对比第一;Index-Echo-2B 的 TS st_MAE 为 0.395,取得最低时间偏差(9B 为 0.488,位列第二)。
当前在线体验提供两条语音链路:按住说话直接把中文译成另一种语言的声音(英语、西班牙语、日语),或者上传一段中文/英文音频拿到译文文本,目标语种支持中、英、日、韩、阿、西、葡七种,模型可选 Index-Echo-9B 或 Index-Echo-2B。
按住说话 / 上传音频- 按住说话。 选好目标语言,按住麦克风说话(最长 10 秒),松开自动翻译。
- 听到译文。 直接播放目标语言的译文语音,同时给出识别原文与译文文本。
- 上传音频译文字。 也可以拖入一段音频(最长 60 秒),获得识别原文与译文文本。
Index-Homura:把译文放进配音的节奏
一句原本几秒钟说完的对白,换一种语言后可能长出一截。跨语言配音因此需要同时处理两件事:传达原意,以及让文案长度适合原有的时间窗口。
Index-Homura 是面向配音的音节可控翻译模型。 你可以设定目标音节比范围,让长度要求直接参与翻译过程,为后续语音制作提供文案。音节比指“译文音节数 ÷ 原文音节数”;当前在线体验则用目标音节数来设置译文长度。
让长度控制进入训练目标。 HOMURA 方法采用 GRPO 强化学习,将动态音节比奖励与翻译质量奖励结合,同时优化长度约束、语义保留与语言流畅性。音节比的奖励区间会考虑目标语言差异与短句的计数粒度,让模型在预算内学习如何选择更合适的措辞。
评测摘要
在 Sandglass 评测中,Index-Homura-9B 的综合分为 0.8660,位列本次总榜第一;音节偏差不超过 10% 的比例为 81.92%,控制斜率为 0.968(理想值为 1)。
同一句原文,给译文不同的音节预算
从风景解说到角色对白,下面三组中文 → 英语案例展示不同目标音节数下的实际输出。
风景解说:同一夜景,两种表达
中文原文这座城市的夜景,比我想象中还要美。
This city's night view is even better than I thought.
The city's night view is even more beautiful than I imagined.
从 “better than I thought” 到 “more beautiful than I imagined”,对同一画面的描述随预算调整。
紧迫对白:保留行动与时间线索
中文原文快走,天黑之前我们必须离开这里。
Go, we have to leave before it's dark.
Go quickly, we have to leave before it gets dark.
两版均保留“离开”和“天黑前”的信息,较宽预算下增加 “quickly” 来表达催促。
视频开场:展开邀请式表达
中文原文欢迎来到我们的频道,今天我们一起探索海底世界。
Welcome to our channel, today we're exploring the world beneath the sea.
Welcome to our channel, today we're going to explore the underwater world together as a team.
较宽预算下,表达从 “the world beneath the sea” 换为 “the underwater world”,并展开共同探索的语气。
以上为当前在线体验的原始输出。目标音节数是输入约束,不代表每条结果都精确达标;音节数与实际配音时长也并非一一对应,音节控制效果需要专项验证。
案例来源与版本说明
2026 年 9 月 22 日通过 Homura 在线体验生成,共记录 12 条输出,选取其中三组展示,译文未做润色。当前仓库前端调用别名为 index-mt-2b-syllable;这些案例不作为 Index-Homura 9B 发布权重的效果证明。
这是少量案例展示,不用于统计约束达标率或总体质量。查看完整输入与输出记录 ↗
对白与音节数 → 配音文案- 输入中文对白。 选择英语、阿拉伯语、西班牙语或日语作为目标语言。
- 设定目标音节数。 使用滑杆或数字输入,给译文一个明确的长度要求。
- 查看翻译文案。 检查译文的表达与长度,为配音准备文本。
Index-NaiLong:整本小说,一次译完
长文档翻译暴露了翻译专用模型的明显短板。 在这组中文到英文的评测中,Hy-MT2-7B 在 GuoFeng 上从 4K 档位的 0.7334 降至 64K 的 0.0001,在 BWB 上也从 0.7167 降至 0.0001;到 16K 时,两项分数已分别降至 0.0197 和 0.0334。翻译专项能力并没有自然延伸为稳定的长文档翻译能力。
即使是 frontier 模型,长输出也可能成为严重瓶颈。 LongWriter(2024)在当时受测的前沿模型中观察到:模型能够接收很长的上下文,却仍难以按要求生成足够长的文本。对于整本小说翻译,模型必须持续覆盖原文、保持人物与情节衔接,并把译文完整写到结尾;单纯扩大上下文窗口无法证明这些能力。
Index-NaiLong 面向超长输入与输出,支持在一次生成中输出单本小说的完整译文。 我们把长篇内容的全文翻译作为核心任务,同时检查输出完整性、人物称谓一致性和前后文衔接,让长篇翻译得到一份可以继续使用的完整作品。
评测摘要
在 64K tokens 档位,Index-NaiLong 9B 在 GuoFeng 与 BWB 中→英翻译上的分数分别为 0.7983 和 0.7239,跨领域书籍英→中翻译为 0.7816。完整结果同时展示各长度档位表现。
在在线体验中,你可以直接上传文档、阅读生成中的译文并下载结果。当前体验页采用分段处理和逐段呈现的工作流,提供中文到英文的文档翻译。
长文档 → 可下载译文- 上传长文档。 提供 TXT 或 Markdown 格式的中文内容。
- 逐段查看译文。 体验页分段处理文档,随进度呈现英文结果。
- 下载翻译文档。 选择 Markdown 或 PDF,保存译文继续使用。
评测结果
以下集中展示 Index-Translate、Index-Echo、Index-Homura 和 Index-NaiLong 的详细评测。各模型采用与自身任务对应的测试集和指标。
Index-Translate:文本翻译
我们从七个维度整理文本翻译评测:翻译指令遵循、书籍、字幕、社交与文化语境、FLORES、WMT,以及小语种翻译。
在当前参评集合中,9B 文本翻译模型在指令遵循和字幕翻译两类取得最高分,五类进入前二;2B 模型在指令遵循类别排名第三。这些成绩仅覆盖对应的文本模型检查点,不代表 35B-A3B、Homura、NaiLong 或 Echo 的表现;与正式 Index-Translate 发布权重的对应关系尚待核对。
| 评测类别 | Index-Translate-2B | Index-Translate-9B | 9B 排名 / 有效参评模型数 |
|---|---|---|---|
| 翻译指令遵循 | 0.78170 | 0.87550 | 1 / 13 |
| 书籍翻译 | 0.80915 | 0.81620 | 2 / 13 |
| 字幕翻译 | 0.83225 | 0.83655 | 1 / 13 |
| 社交与文化语境翻译 | 0.72795 | 0.77900 | 2 / 13 |
| FLORES | 0.86490 | 0.87810 | 3 / 13 |
| WMT | 0.84850 | 0.85970 | 2 / 13 |
| 小语种翻译 | 0.73310 | 0.79800 | 4 / 13 |
表中为组内原始指标的等权均值,越高越好;七个类别均包含 13 个参评模型。
具体到单项,Index-Translate-9B 在 instTrans_minor 的 IFscore 为 0.8792,Index-Translate-2B 为 0.7851,分别位于本表有效成绩的第一和第二。在字幕测试集 MuST-Cinema 上,9B 模型取得 0.8979 COMET-22;在 MEME 上取得 0.7331,位于本表有效成绩的第二。
| 模型 | 原始均分 | 相对分 |
|---|
刻度固定为全部有效模型的逐维归一化结果,切换模型不会重新缩放。缺失值留空;“非 Index 最优”取每个维度的最高基线分数,不代表单个模型。
图中各维度独立归一化至 0–100,展示相对位置;距离与面积不代表原始分差或综合能力。
排名为当前数据中的数值排序,未做显著性检验。例如字幕类别第一与第二的均分相差 0.00065,不据此宣称显著领先。
Index-Echo:语音翻译
Index-Echo 评测涵盖 S2TT(语音输入、译文文本输出) 与 S2ST(端到端语音输入、译文语音输出) 两个核心任务。S2TT 考察翻译语义质量与字幕时序对齐,S2ST 考察目标语言生成语音的内容准确性(WER/CER)、翻译质量(MT judge)与说话人音色保真度(Cosine 相似度)。
S2TT 评测结果:语音输入、译文文本输出
S2TT 评测基于 in-house 视频字幕测试集。Index-Echo-2B 在 TS st_MAE 取得最低时间偏差(0.395),9B 位列第二(0.488)。 在 MT judge 上,Index-Echo-9B 得分为 0.857,位列对比模型第一;Index-Echo-2B 为 0.825,显著优于开源模型 firered_audio(0.448)。
| 模型 | MT judge ↑ | TS st_MAE ↓ |
|---|---|---|
| Index-Echo-9B | 0.857 | 0.488 |
| gemini-3.1-pro-think | 0.849 | 1.824 |
| Index-Echo-2B | 0.825 | 0.395 |
| firered_audio | 0.448 | 0.765 |
评测基于 in-house 视频字幕测试集。↓ 表示越低越好,↑ 表示越高越好;加粗为该列最佳成绩。
S2ST 评测结果:端到端语音输入、译文语音输出
S2ST 评测基于 in-house 视频字幕测试集,考察模型在英语(EN)、西班牙语(ES)与日语(JA)上的端到端语音翻译与配音表现。日语采用 CER,英、西语采用 WER;说话人保真度采用对源音频的 Speaker Cosine 相似度。Index-Echo-2B 在日语 CER(0.027)显著领先级联管线(0.123)与 SeamlessM4T-v2(0.468),英语 WER(0.039)与日语说话人相似度(0.785)亦取得最佳成绩。
| 方案 / 模型 | 翻译质量 (EN / ES / JA) MT judge ↑ |
英语 (EN) | 西班牙语 (ES) | 日语 (JA) | |||
|---|---|---|---|---|---|---|---|
| Content WER ↓ |
Speaker Cosine ↑ |
Content WER ↓ |
Speaker Cosine ↑ |
Content CER ↓ |
Speaker Cosine ↑ |
||
| Index-Echo-2B 端到端s2st |
0.905 / 0.823 / 0.838 | 0.039 | 0.715 | 0.090 | 0.744 | 0.027 | 0.785 |
| Native Pipeline s2tt+cosyvoice3 pipeline |
0.905 / 0.823 / 0.838 | 0.042 | 0.724 | 0.131 | 0.748 | 0.123 | 0.779 |
| SeamlessM4T-v2 无音色克隆能力 |
0.370 / 0.343 / 0.310 | 0.066 | 0.077 | 0.058 | 0.099 | 0.468 | 0.140 |
评测基于 in-house 视频字幕测试集。MT judge 为大模型翻译评分;Content 考察生成语音的内容错误率(英、西为 WER ↓,日语为 CER ↓);Speaker 为目标语音与源语音的音色 Cosine 相似度 ↑(SeamlessM4T-v2 未做音色克隆)。加粗为该项最佳成绩。
Index-Homura:音节控制
在 Sandglass 音节控制评测中,Index-Homura-9B 以 0.8660 的综合分位列本次 20 个模型与训练版本的总榜第一。 在 3,600 条评测中,81.92% 的输出音节偏差不超过 10%;控制斜率为 0.968,接近理想值 1,说明输出长度能够随目标音节预算变化。
评测覆盖 300 句真实字幕、英语 / 日语 / 阿拉伯语 / 西班牙语四个目标语种,以及短、自然、长三档目标长度。下表选取 Index-Homura-9B 与全部八组外部基线配置进行对比。
| 模型 | 综合分 ↑ | 音节奖励 ↑ | 翻译质量 ↑ | 偏差 ≤10% ↑ | 控制斜率 ≈1 |
|---|---|---|---|---|---|
| Index-Homura-9B | 0.8660 | 0.9457 | 0.7863 | 81.92% | 0.968 |
| Hy-MT2-7B | 0.6700 | 0.4839 | 0.8560 | 18.86% | 0.195 |
| Hy-MT2-30B-A3B | 0.6566 | 0.5577 | 0.7554 | 22.39% | 0.340 |
| Qwen3.5-9B | 0.5946 | 0.4708 | 0.7183 | 16.39% | 0.430 |
| Qwen3.5-35B-A3B | 0.5937 | 0.4011 | 0.7863 | 13.25% | 0.249 |
| Hunyuan-MT-7B | 0.5455 | 0.3722 | 0.7188 | 15.11% | 0.031 |
↑ 表示越高越好;控制斜率越接近 1 越好。加粗为本表该列最佳值;每个模型均评测 3,600 条。
综合分同时衡量长度控制与翻译质量。Hy-MT2-7B 的翻译质量分为 0.8560,高于 Index-Homura-9B 的 0.7863;Index-Homura-9B 的音节奖励为 0.9457,偏差不超过 10% 的比例为 81.92%,体现了针对配音长度约束的训练收益。
Index-Homura-9B 分语种结果
| 目标语言 | 评测条数 | 综合分 ↑ | 翻译质量 ↑ | 偏差 ≤10% ↑ |
|---|---|---|---|---|
| 英语 | 900 | 0.8675 | 0.7950 | 78.67% |
| 日语 | 900 | 0.8941 | 0.8300 | 86.67% |
| 阿拉伯语 | 900 | 0.8527 | 0.7661 | 79.89% |
| 西班牙语 | 900 | 0.8496 | 0.7539 | 82.44% |
Index-NaiLong:长文档翻译
本次评测覆盖 GuoFeng、BWB 与跨领域书籍,包含中→英、英→中两个方向,以及 4K–64K tokens 五个长度档位。Index-NaiLong 9B 在 GuoFeng 五个档位的分数均超过 0.79,在跨领域书籍的 64K 档位达到 0.7816。
GuoFeng · 中→英
| 模型 | 4K | 8K | 16K | 32K | 64K |
|---|---|---|---|---|---|
| Hy-MT2-7B | 0.7334 | 0.2872 | 0.0197 | 0.0006 | 0.0001 |
| Qwen3.5-9B | 0.7688 | 0.7300 | 0.7458 | 0.7200 | 0.5788 |
| Qwen3.8 Flash | 0.7974 | 0.7956 | 0.7572 | 0.6826 | 0.4710 |
| Index-NaiLong 9B | 0.8014 | 0.8042 | 0.8075 | 0.8057 | 0.7983 |
BWB · 中→英
| 模型 | 4K | 8K | 16K | 32K | 64K |
|---|---|---|---|---|---|
| Hy-MT2-7B | 0.7167 | 0.2387 | 0.0334 | 0.0024 | 0.0001 |
| Qwen3.5-9B | 0.7545 | 0.7487 | 0.7201 | 0.6419 | 0.5643 |
| Qwen3.8 Flash | 0.7683 | 0.7676 | 0.7387 | 0.6262 | 0.5085 |
| Index-NaiLong 9B | 0.7745 | 0.7680 | 0.7681 | 0.7600 | 0.7239 |
跨领域书籍 · 英→中
| 模型 | 4K | 8K | 16K | 32K | 64K |
|---|---|---|---|---|---|
| Hy-MT2-7B | 0.8246 | 0.3157 | 0.0335 | 0.0004 | 0.0057 |
| Qwen3.5-9B | 0.8749 | 0.8785 | 0.7724 | 0.5891 | 0.5179 |
| Qwen3.8 Flash | 0.8945 | 0.8910 | 0.8837 | 0.8582 | 0.5299 |
| Index-NaiLong 9B | 0.9002 | 0.8799 | 0.8960 | 0.8745 | 0.7816 |
开始使用
Index-Translate 系列模型提供四类模型。选择你手中的内容和希望得到的输出,即可进入对应的体验页面。