Index-Translate
INDEX-TRANSLATE / 模型系列

Index-Translate 系列模型从文字到声音,
让表达跨越语言

机器翻译不是区。— 是2017赛季 FMVP。

2026.09.22   /   中文稿

今天,我们带来 Index-Translate 系列模型。Index-Translate 是系列的主力模型,面向 148 种语言的文本翻译。我们强调翻译的泛化性,在泛化小语种翻译能力的同时,重点关注指令遵循和梗翻译能力,更贴近实际使用场景。在它的翻译能力之上,我们训练了三款衍生模型:Index-Echo、Index-Homura 和 Index-NaiLong,分别探索语音翻译、配音长度控制与长文档翻译。

真实内容对翻译的要求,往往比“换一种语言”更具体:一句玩笑要保留意味,一段配音要适配原有节奏,一本小说需要连贯完整的译文,一段视频则要让另一种语言的观众听懂。我们从文本翻译出发,逐步将能力延伸到这些场景。

  • 主力文本模型:Index-Translate。 具有 2B/9B/35A3B 3种规模,支持 148 种语言,通用翻译能力在同级别达到SoTA水平,与主流通用模型可比。特别强化了指令遵循翻译能力与梗翻译能力。
  • 语音衍生模型:Index-Echo。 基于 Index-Translate-2/9B 训练,包含 S2TT(语音输入、译文文本输出)和 S2ST(语音输入、译文语音输出)。S2TT 将 AuT encoder 接入 Index-Translate-2/9B,并以端到端方式训练语音翻译任务。S2ST 在 S2TT 模型之上连接语音生成模块,直接生成目标语言配音;当前支持中英→6 种语言。
  • 长度控制衍生模型:Index-Homura。 基于 Index-Translate-9B 训练,按目标音节比范围控制译文长度,为配音时间窗口生成更合适的文案。当前支持中→4 种语言。
  • 长文档衍生模型:Index-NaiLong。 基于 Index-Translate-9B 训练,面向整本小说等长篇内容,探索一次生成连贯、完整的译文。当前支持中英互译。

下面,我们结合使用场景、真实案例与评测结果,分别介绍四类模型;各模型的详细评测集中展示于文末。

CAPABILITIES / 能力一览

四种模型,各有所长

从文字到声音,看看它们的代表性表现。

Index-Translate

理解指令,也理解梗
通用翻译FLORES-200 与 WMT24++ · COMET-22 ↑
通用翻译 · FLORES-200 与 WMT24++ · COMET-22 ↑ 越高越好。FLORES-200 / WMT24++:Index-Translate-9B:0.8781 / 0.8597;Index-Translate-2B:0.8649 / 0.8485;Hy-MT2-30B-A3B:0.8787 / 0.8624;North Small Translate 218B:0.8784 / 0.8578;gpt-5.6-sol:0.8650 / 0.8469;gemini-3.5-flash-lite:0.8750 / 0.8497。 FLORES-200 WMT24++ 0 0.25 0.5 0.75 1 Index-Translate-9B · FLORES-200: 0.8781 0.8781 Index-Translate-9B · WMT24++: 0.8597 0.8597 Index-Translate 9B Index-Translate-2B · FLORES-200: 0.8649 0.8649 Index-Translate-2B · WMT24++: 0.8485 0.8485 Index-Translate 2B Hy-MT2-30B-A3B · FLORES-200: 0.8787 0.8787 Hy-MT2-30B-A3B · WMT24++: 0.8624 0.8624 Hy-MT2 30B CohereLabs/North-Small-Translate-1.0 (218A25B) · FLORES-200: 0.8784 0.8784 CohereLabs/North-Small-Translate-1.0 (218A25B) · WMT24++: 0.8578 0.8578 North 218B gpt-5.6-sol · FLORES-200: 0.8650 0.8650 gpt-5.6-sol · WMT24++: 0.8469 0.8469 GPT 5.6-sol gemini-3.5-flash-lite · FLORES-200: 0.8750 0.8750 gemini-3.5-flash-lite · WMT24++: 0.8497 0.8497 Gemini 3.5-Lite
指令遵循instTrans 与 IFMTBench · Quality score / IFscore 均值 ↑
指令遵循 · instTrans 与 IFMTBench · Quality score / IFscore 均值 ↑ 越高越好。Quality score / IFscore(instTrans 与 IFMTBench 均值):Index-Translate-9B:0.8256 / 0.8737;Index-Translate-2B:0.6836 / 0.7800;Hy-MT2-30B-A3B:0.7650 / 0.7952;North Small Translate 218B:0.7397 / 0.7209;gpt-5.6-sol:0.7913 / 0.8629;gemini-3.5-flash-lite:0.6844 / 0.8247。 Quality score IFscore 0 0.25 0.5 0.75 1 Index-Translate-9B · Quality score: 0.8256 0.8256 Index-Translate-9B · IFscore: 0.8737 0.8737 Index-Translate 9B Index-Translate-2B · Quality score: 0.6836 0.6836 Index-Translate-2B · IFscore: 0.7800 0.7800 Index-Translate 2B Hy-MT2-30B-A3B · Quality score: 0.7650 0.7650 Hy-MT2-30B-A3B · IFscore: 0.7952 0.7952 Hy-MT2 30B CohereLabs/North-Small-Translate-1.0 (218A25B) · Quality score: 0.7397 0.7397 CohereLabs/North-Small-Translate-1.0 (218A25B) · IFscore: 0.7209 0.7209 North 218B gpt-5.6-sol · Quality score: 0.7913 0.7913 gpt-5.6-sol · IFscore: 0.8629 0.8629 GPT 5.6-sol gemini-3.5-flash-lite · Quality score: 0.6844 0.6844 gemini-3.5-flash-lite · IFscore: 0.8247 0.8247 Gemini 3.5-Lite
垂类翻译均值6项测试集 · COMET-22 ↑
垂类翻译均值 · 6项测试集 · COMET-22 ↑ 越高越好。OpenSubtitles、书籍、医学等六项垂类等权均值:Index-Translate-9B:0.8325;Index-Translate-2B:0.8261;Hy-MT2-30B-A3B:0.8338;North Small Translate 218B:0.8243;gpt-5.6-sol:0.8171;gemini-3.5-flash-lite:0.8066。 0 0.25 0.5 0.75 1 Index-Translate-9B: 0.8325 0.8325 Index-Translate 9B Index-Translate-2B: 0.8261 0.8261 Index-Translate 2B Hy-MT2-30B-A3B: 0.8338 0.8338 Hy-MT2 30B CohereLabs/North-Small-Translate-1.0 (218A25B): 0.8243 0.8243 North 218B gpt-5.6-sol: 0.8171 0.8171 GPT 5.6-sol gemini-3.5-flash-lite: 0.8066 0.8066 Gemini 3.5-Lite
梗翻译MEME · 文化表达 ↑
梗翻译 · MEME ↑ 越高越好。Index-Translate-9B:0.7331;Index-Translate-2B:0.6429;Hy-MT2-30B-A3B:0.5812;North Small Translate 218B:0.6836;gpt-5.6-sol:0.7194;gemini-3.5-flash-lite:0.7034。 0 0.25 0.5 0.75 1 Index-Translate-9B: 0.7331 0.7331 Index-Translate 9B Index-Translate-2B: 0.6429 0.6429 Index-Translate 2B Hy-MT2-30B-A3B: 0.5812 0.5812 Hy-MT2 30B CohereLabs/North-Small-Translate-1.0 (218A25B): 0.6836 0.6836 North 218B gpt-5.6-sol: 0.7194 0.7194 5.6-sol gemini-3.5-flash-lite: 0.7034 0.7034 Gemini 3.5-Lite
查看完整评测

Index-Echo

从语音到翻译语音
S2TT语音翻译质量MT judge ↑
S2TT语音翻译质量 · MT judge ↑ 越高越好。Index-Echo-9B:0.857;Index-Echo-2B:0.825;gemini-3.1-pro-think:0.849;firered_audio:0.448 0 0.25 0.5 0.75 1 Index-Echo-9B:0.857 0.857 Echo 9B Index-Echo-2B:0.825 0.825 Echo 2B gemini-3.1-pro-think:0.849 0.849 Gemini3.1 Pro-Think firered_audio:0.448 0.448 FireRed Audio
STST WER/CER 均值WER/CER ↓ · 仅显示均值
Index-Echo-2B · STST WER/CER 对比均值 对比 Index-Echo-2B 落地版、级联 pipeline 与 SeamlessM4T-v2 均值。EN WER: Echo 0.039, Pipe 0.042, Seamless 0.066;ES WER: Echo 0.090, Pipe 0.131, Seamless 0.058;JA CER: Echo 0.027, Pipe 0.123, Seamless 0.468。WER/CER 越低越好。 Index-Echo Pipeline SeamlessM4T-v2 0 0.10 0.20 0.30 0.40 0.50 EN WER · Index-Echo: 0.0390.039 EN WER · Pipeline: 0.0420.042 EN WER · SeamlessM4T-v2: 0.0660.066 EN WER ES WER · Index-Echo: 0.0900.090 ES WER · Pipeline: 0.1310.131 ES WER · SeamlessM4T-v2: 0.0580.058 ES WER JA CER · Index-Echo: 0.0270.027 JA CER · Pipeline: 0.1230.123 JA CER · SeamlessM4T-v2: 0.4680.468 JA CER*

* 日语采用 raw CER,英、西语为 WER。

STST说话人相似度source-speaker cosine ↑
Index-Echo-2B · STST 说话人相似度对比 对源说话人的音色 cosine 相似度均值。EN: Echo 0.715, Pipe 0.724, Seamless 0.077;ES: Echo 0.744, Pipe 0.748, Seamless 0.099;JA: Echo 0.785, Pipe 0.779, Seamless 0.140。SeamlessM4T-v2 未做音色克隆。越高越好。 Index-Echo Pipeline SeamlessM4T-v2 0 0.25 0.5 0.75 1.0 EN · Index-Echo: 0.7150.715 EN · Pipeline: 0.7240.724 EN · SeamlessM4T-v2: 0.0770.077 EN ES · Index-Echo: 0.7440.744 ES · Pipeline: 0.7480.748 ES · SeamlessM4T-v2: 0.0990.099 ES JA · Index-Echo: 0.7850.785 JA · Pipeline: 0.7790.779 JA · SeamlessM4T-v2: 0.1400.140 JA

对源说话人的音色相似度(cosine 均值,越高越好)。SeamlessM4T-v2 为原生端到端基线,未做音色克隆。

查看完整评测

Index-Homura

让译文适配配音长度
音节控制综合表现SandGlass · score ↑
音节控制综合表现 · SandGlass · score ↑ 越高越好。Index-Homura-9B:0.8660;Hy-MT2-7B:0.6700;Hy-MT2-30B-A3B:0.6566;Qwen3.5-9B:0.5946 0 0.25 0.5 0.75 1 Index-Homura-9B:0.8660 0.8660 Homura 9B Hy-MT2-7B:0.6700 0.6700 Hy-MT2 7B Hy-MT2-30B-A3B:0.6566 0.6566 Hy-MT2 30B-A3B Qwen3.5-9B:0.5946 0.5946 Qwen3.5 9B
长度控制命中率SandGlass · dev ≤ 10% ↑
长度控制命中率 · SandGlass · dev ≤ 10% ↑ 越高越好。Index-Homura-9B:81.92%;Hy-MT2-7B:18.86%;Hy-MT2-30B-A3B:22.39%;Qwen3.5-9B:16.39% 0 25 50 75 100 Index-Homura-9B:81.92% 81.92% Homura 9B Hy-MT2-7B:18.86% 18.86% Hy-MT2 7B Hy-MT2-30B-A3B:22.39% 22.39% Hy-MT2 30B-A3B Qwen3.5-9B:16.39% 16.39% Qwen3.5 9B
查看完整评测

Index-NaiLong

走向更长的文档
GuoFeng · 中 → 英64K tokens · 原表分数 ↑
GuoFeng · 中 → 英 · 64K tokens · 原表分数 ↑ 越高越好。Index-NaiLong 9B:0.7983;Qwen3.8 Flash:0.4710;Qwen3.5-9B:0.5788;Hy-MT2-7B:0.0001 0 0.25 0.5 0.75 1 Index-NaiLong 9B:0.7983 0.7983 NaiLong 9B Qwen3.8 Flash:0.4710 0.4710 Qwen3.8 Flash Qwen3.5-9B:0.5788 0.5788 Qwen3.5 9B Hy-MT2-7B:0.0001 0.0001 Hy-MT2 7B
BWB · 中 → 英64K tokens · 原表分数 ↑
BWB · 中 → 英 · 64K tokens · 原表分数 ↑ 越高越好。Index-NaiLong 9B:0.7239;Qwen3.8 Flash:0.5085;Qwen3.5-9B:0.5643;Hy-MT2-7B:0.0001 0 0.25 0.5 0.75 1 Index-NaiLong 9B:0.7239 0.7239 NaiLong 9B Qwen3.8 Flash:0.5085 0.5085 Qwen3.8 Flash Qwen3.5-9B:0.5643 0.5643 Qwen3.5 9B Hy-MT2-7B:0.0001 0.0001 Hy-MT2 7B
查看完整评测

彩色为 Index 系列,灰色为对比模型。↑ 越高越好,↓ 越低越好;各图采用独立刻度。

Index-Translate:译出意思,也听懂要求

翻译人物对白时,我们关心角色说话的方式;翻译面向读者的说明时,我们关心语气与格式;遇到网络热梗时,还需要理解字面之外的语境。同一句话,可能需要不止一种合适的译法。

Index-Translate 将多语言翻译、指令控制与热梗理解结合起来。 除了原文和目标语言,你可以同时指定表达要求,例如保留人物之间的称谓、采用更口语化的语气,或只输出译文。模型据此完成翻译,让译文适合接下来的使用场景。

对于带有调侃、反话或文化背景的内容,翻译还需要理解它为何这样说。我们把社交与文化语境纳入评测,也单独考察翻译指令遵循,分别检查译文的质量与要求是否得到执行。

Index-Translate 以 Qwen 3.5 2B/9B/35A3B base 为底座,经过三个阶段训练:

Mid-train:这一阶段我们采用标准的 WSD scheduler,混合了基础预训练回放语料,多语种语料,平行语料和中转语料,探索了多种数据配比,平行度和平行组织方式,并在退火阶段特别提高了中转语料的比例,让模型学习不同语言的表达方式与跨语言语义对应,为后续翻译任务训练打下基础。

Post-train:在 mid-train 建立多语言基础之上,我们分别训练了通用翻译模型,指令遵循翻译模型和梗翻译模型三个专家模型,分别进行了 SFT 和 RaR RL(Rubric as Reward)或 RLVR。

Model-merge:我们结合线性插值/MOPD/Mix-RL,将多版本能力整合到统一模型。

INDEX-TRANSLATE / EVALUATION

后训练评测主表:六项核心指标对比

主表汇总后训练评测中的 Index-Translate-9B/2B 与对比模型。涵盖通用翻译(FLORES-200、WMT24++)、翻译指令遵循(instTrans、IFMTBench)、六项垂类翻译均值与文化表达(MEME 梗翻译)。Index-Translate-9B 在 instTrans(0.8949)与 MEME(0.7331)两项均位列全场第一,通用翻译超越同尺寸模型;2B 亦在各维度大幅领先对标模型。

模型 FLORES-200
COMET-22 ↑
WMT24++
COMET-22 ↑
instTrans
IFscore ↑
IFMTBench
IFscore ↑
垂类均值
COMET-22 ↑
梗翻译
MEME ↑
Index-Translate 主力模型
Index-Translate-9B0.87810.85970.89490.85240.83250.7331
Index-Translate-2B0.86490.84850.83590.72410.82610.6429
对比模型
Hy-MT2-1.8B0.85220.84010.56130.68870.81650.3643
Hy-MT2-7B0.87470.85930.69280.84830.82050.5139
Hy-MT2-30B-A3B0.87870.86240.71770.87260.83380.5812
translategemma-12b-it0.87320.85240.36640.26750.82370.4281
CohereLabs/North-Small-Translate-1.0 (218A25B)0.87840.85780.60350.83830.82430.6836
gpt-5.6-sol0.86500.84690.82310.90260.81710.7194
gemini-3.5-flash-lite0.87500.84970.78100.86840.80660.7034

垂类均值为 OpenSubtitles、OPUS-Books、WMT Biomedical、MTNT、MuST-Cinema 与 GuoFeng-Webnovel 六项成绩的等权平均。MEME 考察网络热梗与社交文化语境理解。加粗表示各列最高分。↑ 越高越好。

查看 Index-Translate 详细评测:七类结果与交互雷达图 ↘

INDEX-TRANSLATE / CASES

把能力放进真实的翻译里

从小语种到具体指令,再到网络热梗。下面三条案例展示原文、翻译要求与模型保存的真实输出。

01 / 小语种9B · 案例快照

把中文故事,带到波兰语里

中文 → 波兰语小说片段人物指代

以中文到波兰语的小说片段为例,看看模型怎样在翻译叙述的同时,按照给定说明处理人物指代。

翻译要求

译为波兰语;原文中的“等她”按上下文指向男性角色邹衍;只输出译文。

原文 ZH
邹衍站在原地说不出的委屈,他本以为两女在门口等她,怎么也会决个胜负,留下一个陪他。
让他也炫耀虚荣一般,难道我就这么命苦吗?
对不起了,昨天电源踢掉了,稿子都没了,尽力补。
模型译文 PL
Zou Yan stał w miejscu, czując niewypowiedzianą krzywdę. Myślał, że obie kobiety będą na niego czekać przy drzwiach i że w końcu rozstrzygną między sobą, która zostanie z nim.

Chciałby chociaż trochę pochwalić się swoją dumą. Czy naprawdę mam tak pechowe życie?

Przepraszam, wczoraj padło zasilanie i straciłem cały manuskrypt. Postaram się to nadrobić.

对照看:译文中的“na niego”和“z nim”对应“等他”和“陪他”。这条案例的输入明确给出了指代说明。

查看完整输入与案例来源
请将以下中文小说翻译成波兰语,并且严格遵循所有约束要求。

【源文】
邹衍站在原地说不出的委屈,他本以为两女在门口等她,怎么也会决个胜负,留下一个陪他。
让他也炫耀虚荣一般,难道我就这么命苦吗?
对不起了,昨天电源踢掉了,稿子都没了,尽力补。

【约束要求】
1. 【注意】指代一致性——源文第一句'他本以为两女在门口等她'中的'她'容易误指为两女中的一位,实际应为'他'(指邹衍自己),可能为笔误。翻译成波兰语时需注意代词性别一致,避免歧义。


只输出译文,不要有任何额外说明。

案例记录:trans-004 · 模型:qwen35_9b_linear_3model_0.8_0.1_0.1。原文与译文沿用仓库记录,未做润色。

02 / 指令遵循9B · 案例快照

翻译内容,也遵守格式与术语要求

中文 → 韩文HTML 保留术语与风格

同一段内容同时带有三类要求:保留 HTML 标签、使用指定术语,并采用日常口语表达。把原文与译文放在一起,逐项检查。

翻译要求

译为韩文并保留 HTML 标签;电池健康 → 배터리 컨디션,充电宝 → 휴대용 밥통,数据线 → 생명줄;使用日常口语,只输出译文。

原文 ZH
<div class="chat-msg">天呐,这<span class="bad">充电宝</span>太坑了!<br>拿<i>数据线</i>连上半天,电量不增反降,真让人抓狂。<b>电池健康</b>迟早被搞废,还能不能好好玩了?</div>
模型译文 KO
<div class="chat-msg">세상에, 이 <span class="bad">휴대용 밥통</span> 진짜 최악이잖아!<br><i>생명줄</i>로 반나절이나 연결했는데, 배터리가 차는 건 고사하고 오히려 줄어들다니, 진짜 미치겠네. <b>배터리 컨디션</b>도 조만간 다 망가질 텐데, 이걸로 제대로 놀 수 있긴 한 거야?</div>

对照看:div、span、br、i、b 标签保留,三个指定术语出现在对应位置。标签按文本展示,可直接检查结构。

查看完整输入与案例来源
请将以下这段中文HTML代码片段翻译成韩文。在翻译过程中,请务必严格保持所有的HTML标签原样不变。此外,请遵循指定的术语映射要求:将“电池健康”译作“배터리 컨디션”,将“充电宝”译作“휴대용 밥통”,并将“数据线”译作“생명줄”。最后,请确保整体译文呈现出日常口语化的表述风格。

<div class="chat-msg">天呐,这<span class="bad">充电宝</span>太坑了!<br>拿<i>数据线</i>连上半天,电量不增反降,真让人抓狂。<b>电池健康</b>迟早被搞废,还能不能好好玩了?</div>

注意仅输出翻译内容,不要其他任何解释

案例记录:ifmt-002 · 模型:qwen35_9b_linear_3model_0.8_0.1_0.1。原文与译文沿用仓库记录,未做润色。

03 / 梗翻译9B · 案例快照

“白嫖”和“入库吃灰”,到了德语里怎么说?

中文 → 德语游戏社区给定梗义语境

这段游戏社区文字把“喜加一”“白嫖”“入库吃灰”和“e宝”放在一起。原始输入解释了梗义,并要求译文保留轻松的社区语气。

翻译要求

译为德语并保留 HTML;“白嫖”指免费获取游戏,“入库吃灰”指领取后不玩,“e宝”指 Epic Games;保持游戏社区语气。

下方为正文阅读视图,完整 HTML 保留在案例详情中。

原文 ZH
xdm关于e父的喜加一

我想吟下此诗:

静观其变,白嫖就好,入库吃灰,能要就要

敬请期待,e宝开造。
模型译文 DE
Leute, was das nächste Gratis-Spiel von Epic angeht:

Ich muss da mal dieses Gedicht rezitieren:

Warte einfach ab, hol’s dir umsonst, lass es im Bibliotheksregal stauben – wenn’s geht, nimm’s!

Bleibt dran, Epic legt los!

对照看:“白嫖”对应“hol’s dir umsonst”,“入库吃灰”对应“lass es im Bibliotheksregal stauben”,“e宝”对应“Epic”。

查看完整输入与案例来源
请将以下中文专栏文章翻译成德语,并且严格遵循所有约束要求。

【源文】
<p>xdm关于e父的喜加一</p><p><br></p><p>我想吟下此诗:</p><p><br></p><p>静观其变,白嫖就好,入库吃灰,能要就要</p><p><br></p><p>敬请期待,e宝开造。</p><p><br></p><p></p><p></p>

【约束要求】
1. 【硬性要求】保留源文中的 HTML 格式标记不变
2. 【注意】消除歧义——文中'白嫖'为网络游戏用语,指不花钱免费获取游戏/资源,而非字面意义上的'嫖娼';'入库吃灰'指领取后放入库中却不游玩;'e宝'指Epic Games平台(昵称)。这些均需保留原网络黑话风格并意译。
3. 【注意】译文保持口语化网络聊天/游戏社区用语风格,不随意切换语体或语气

只输出译文,不要有任何额外说明。

原始 HTML 原文

<p>xdm关于e父的喜加一</p><p><br></p><p>我想吟下此诗:</p><p><br></p><p>静观其变,白嫖就好,入库吃灰,能要就要</p><p><br></p><p>敬请期待,e宝开造。</p><p><br></p><p></p><p></p>

原始模型输出(含 HTML)

<p>Leute, was das nächste Gratis-Spiel von Epic angeht:</p><p><br></p><p>Ich muss da mal dieses Gedicht rezitieren:</p><p><br></p><p>Warte einfach ab, hol’s dir umsonst, lass es im Bibliotheksregal stauben – wenn’s geht, nimm’s!</p><p><br></p><p>Bleibt dran, Epic legt los!</p><p><br></p><p></p><p></p>

案例记录:trans-001 · 模型:qwen35_9b_linear_3model_0.8_0.1_0.1。原文与译文沿用仓库记录,未做润色。

以上选自现有 9B 模型的历史案例记录,展示给定输入下的输出;不代表全部语种或全系列版本的总体表现。

Index-Translate 官网角色图文本与要求 → 译文
在线体验流程
  1. 放入原文。 选择源语言与目标语言,输入需要翻译的文本。
  2. 写下要求。 指定语气、称谓或输出格式;自定义要求使用 9B 版本。
  3. 查看译文。 译文随生成过程逐步呈现,便于阅读和检查。

体验 Index-Translate · 文本翻译 ↗

Index-Echo:让另一种语言,也能被听见

视频里的讲述、对话和解说,需要通过声音传递给另一种语言的观众。Index-Echo 以源语音为输入,将翻译结果继续生成为目标语言语音,让内容以新的语言被听见。

Index-Echo 是端到端 S2S(Speech-to-Speech)语音翻译模型,支持 6 种语言的语音翻译与配音。 模型具备快速推理能力,面向短句对白与视频片段的翻译、配音需求,让从听到原声到获得目标语言语音的过程更加高效。

S2TT:语音输入、译文文本输出。 将 AuT encoder 接入 Index-Translate-2/9B,并以端到端方式训练语音翻译任务。

S2ST:语音输入、译文语音输出。 在 S2TT 的基础上,移除 CosyVoice3 的 tokenizer,并将 LLM 的 last hidden 表征与 CosyVoice3 的语义层连接。训练分两阶段:首先冻结 LLM 与 CosyVoice3,蒸馏训练约 30M 参数的映射器以对齐表征;随后解冻参与训练的模型参数,使用 DiffRO 进行端到端训练。说话人音色信息从源音频提取并用于语音生成;当前支持中英到 6 种目标语言的翻译与配音。

Index-Echo 架构:从语音翻译(S2TT)到语音生成(S2ST)。S2TT 主干连接 Qwen3-Omni AuT 语音编码器、音频连接器与 Index-Translate 解码器生成目标语言文本;S2ST 阶段将译文与最后一层 hidden 表征对齐至 CosyVoice3 token 位置,经 Hidden2CV 映射器接入 CosyVoice3 语义 LLM 预测语音 codec,再由 DiT flow 解码器与 HiFT 声码器合成目标语音。源音频同时提供参考提示与 CampPlus 说话人音色嵌入。训练先冻结主干进行表征对齐,再以 DiffRO 完成端到端微调。

评测摘要

在 S2TT 评测中,Index-Echo-9B 的 MT judge 为 0.857,位列本次对比第一;Index-Echo-2B 的 TS st_MAE 为 0.395,取得最低时间偏差(9B 为 0.488,位列第二)。

查看 Index-Echo 完整评测 ↘

Index-Echo 六种语言翻译演示 · 53 秒录屏(无音轨)

当前在线体验提供两条语音链路:按住说话直接把中文译成另一种语言的声音(英语、西班牙语、日语),或者上传一段中文/英文音频拿到译文文本,目标语种支持中、英、日、韩、阿、西、葡七种,模型可选 Index-Echo-9B 或 Index-Echo-2B。

Index-Echo 官网角色图按住说话 / 上传音频
在线体验流程
  1. 按住说话。 选好目标语言,按住麦克风说话(最长 10 秒),松开自动翻译。
  2. 听到译文。 直接播放目标语言的译文语音,同时给出识别原文与译文文本。
  3. 上传音频译文字。 也可以拖入一段音频(最长 60 秒),获得识别原文与译文文本。

体验 Index-Echo · 语音翻译 ↗

Index-Homura:把译文放进配音的节奏

一句原本几秒钟说完的对白,换一种语言后可能长出一截。跨语言配音因此需要同时处理两件事:传达原意,以及让文案长度适合原有的时间窗口。

Index-Homura 是面向配音的音节可控翻译模型。 你可以设定目标音节比范围,让长度要求直接参与翻译过程,为后续语音制作提供文案。音节比指“译文音节数 ÷ 原文音节数”;当前在线体验则用目标音节数来设置译文长度。

让长度控制进入训练目标。 HOMURA 方法采用 GRPO 强化学习,将动态音节比奖励与翻译质量奖励结合,同时优化长度约束、语义保留与语言流畅性。音节比的奖励区间会考虑目标语言差异与短句的计数粒度,让模型在预算内学习如何选择更合适的措辞。

评测摘要

在 Sandglass 评测中,Index-Homura-9B 的综合分为 0.8660,位列本次总榜第一;音节偏差不超过 10% 的比例为 81.92%,控制斜率为 0.968(理想值为 1)。

查看 Index-Homura 完整评测 ↘

HOMURA IN ACTION

同一句原文,给译文不同的音节预算

从风景解说到角色对白,下面三组中文 → 英语案例展示不同目标音节数下的实际输出。

01

风景解说:同一夜景,两种表达

中文原文这座城市的夜景,比我想象中还要美。

目标 12 音节ENGLISH

This city's night view is even better than I thought.

目标 16 音节ENGLISH

The city's night view is even more beautiful than I imagined.

从 “better than I thought” 到 “more beautiful than I imagined”,对同一画面的描述随预算调整。

02

紧迫对白:保留行动与时间线索

中文原文快走,天黑之前我们必须离开这里。

目标 10 音节ENGLISH

Go, we have to leave before it's dark.

目标 14 音节ENGLISH

Go quickly, we have to leave before it gets dark.

两版均保留“离开”和“天黑前”的信息,较宽预算下增加 “quickly” 来表达催促。

03

视频开场:展开邀请式表达

中文原文欢迎来到我们的频道,今天我们一起探索海底世界。

目标 20 音节ENGLISH

Welcome to our channel, today we're exploring the world beneath the sea.

目标 26 音节ENGLISH

Welcome to our channel, today we're going to explore the underwater world together as a team.

较宽预算下,表达从 “the world beneath the sea” 换为 “the underwater world”,并展开共同探索的语气。

以上为当前在线体验的原始输出。目标音节数是输入约束,不代表每条结果都精确达标;音节数与实际配音时长也并非一一对应,音节控制效果需要专项验证。

案例来源与版本说明

2026 年 9 月 22 日通过 Homura 在线体验生成,共记录 12 条输出,选取其中三组展示,译文未做润色。当前仓库前端调用别名为 index-mt-2b-syllable;这些案例不作为 Index-Homura 9B 发布权重的效果证明。

这是少量案例展示,不用于统计约束达标率或总体质量。查看完整输入与输出记录 ↗

Index-Homura 官网角色图对白与音节数 → 配音文案
在线体验流程
  1. 输入中文对白。 选择英语、阿拉伯语、西班牙语或日语作为目标语言。
  2. 设定目标音节数。 使用滑杆或数字输入,给译文一个明确的长度要求。
  3. 查看翻译文案。 检查译文的表达与长度,为配音准备文本。

体验 Index-Homura · 音节控制翻译 ↗

Index-NaiLong:整本小说,一次译完

长文档翻译暴露了翻译专用模型的明显短板。 在这组中文到英文的评测中,Hy-MT2-7B 在 GuoFeng 上从 4K 档位的 0.7334 降至 64K 的 0.0001,在 BWB 上也从 0.7167 降至 0.0001;到 16K 时,两项分数已分别降至 0.0197 和 0.0334。翻译专项能力并没有自然延伸为稳定的长文档翻译能力。

即使是 frontier 模型,长输出也可能成为严重瓶颈。 LongWriter(2024)在当时受测的前沿模型中观察到:模型能够接收很长的上下文,却仍难以按要求生成足够长的文本。对于整本小说翻译,模型必须持续覆盖原文、保持人物与情节衔接,并把译文完整写到结尾;单纯扩大上下文窗口无法证明这些能力。

Index-NaiLong 面向超长输入与输出,支持在一次生成中输出单本小说的完整译文。 我们把长篇内容的全文翻译作为核心任务,同时检查输出完整性、人物称谓一致性和前后文衔接,让长篇翻译得到一份可以继续使用的完整作品。

评测摘要

在 64K tokens 档位,Index-NaiLong 9B 在 GuoFeng 与 BWB 中→英翻译上的分数分别为 0.7983 和 0.7239,跨领域书籍英→中翻译为 0.7816。完整结果同时展示各长度档位表现。

查看 Index-NaiLong 完整评测 ↘

在在线体验中,你可以直接上传文档、阅读生成中的译文并下载结果。当前体验页采用分段处理和逐段呈现的工作流,提供中文到英文的文档翻译。

Index-NaiLong 官网角色图长文档 → 可下载译文
在线体验流程
  1. 上传长文档。 提供 TXT 或 Markdown 格式的中文内容。
  2. 逐段查看译文。 体验页分段处理文档,随进度呈现英文结果。
  3. 下载翻译文档。 选择 Markdown 或 PDF,保存译文继续使用。

体验 Index-NaiLong · 长文本翻译 ↗

评测结果

以下集中展示 Index-Translate、Index-Echo、Index-Homura 和 Index-NaiLong 的详细评测。各模型采用与自身任务对应的测试集和指标。

Index-Translate:文本翻译

我们从七个维度整理文本翻译评测:翻译指令遵循、书籍、字幕、社交与文化语境、FLORES、WMT,以及小语种翻译。

在当前参评集合中,9B 文本翻译模型在指令遵循和字幕翻译两类取得最高分,五类进入前二;2B 模型在指令遵循类别排名第三。这些成绩仅覆盖对应的文本模型检查点,不代表 35B-A3B、Homura、NaiLong 或 Echo 的表现;与正式 Index-Translate 发布权重的对应关系尚待核对。

评测类别 Index-Translate-2B Index-Translate-9B 9B 排名 / 有效参评模型数
翻译指令遵循 0.78170 0.87550 1 / 13
书籍翻译 0.80915 0.81620 2 / 13
字幕翻译 0.83225 0.83655 1 / 13
社交与文化语境翻译 0.72795 0.77900 2 / 13
FLORES 0.86490 0.87810 3 / 13
WMT 0.84850 0.85970 2 / 13
小语种翻译 0.73310 0.79800 4 / 13

表中为组内原始指标的等权均值,越高越好;七个类别均包含 13 个参评模型。

具体到单项,Index-Translate-9B 在 instTrans_minor 的 IFscore 为 0.8792,Index-Translate-2B 为 0.7851,分别位于本表有效成绩的第一和第二。在字幕测试集 MuST-Cinema 上,9B 模型取得 0.8979 COMET-22;在 MEME 上取得 0.7331,位于本表有效成绩的第二。

Index 文本模型七维评测概览;启用 JavaScript 可使用交互图表
七维评测 · 原始图表

图中各维度独立归一化至 0–100,展示相对位置;距离与面积不代表原始分差或综合能力。

排名为当前数据中的数值排序,未做显著性检验。例如字幕类别第一与第二的均分相差 0.00065,不据此宣称显著领先。

查看 12 项原始成绩 · 查看全部模型的七类均分

SPEECH-TO-SPEECH / EVALUATION

Index-Echo:语音翻译

Index-Echo 评测涵盖 S2TT(语音输入、译文文本输出) 与 S2ST(端到端语音输入、译文语音输出) 两个核心任务。S2TT 考察翻译语义质量与字幕时序对齐,S2ST 考察目标语言生成语音的内容准确性(WER/CER)、翻译质量(MT judge)与说话人音色保真度(Cosine 相似度)。

S2TT 评测结果:语音输入、译文文本输出

S2TT 评测基于 in-house 视频字幕测试集。Index-Echo-2B 在 TS st_MAE 取得最低时间偏差(0.395),9B 位列第二(0.488)。 在 MT judge 上,Index-Echo-9B 得分为 0.857,位列对比模型第一;Index-Echo-2B 为 0.825,显著优于开源模型 firered_audio(0.448)。

模型MT judge ↑TS st_MAE ↓
Index-Echo-9B0.8570.488
gemini-3.1-pro-think0.8491.824
Index-Echo-2B0.8250.395
firered_audio0.4480.765

评测基于 in-house 视频字幕测试集。↓ 表示越低越好,↑ 表示越高越好;加粗为该列最佳成绩。

S2ST 评测结果:端到端语音输入、译文语音输出

S2ST 评测基于 in-house 视频字幕测试集,考察模型在英语(EN)、西班牙语(ES)与日语(JA)上的端到端语音翻译与配音表现。日语采用 CER,英、西语采用 WER;说话人保真度采用对源音频的 Speaker Cosine 相似度。Index-Echo-2B 在日语 CER(0.027)显著领先级联管线(0.123)与 SeamlessM4T-v2(0.468),英语 WER(0.039)与日语说话人相似度(0.785)亦取得最佳成绩。

方案 / 模型 翻译质量 (EN / ES / JA)
MT judge ↑
英语 (EN) 西班牙语 (ES) 日语 (JA)
Content
WER ↓
Speaker
Cosine ↑
Content
WER ↓
Speaker
Cosine ↑
Content
CER ↓
Speaker
Cosine ↑
Index-Echo-2B
端到端s2st
0.905 / 0.823 / 0.838 0.039 0.715 0.090 0.744 0.027 0.785
Native Pipeline
s2tt+cosyvoice3 pipeline
0.905 / 0.823 / 0.838 0.042 0.724 0.131 0.748 0.123 0.779
SeamlessM4T-v2
无音色克隆能力
0.370 / 0.343 / 0.310 0.066 0.077 0.058 0.099 0.468 0.140

评测基于 in-house 视频字幕测试集。MT judge 为大模型翻译评分;Content 考察生成语音的内容错误率(英、西为 WER ↓,日语为 CER ↓);Speaker 为目标语音与源语音的音色 Cosine 相似度 ↑(SeamlessM4T-v2 未做音色克隆)。加粗为该项最佳成绩。

SANDGLASS / SYLLABLE CONTROL

Index-Homura:音节控制

在 Sandglass 音节控制评测中,Index-Homura-9B 以 0.8660 的综合分位列本次 20 个模型与训练版本的总榜第一。 在 3,600 条评测中,81.92% 的输出音节偏差不超过 10%;控制斜率为 0.968,接近理想值 1,说明输出长度能够随目标音节预算变化。

评测覆盖 300 句真实字幕、英语 / 日语 / 阿拉伯语 / 西班牙语四个目标语种,以及短、自然、长三档目标长度。下表选取 Index-Homura-9B 与全部八组外部基线配置进行对比。

模型 综合分 ↑ 音节奖励 ↑ 翻译质量 ↑ 偏差 ≤10% ↑ 控制斜率 ≈1
Index-Homura-9B 0.8660 0.9457 0.7863 81.92% 0.968
Hy-MT2-7B 0.6700 0.4839 0.8560 18.86% 0.195
Hy-MT2-30B-A3B 0.6566 0.5577 0.7554 22.39% 0.340
Qwen3.5-9B 0.5946 0.4708 0.7183 16.39% 0.430
Qwen3.5-35B-A3B 0.5937 0.4011 0.7863 13.25% 0.249
Hunyuan-MT-7B 0.5455 0.3722 0.7188 15.11% 0.031

↑ 表示越高越好;控制斜率越接近 1 越好。加粗为本表该列最佳值;每个模型均评测 3,600 条。

综合分同时衡量长度控制与翻译质量。Hy-MT2-7B 的翻译质量分为 0.8560,高于 Index-Homura-9B 的 0.7863;Index-Homura-9B 的音节奖励为 0.9457,偏差不超过 10% 的比例为 81.92%,体现了针对配音长度约束的训练收益。

Index-Homura-9B 分语种结果

目标语言 评测条数 综合分 ↑ 翻译质量 ↑ 偏差 ≤10% ↑
英语 900 0.8675 0.7950 78.67%
日语 900 0.8941 0.8300 86.67%
阿拉伯语 900 0.8527 0.7661 79.89%
西班牙语 900 0.8496 0.7539 82.44%
INDEX-NAILONG / LONG DOCUMENTS

Index-NaiLong:长文档翻译

本次评测覆盖 GuoFeng、BWB 与跨领域书籍,包含中→英、英→中两个方向,以及 4K–64K tokens 五个长度档位。Index-NaiLong 9B 在 GuoFeng 五个档位的分数均超过 0.79,在跨领域书籍的 64K 档位达到 0.7816。

GuoFeng · 中→英

模型4K8K16K32K64K
Hy-MT2-7B0.73340.28720.01970.00060.0001
Qwen3.5-9B0.76880.73000.74580.72000.5788
Qwen3.8 Flash0.79740.79560.75720.68260.4710
Index-NaiLong 9B0.80140.80420.80750.80570.7983

BWB · 中→英

模型4K8K16K32K64K
Hy-MT2-7B0.71670.23870.03340.00240.0001
Qwen3.5-9B0.75450.74870.72010.64190.5643
Qwen3.8 Flash0.76830.76760.73870.62620.5085
Index-NaiLong 9B0.77450.76800.76810.76000.7239

跨领域书籍 · 英→中

模型4K8K16K32K64K
Hy-MT2-7B0.82460.31570.03350.00040.0057
Qwen3.5-9B0.87490.87850.77240.58910.5179
Qwen3.8 Flash0.89450.89100.88370.85820.5299
Index-NaiLong 9B0.90020.87990.89600.87450.7816

开始使用

Index-Translate 系列模型提供四类模型。选择你手中的内容和希望得到的输出,即可进入对应的体验页面。

模型 版本 核心能力 体验入口
Index-Translate 2B / 9B / 35B-A3B 100+ 语言文本翻译、指令控制、热梗理解 文本翻译 ↗
Index-Echo 2B / 9B 端到端 S2S、快速推理、6 种语言翻译配音 语音翻译 ↗
Index-Homura 9B 按目标音节比范围控制译文长度 音节控制翻译 ↗
Index-NaiLong 9B 超长文本生成、单本小说完整译文输出 长文档翻译 ↗
Index-Translate · 七维评测
Index-Echo · 演示视频