B站开源 Index-Translate 多语言翻译模型家族,支持150种语言,2B/9B模型也能接住热梗
一句弹幕里的“狒瘾犯了”,换成英文还能让人接住梗吗?一段视频换了语言,能否听到自然的配音?一本小说翻到后半本,人物的名字还能保持一致吗?
哔哩哔哩Index LLM团队推出 Index-Translate 多语言翻译模型家族。文本模型覆盖包括中文、英文在内的 150 种语言,提供 2B、9B、35B-A3B(preview) 三种规模;Index-Echo、Index-Homura 和 Index-NativeLong 分别面向语音翻译、音节可控翻译与长文档翻译。
- Demo主页:https://index-translate.bilibili.com/
- Github:https://github.com/bilibili/Index-Translate
- ModelScope:
https://www.modelscope.cn/collections/IndexTeam/Index-Translate

图 1 七个维度看翻译能力。采用官网数据及固定的逐维 min–max 归一化,越靠外表示该维度的相对得分越高,并非准确率;灰色虚线是各维度非 Index 模型的最高值组合。图中展示 35B-A3B(preview)、9B、2B 及默认对照,归一化范围覆盖全部 14 款模型。七个维度为 WMT、FLORES、指令遵循、小语种、字幕翻译、MEME 和书籍网文;指令遵循取 instTrans 与 IFMTBench IFscore 均值。完整模型与原始分数见官网评测。
下面用官网的演示和真实案例,看看这些能力如何落到具体内容中。
Index-Echo将视频翻译成另一种语言
Index-Echo 支持语音到语音(S2ST)和语音到文字(S2TT)两种翻译任务,分别生成目标语言配音和文字;生成配音时还会参考源音频的说话人声音特征。
视频配音演示
这段 21 秒录屏展示英文视频转为日语配音,界面并列呈现视频、英文原句与日文译文。

多语字幕演示
这段 47 秒录屏展示多语言字幕。下方预览中的英文演讲配有中文、日文、西班牙文等译文。

语音任务的语言覆盖按具体功能提供,欢迎进入 Index-Echo 在线 Demo 体验 👇
Index-Echo 在线 Demo:
https://index-translate.bilibili.com/?p=/site/index.html&lang=zh
Index-Translate将翻译要求一起执行
翻译工作经常附带具体要求:术语必须统一,品牌名保持原样,只翻译指定字段,或者保留话题标签。Index-Translate 将这些要求与原文一起理解,让译文适应后续的使用方式。
话题标签保留原样
一条动态需要从中文译为韩文。用户要求保留 JSON 结构,以及话题标签 #热血航线大和登场# 和星号符号。
原文
{"title": "⭐2月13日例行维护公告⭐", "content": "#热血航线大和登场#"}
Index-Translate-9B
{"title": "⭐2월 13일 정기 점검 공지⭐", "content": "#热血航线大和登场#"}
对照输出
{"title": "⭐2월 13일 정기 점검 안내⭐", "content": "#열혈 항로 야마토 등장#"}
两份译文都翻译了公告标题,区别在于话题标签。Index-Translate-9B 保留了用户指定的中文标签,对照输出则将标签一并译成韩文。在这个样本中,两者翻译质量评分均为 1.0,约束检查得分分别为 1.0 和 0.0。
把文字译通顺,同时分清哪些内容需要保持原样,是这类任务的关键。
商品表格只翻译指定列
另一个任务要求将商品 CSV 从英文译为中文:只翻译类别、描述和发布状态,保留英文表头、产品编号、价格与三行结构。
原文的表头及第一条数据如下,完整输入另含编号为 SYS-002 的软件商品。
Product_ID,Category,Description,Release_Status,Price
"SYS-001","Hardware","High-performance motherboard, equipped with dual Gigabit LAN and PCIe 4.0 slots.","Available",199.99
Index-Translate-9B 对应输出:
Product_ID,Category,Description,Release_Status,Price
"SYS-001","硬件","高性能主板,配备双千兆局域网和PCIe 4.0插槽。","已发布",199.99
在完整案例中,Index-Translate-9B 保留表头和两条商品记录;对照输出遗漏了表头,从三行变成两行。对商品资料、多语言字幕或产品文档,这样的结构要求会直接影响译文能否接入后续流程。
网络热梗也要翻出原来的意思
社交内容里的谐音、简称和调侃,常常需要结合社区语境理解。下面三个中译英案例来自官网展示,保留了模型的实际输出。
你好结芬
原文是“那个,你好,结芬”,后面跟着一个表情占位符。这里的“结芬”是“结婚”的俏皮写法,表达玩笑式求婚。
| 输出 | 译文 |
|---|---|
| Index-Translate-9B | Um, hi, let's get married <EMOTE-placeholder-0> |
| Index-Translate-2B | Um, hi there, let's get married<EMOTE-placeholder-0> |
| 对照输出 | Um, hello, Jie Fen <EMOTE-placeholder-0> |
Index 将“结芬”转成了 “let's get married”,保留了原来的玩笑。对照输出中的 “Jie Fen” 则把它理解成了人名。
狒瘾犯了就去打
在这个游戏社区样本中,“狒瘾”指想玩《最终幻想 XIV》的劲头又上来了。
| 输出 | 译文 |
|---|---|
| Index-Translate-9B | When the FFXIV itch hits, just go play. |
| Index-Translate-2B | Go play when my FFXIV addiction kicks in. |
| 对照输出 | If you get monkey addiction, go fight. |
“FFXIV” 点明游戏,“itch hits” 表达了想玩的冲动。若把“狒”理解为动物,整句就会偏离原意。
红红火火恍恍惚惚
原文“Fuyuan Flower红红火火恍恍惚惚”出现在弹幕中。“红红火火恍恍惚惚”的拼音首字母都是 h,在这里承担了“哈哈哈哈”的表达功能。
| 输出 | 译文 |
|---|---|
| Index-Translate-9B | Fuyuan Flower: Hahahahaha, this is wild! |
| 对照输出 | Fuyuan Flower—red-hot and thriving, hazy and wavy. |
Index 的译文保留了笑声和调侃语气。把两个词组逐字译成“红火”和“恍惚”,就很难让英文读者感受到同样的情绪。
更多术语、格式和社区表达案例,可在 Index-Translate 文本 Demo 中体验 👇
Index-Translate 文本 Demo:
https://index-translate.bilibili.com/?p=/site/translate.html&lang=zh
Index-Homura按目标音节调整译文
视频配音要考虑一句话能否在镜头留出的时间里说完。Index-Homura 接受目标音节数,在翻译时调整措辞和长度,为后续配音提供可控的文本。
官网的旅游解说案例,原文是:“生活两天,是一种什么体验”。给同一句话设置三档目标,Index-Homura-9B 输出如下。
| 目标音节数 | 实际音节数 | 英文译文 |
|---|---|---|
| 10 | 10 | to live for two days. What would that be like? |
| 14 | 14 | What would it be like to live there for two days, I wonder? |
| 18 | 18 | What would it be like to live there for two days, trying to get by somehow? |
从短句切分,到加入 “I wonder”,再到更长的表达,模型会随音节预算重组句子。这个案例的三档输出都精确命中了目标;同场对照的三档输出分别为 8、9、9 个音节,长度随要求变化较小。
在 SandGlass 的 3,600 条测试案例中,Index-Homura-9B 有 81.92% 的输出与目标音节数偏差不超过 10%。音节控制为配音长度适配提供了一个调节手段,最终时长仍会受到语速、停顿和语音生成方式影响。
体验 Index-Homura 音节可控翻译:
https://index-translate.bilibili.com/?p=/site/syllable.html&lang=zh
Index-NativeLong 让长文前后连贯
一本书里的人物、术语和概念会反复出现。Index-NativeLong 采用原生长文档翻译方式,一次输入全文并连续生成译文,利用更长的上下文维持前后联系。
同一位导师翻到后面仍然是同一个人
官网展示了一篇约 32K tokens 的游戏奇幻文本。前文明确出现“王妃导师”,后文还有学院、办公室等情节。在这里,“王妃”是人物姓名。
| 原文中的位置 | Index-NativeLong-9B原生全文 | 分块对照(自动词表) |
|---|---|---|
| 约 31.3% | Mentor Wang Fei | Instructor Wangfei |
| 约 56.6% | Wang Fei | the Dean |
| 约 84.8% | Wang Fei | The Queen Consort |
上表摘录对应译文中的称呼,位置按原文字符计算。前两种拼写中有没有空格,并不影响人物身份;后续变成“院长”和“王后”,才是需要解决的问题。原生全文译文在这几处持续保留了 Wang Fei。
该组原生全文与分块对照采用同一模型;分块对照使用带相邻上下文和自动词表的 TranslateBooksWithLLMs 流程。官网也展示了加入高质量外部词表后修复这个人名的结果;本例体现的是原生全文在无需额外词表时保持一致的能力。
术语一致还要分清概念层级
另一篇约 38K tokens 的冰川史文本同时使用了 “ice age”“glacials” 和 “interglacials”。作者明确区分:整个寒冷时期包含冰川推进和退缩的不同阶段。
| 概念 | Index-NativeLong-9B原生全文 | 分块对照 |
|---|---|---|
| ice age 整体事件 | 冰河时代 | 冰期 |
| glacials 内部寒冷阶段 | 冰期 | 冰期 |
| interglacials 内部温暖阶段 | 间冰期 | 间冰期 |
原生译文保留了“冰河时代”与其内部“冰期/间冰期”的层级。对照中的两个层级都被写成“冰期”,容易让读者混淆概念。这也说明,长文翻译除了统一词语,还需要理解词语在全文中的关系。
量化评测覆盖 GuoFeng、BWB、Books 三组数据,以及按中文侧 token 数划分的 4K 至 64K 五个长度档位。Index-NativeLong-9B 在技术报告所列模型中,三组数据的五档平均得分均为最高。
上面的案例展示具体长文中的表现,完整设置与结果可在官网长文档评测中查看 👇
官网长文档评测:
https://index-translate.bilibili.com/?p=/site/home.html#nailong-benchmark-title
体验 Index-NativeLong 长文档翻译:
https://index-translate.bilibili.com/?p=/site/doc.html&lang=zh
怎样评估这些翻译能力
除 FLORES、WMT 等通用翻译评测外,我们也关注翻译在真实使用中的要求。图 1 将相关结果汇总为七个维度;具体任务则分别衡量翻译质量、约束遵循和跨文化表达等能力。
instTrans 译得好也要遵守要求
instTrans 关注带指令的翻译,覆盖 10 类约束,包括术语、格式、保留内容和表达风格等。它包含 3,000 条中文到 20 种语言的任务,另有 2,793 条面向低资源语言的任务。评测分别观察译文质量和指令遵循程度,避免把“文字通顺”与“要求执行到位”混为一个分数。
小语种 翻译质量与指令遵循一起看
FLORES_minor_pair 检验小语种通用翻译,instTrans_minor 检验小语种指令遵循。
35B-A3B(preview)在 FLORES_minor_pair 上的 COMET-22 / XCOMET-XXL 为 0.8168 / 0.7164,输出语言偏离目标的比例为 2.4%;
9B 在 instTrans_minor 上的 IFscore 为 0.7725。完整结果还分别报告翻译质量与语言偏离比例,便于观察不同能力的表现。
MEME 能否传达梗意与文化语境
MEME 面向社区文化表达,包含 3,638 条中译英样例,覆盖 703 个词语和 857 个区分后的词义,同时关注含义、自然度与文化语境。前文的“结芬”“狒瘾”和大笑弹幕,展示的正是这类翻译问题。
针对配音文本的长度控制,我们使用 SandGlass;针对长文档,则分别评估不同文体和长度。以下是文本模型的部分结果。
| 模型 | FLORES | instTrans指令遵循 | MEME |
|---|---|---|---|
| Index-Translate-2B | 0.8655 | 0.7569 | 0.6443 |
| Index-Translate-9B | 0.8789 | 0.8209 | 0.7387 |
| Index-Translate-35B-A3B (preview) | 0.8794 | 0.8336 | 0.7405 |
| Hy-MT2-7B | 0.8747 | 0.6079 | 0.5139 |
| GPT-5.6-Sol | 0.8650 | 0.7624 | 0.7194 |
FLORES 列为 COMET-22,instTrans 列为 IFscore,MEME 列为翻译质量评分,均为越高越好;不同列不宜直接比较。35B-A3B 为报告中的预览评测结果。
不同任务各有侧重,例如 GPT-5.6-Sol 在报告的 WMT26 和 instTrans 翻译质量指标上仍有更高得分。
在线体验
从文本与社区表达,到视频字幕、配音和长文档,Index-Translate 希望让更多内容以适合目标读者和观众的方式跨越语言。
欢迎进入 Demo 主页体验四类翻译能力,或通过 GitHub 与 ModelScope 了解项目和模型。
- Demo主页:https://index-translate.bilibili.com/
- Github:https://github.com/bilibili/Index-Translate
- ModelScope:
https://www.modelscope.cn/collections/IndexTeam/Index-Translate
文中案例与视频来自 Index-Translate 官方 Demo,量化结果结合《Index-Translate: A Multilingual Translation Model Family》技术报告
案例均对应具体测试样本;完整模型对照、任务设置和原始分数见官网
更多推荐




所有评论(0)