翻译不是把词换成另一种语言,而是把意思用另一种语言重新表达。智能体翻译管线的核心是"多步协作+质量把关"。
机器翻译已经发展了几十年,从早期的规则翻译到统计翻译,再到现在的神经网络翻译。大语言模型的出现让翻译质量有了质的飞跃,但也带来了新的挑战:如何让智能体翻译既有机器的效率,又有人工的精准。
一个成熟的智能体翻译管线不是"输入原文→输出译文"的一步到位,而是多阶段流水线:
原文输入
↓
[阶段1: 预处理] — 分段、术语识别、上下文标注
↓
[阶段2: 初译] — 逐段翻译
↓
[阶段3: 审校] — 语法、语义、术语一致性检查
↓
[阶段4: 润色] — 目标语言的自然度优化
↓
[阶段5: 终审] — 整体连贯性和格式检查
↓
译文输出
每个阶段由专门的智能体处理,前一个阶段的输出是后一个阶段的输入。
预处理是常被忽略但非常关键的环节。
长文本需要分段翻译。分段不只是按字数切割:
分段时记录每段在原文中的位置,方便最终合并。
提取原文中的专业术语,建立术语表:
原文: "TTS engine converts text into speech."
术语识别:
- TTS → 语音合成(不翻,保留缩写或翻译为"语音合成")
- engine → 引擎(在IT语境下)
术语表:
TTS → 语音合成
engine → 引擎
speech → 语音
术语表在后续翻译中作为约束输入,确保全文术语一致。
为每段附加上下文信息:
{
"segment_id": 3,
"text": "It supports multiple voices.",
"context": {
"document_type": "product_manual",
"subject": "AI配音工具使用说明",
"previous_segment": "The software is easy to use.",
"target_language": "zh-CN",
"tone": "professional"
}
}
上下文帮助翻译智能体做出正确的歧义消解。
初译智能体的提示词设计:
你是一位专业翻译,从{source_lang}翻译到{target_lang}。
要求:
1. 忠实原文意思,不增不减。
2. 使用术语表中的统一译法。
3. 保持原文的语气和正式程度。
4. 遇到有歧义的句子,选择最可能的含义并在注释中说明。
术语表: {glossary}
上下文: {context}
原文: {source_text}
初译阶段不要追求完美,目标是"准确"而非"优美"。
审校智能体检查初译的问题:
你是一位翻译审校专家。请检查以下翻译对,找出问题:
原文: {source}
译文: {translation}
检查维度:
1. 准确性: 译文是否忠实原文?有无误译、漏译?
2. 术语: 术语是否与术语表一致?
3. 语法: 目标语言语法是否正确?
4. 歧义: 原文有歧义的地方,译文的选择是否合理?
输出格式:
- 问题列表(每条标注位置和类型)
- 修改建议
- 严重程度(高/中/低)
审校智能体只找问题不直接改,修改由人工或下一个智能体完成。这种"审查与修改分离"能避免"自己改自己"的盲区。
润色智能体专注于目标语言的自然度:
你是{target_lang}的母语级文字编辑。请优化以下译文的自然度:
译文: {translation}
优化方向:
1. 消除翻译腔(生硬的直译表达)
2. 调整语序符合目标语言习惯
3. 替换不自然的用词
4. 保持原文语气不变
注意: 只优化表达,不改变意思。如果原文信息有问题,不要自行修正。
润色的边界很重要:只改"怎么说",不改"说什么"。如果润色智能体擅自修改了原文信息,就破坏了翻译的忠实度。
终审是对整篇译文的最后检查:
终审通过后输出最终译文。
翻译管线的质量衡量:
| 指标 | 说明 | 目标值 |
|---|---|---|
| 术语一致率 | 术语表覆盖率 | >95% |
| 漏译率 | 原文内容遗漏比例 | <1% |
| 审校修改率 | 审校阶段发现问题比例 | <15% |
| 人工修改率 | 终稿相对管线输出的修改比例 | <10% |
| 翻译速度 | 每千字处理时间 | <5分钟 |
如果人工修改率超过10%,说明管线某个环节需要优化。分析人工修改的内容类型,针对性地调整对应阶段的提示词。
完全自动化的翻译管线适合大批量、质量要求中等的场景。对于高质量要求的翻译,推荐人机协作:
管线自动完成 阶段1-4 → 人工审校 → 管线终审
人工在阶段3-4之间介入,修改后再由管线做终审。这样既发挥了管线的效率优势,又保证了人工的质量把关。
翻译管线的核心价值不在于替代人工翻译,而在于把人工翻译者从"从零翻译"的体力活中解放出来,专注于审校和润色的创造性工作。