有道把文档翻译同时做成了面向个人的功能和面向开发者的 API,还单独提供 SaaS 版的文档翻译应用。常见办公格式(PDF、Word、PPT、Excel 等)属于覆盖范围;排版还原程度取决于原文件结构——文字型 PDF 效果好,扫描件和复杂图表需要 OCR 参与,误差明显更大。
文档翻译的体验差异,往往不在翻译质量,而在排版还原。同一个引擎翻同样的内容,给一个 Word 和给一份扫描 PDF,结果完全不是一个档次。
有道提供文档翻译的三种形态
| 形态 | 面向对象 | 入口 |
|---|---|---|
| 客户端内的文档翻译功能 | 个人用户 | 有道翻译桌面端 / App |
| 文档翻译 API | 开发者、企业系统集成 | ai.youdao.com |
| SaaS 文档翻译应用 | 企业办公场景 | 有道智云 SaaS 应用 |
此外智云还单列了 PDF 转 Word 和 PDF 转 Markdown 两个 OCR 类接口——这两个接口的存在,恰好说明「PDF 的结构还原」在工程上是一个独立难题,需要专门的模型处理,而不是翻译引擎顺手就能解决。
排版还原的难度分级
- 最好还原:Word、Markdown、纯文本。结构信息清晰,段落、标题、列表都有明确标记。
- 较好还原:文字型 PDF(可以选中复制文字的那种)。有文本层,位置信息完整。
- 较难还原:PPT。文本框位置固定,译文长度变化后容易溢出框外或字号被压缩。
- 最难还原:扫描版 PDF、图片。没有文本层,必须先 OCR 识别,识别错误会直接传导到译文里。
一个实用技巧:中译英通常会「变长」(英文单词比汉字占更多横向空间),英译中通常会「变短」。做 PPT 翻译时,中译英后文本溢出是高频问题,建议翻完检查每一页的文本框。
三类高危内容
- 数学公式:OCR 对公式的识别本身就困难。智云为此单列了「整题识别(含公式)」接口,说明这是特殊处理的场景,通用文档翻译不保证公式正确。
- 表格:跨页表格、合并单元格容易错行。智云同样单列了「表格识别」接口。
- 图内文字:嵌在图片里的文字(流程图标注、截图)通常不会被文档翻译处理,需要单独用图片翻译。

涉及合同、论文、投标、医疗与法律文件时,机器翻译只能作为初稿。有道自己也保留了「有道人工翻译」(f.youdao.com)这条线,正是因为机器输出在这些场景下不足以直接交付。人工翻译的具体计价方式与交付时效待核实,请在其官网下单页确认。

实拍:有道词典 实际运行界面。
资料来源
- 有道智云 AI 开放平台(文档翻译 API、PDF 转 Word / Markdown、表格识别、整题识别等接口目录)
- 有道人工翻译(f.youdao.com)