返回博客

AI 漫画翻译:OCR 文字识别与排版是如何工作的

2026-08-095 min read

AI 漫画翻译从外面看很简单——上传一页,拿回一张翻译好的图。但在底层,系统必须解决两个真正困难的问题:准确读懂原文(OCR),以及把译文排回画面而不破坏原画(排版)。本文用通俗的方式解释这两件事。

第一步:文字检测与 OCR

系统首先要找到文字在哪里。漫画文字分布在对话框、旁白框和拟声词中——有时竖排、有时横排,还常常压在画面上。检测模型在每段文字周围画出框,然后 OCR(光学字符识别)模型识别每个框里的字,并注意阅读顺序,让从右到左、从上到下的分镜被正确转写。

这比文档 OCR 难得多。漫画页使用风格化字体、手写字形,还有压在复杂背景上的低对比度文字。识别精度设置控制检测器的激进程度:精度越高越能抓住细小或浅色文字,但也可能把背景噪点误判成文字。

第二步:抹字——清除原文

文字被读出后,需要清除原字以便放入译文。系统用周围画面填补文字所在区域——这一过程称为 inpainting(图像修复)。纯白气泡很容易处理;对于直接压在画上的文字,则使用分割 mask 只擦除实际笔画、保留下方画面,目标是擦完后看不出那里曾经有字。

第三步:翻译

提取出的文字被送入翻译模型。源语言可根据字符本身自动检测——带假名的是日语、韩文、中文等——所以通常无需手动指定。译文按行返回,并映射回原来的文字区域。

第四步:译文排版

排版是许多工具翻车的地方。译文长度几乎从不和原文相同:相比日语,英语往往更长,欧洲语言可能还要长。系统必须为每个气泡选择合适字号、自动换行,并遵守阅读方向。文字会溢出时就缩小字号重试,同时保持最小字号以保证可读。

竖排(从右到左)漫画和横排(从左到右)漫画需要不同的排版规则。OCR 根据文本框形状判断阅读方向,排版器遵循该方向,让对话气泡读起来自然。

为什么不同页面效果有差异

  • 图片质量:干净、高分辨率的扫描件给 OCR 更多可识别信息。
  • 气泡形状:拥挤或不规则的气泡更难把文字塞进去。
  • 风格化字形:装饰性拟声词天生难识别也难翻译。
  • 源语言:字符特征明显的文字(日文假名、韩文谚文)比密集中文更容易自动检测。

合理的预期

现代 AI 能给出可读、准确的初稿,非常适合个人阅读和判断一部作品是否值得追。它不能替代你心爱作品的专业人工本地化——但用来补没人翻译的章节,已经是质的飞跃。了解 OCR 和排版的原理,也能帮你挑选更好的图源和设置,直接提升拿到的页面质量。

准备好翻译你的漫画了吗?

免费试用 MangaOCR — 无需信用卡。

立即开始翻译