AI Manga Translator

為什麼有些機翻漫畫看起來像亂碼?帶你拆解 AI 漫畫 OCR 的技術難點

機翻漫畫為什麼常常順序錯亂、滿頁亂碼?從找字、認字、排序三個步驟,拆解漫畫 OCR 的五大難點:直排與閱讀順序、振假名、效果音與手寫字、對話框外的文字,以及畫質。

很多追生肉的朋友都有這種經驗:把漫畫截圖丟給一般的翻譯軟體或通用 OCR,出來的文字不但順序錯亂,還把背景的裝飾字、效果音當成台詞一起硬翻,整頁看起來就像一堆毫無邏輯的亂碼。

問題往往不是出在翻譯,而是在翻譯之前。文字一開始就認錯、排錯,後面的翻譯再厲害也救不回來。今天就從技術的角度,拆解漫畫 OCR 背後真正的難點。

如果你想看的是實際操作方法,可以先看這篇:追漫等不到中文版?用 AI 翻譯生肉的實用指南。

先搞懂:OCR 其實是三件事

我們常說的 OCR(光學字元辨識),在漫畫裡其實要完成三件事:

  1. 找字(文字偵測): 在整張圖裡找出「哪些地方有字」,框出每一塊文字的位置。

  2. 認字(文字辨識): 把每一個框裡的圖像轉成真正的文字。

  3. 排序: 決定這些文字要按什麼順序讀。

一般文件的 OCR,第一步和第三步幾乎不用想:字都是橫排、整齊的一行一行,由左到右、由上到下讀就好。但漫畫的三個步驟,每一步都有陷阱。

難點一:直排文字與閱讀順序

日漫的台詞大多是直排,而且整頁是由右往左讀。

直排文字本身,現在的 OCR 大多辨識得出來。真正常出錯的是第三步的排序。一頁漫畫裡可能有十幾個對話框,分散在五、六個分格中。通用工具如果只是按照座標由左到右、由上到下排列,就會變成:

  • 右邊分格的回答,排到左邊分格的問題前面

  • 同一格裡的兩個對話框前後顛倒

  • 跨越兩格的長台詞被拆成兩句,中間插進別人的話

每一句都認對了,連起來卻完全看不懂,這就是「亂碼感」最主要的來源。

要排對順序,AI 得先理解整頁的結構:分格怎麼切、哪個對話框屬於哪一格、每一格的閱讀順序是什麼。這已經不是文字問題,而是一個電腦視覺的問題。

難點二:振假名(注音小字)

日漫的漢字旁邊常常附有小小的讀音,叫做振假名。直排的漫畫裡,它們印在漢字的右側。

振假名對 OCR 造成三個麻煩:

  • 和正文黏在一起: 小字緊貼著正文,很容易被當成同一行一起讀,結果漢字和讀音混成一串。

  • 字太小: 振假名比正文小很多,截圖稍微模糊就糊成一團,還會連帶影響旁邊正文的辨識。

  • 有時意思不一樣: 作者偶爾會寫一個詞、注音卻標另一個詞,例如寫「本気」(認真)卻標「マジ」(口語的「真的假的」),兩層意思都是刻意的。

少年漫畫幾乎每個漢字都有振假名,所以這個問題在熱門作品裡特別常見。

難點三:效果音與手寫字

效果音是漫畫最有特色、也最讓 OCR 頭痛的部分。它們通常:

  • 字體巨大、傾斜、變形,有粗描邊或陰影

  • 直接畫在人物或背景上,和畫面融為一體

  • 有時橫跨兩個分格

文字偵測模型大多是用「整齊的字」訓練的,看到這種字,常常根本不覺得那是文字;就算認出來了,也可能只認到一半。

手寫台詞也是同樣的問題。角色的內心獨白、小聲嘀咕、畫面角落的吐槽,常常是作者手寫的,筆畫不規則,辨識錯誤率明顯比印刷字高。

而且效果音還有一個更根本的問題:要不要翻? 很多效果音是畫面的一部分,硬翻反而破壞畫面。這已經不是技術問題,而是翻譯判斷。

難點四:對話框外的文字

漫畫裡不是所有文字都在對話框裡:

  • 旁白框: 方形框裡的敘事文字

  • 心聲: 沒有框、直接寫在角色旁邊的內心話

  • 背景文字: 招牌、海報、手機畫面、黑板上的字

  • 作者的小註解: 畫面角落的補充說明

這些文字的重要性完全不同。旁白和心聲是劇情的一部分,一定要翻;背景招牌有時是劇情線索,有時只是裝飾。通用 OCR 只會把所有字一視同仁地丟給翻譯,結果重要的台詞和無關的招牌混在一起,讀者更難看懂。

難點五:畫質與網點

漫畫是黑白印刷,大量使用網點(表現灰階的小點圖案)。

  • 網點被當成雜訊: 字寫在網點背景上時,OCR 很難分清楚哪些是筆畫、哪些是點點。

  • 截圖被壓縮: 網路上流傳的圖常被多次壓縮、縮小,細小的字和振假名最先糊掉。

  • 掃描品質參差: 自己掃描的紙本書可能歪斜、有陰影、中間彎曲。

畫質差的圖,OCR 第一步就會漏字或認錯,後面全部跟著錯。

韓漫條漫:另一種難

韓國條漫是橫排、由上往下讀,閱讀順序反而比日漫單純。它的難點在別的地方:一話可能是一條幾萬像素長的圖,必須切開來處理,而對話框很容易剛好被切成兩半。詳細可以看:韓漫機翻怎麼做?韓文網漫翻譯完整指南(2026)。

五大難點一覽

難點

出錯的步驟

讀者看到的結果

直排與閱讀順序

排序

問答顛倒、台詞被拆開

振假名

找字、認字

漢字和讀音混成一串

效果音與手寫字

找字、認字

漏翻,或翻出莫名其妙的字

對話框外的文字

找字、排序

台詞和招牌混在一起

畫質與網點

找字、認字

漏字、認錯字

專門的漫畫 OCR 怎麼解決

要真正看懂一頁漫畫,AI 不能把圖片當成「一堆字」來讀,而要先理解版面:

  1. 先看結構: 偵測分格和對話框的位置,理解整頁的版面。

  2. 再排順序: 依照漫畫的閱讀方向,決定分格和對話框的先後。

  3. 分類文字: 區分台詞、旁白、心聲、效果音和背景文字,決定哪些要翻、怎麼翻。

  4. 最後才認字: 針對直排、振假名、手寫字等不同類型分別處理。

OCR 之後,還有翻譯、修圖、嵌字三個步驟,每一步各自的工作可以看這篇:韓漫機翻到底在做什麼?OCR、翻譯、修圖、嵌字四個步驟。

讀者可以怎麼做

就算用專門的工具,下面幾件事也能讓結果更好:

  • 盡量用原始畫質: 正版電子書的檔案比網路截圖清楚得多。

  • 翻得怪的地方先看原圖: 多半是手寫字、效果音或振假名的位置,確認那幾格就好。

  • 效果音看不懂可以先跳過: 它們很少影響劇情理解。

結語

機翻漫畫看起來像亂碼,問題通常不在翻譯本身,而在翻譯之前:字有沒有找對、認對、排對。漫畫本地化是一場結合電腦視覺和閱讀順序重建的挑戰,這也是一般翻譯軟體很難處理好漫畫的原因。

如果你也常被生肉的亂碼和排版困擾,可以試試專為漫畫打造的 AI Manga Translator,看看先理解版面、再翻譯的效果有什麼不同。

為什麼有些機翻漫畫看起來像亂碼?帶你拆解 AI 漫畫 OCR 的技術難點 | AI漫畫翻譯器