很多追生肉的朋友都有這種經驗:把漫畫截圖丟給一般的翻譯軟體或通用 OCR,出來的文字不但順序錯亂,還把背景的裝飾字、效果音當成台詞一起硬翻,整頁看起來就像一堆毫無邏輯的亂碼。
問題往往不是出在翻譯,而是在翻譯之前。文字一開始就認錯、排錯,後面的翻譯再厲害也救不回來。今天就從技術的角度,拆解漫畫 OCR 背後真正的難點。
如果你想看的是實際操作方法,可以先看這篇:追漫等不到中文版?用 AI 翻譯生肉的實用指南。
先搞懂:OCR 其實是三件事
我們常說的 OCR(光學字元辨識),在漫畫裡其實要完成三件事:
找字(文字偵測): 在整張圖裡找出「哪些地方有字」,框出每一塊文字的位置。
認字(文字辨識): 把每一個框裡的圖像轉成真正的文字。
排序: 決定這些文字要按什麼順序讀。
一般文件的 OCR,第一步和第三步幾乎不用想:字都是橫排、整齊的一行一行,由左到右、由上到下讀就好。但漫畫的三個步驟,每一步都有陷阱。
難點一:直排文字與閱讀順序
日漫的台詞大多是直排,而且整頁是由右往左讀。
直排文字本身,現在的 OCR 大多辨識得出來。真正常出錯的是第三步的排序。一頁漫畫裡可能有十幾個對話框,分散在五、六個分格中。通用工具如果只是按照座標由左到右、由上到下排列,就會變成:
右邊分格的回答,排到左邊分格的問題前面
同一格裡的兩個對話框前後顛倒
跨越兩格的長台詞被拆成兩句,中間插進別人的話
每一句都認對了,連起來卻完全看不懂,這就是「亂碼感」最主要的來源。
要排對順序,AI 得先理解整頁的結構:分格怎麼切、哪個對話框屬於哪一格、每一格的閱讀順序是什麼。這已經不是文字問題,而是一個電腦視覺的問題。
難點二:振假名(注音小字)
日漫的漢字旁邊常常附有小小的讀音,叫做振假名。直排的漫畫裡,它們印在漢字的右側。
振假名對 OCR 造成三個麻煩:
和正文黏在一起: 小字緊貼著正文,很容易被當成同一行一起讀,結果漢字和讀音混成一串。
字太小: 振假名比正文小很多,截圖稍微模糊就糊成一團,還會連帶影響旁邊正文的辨識。
有時意思不一樣: 作者偶爾會寫一個詞、注音卻標另一個詞,例如寫「本気」(認真)卻標「マジ」(口語的「真的假的」),兩層意思都是刻意的。
少年漫畫幾乎每個漢字都有振假名,所以這個問題在熱門作品裡特別常見。
難點三:效果音與手寫字
效果音是漫畫最有特色、也最讓 OCR 頭痛的部分。它們通常:
字體巨大、傾斜、變形,有粗描邊或陰影
直接畫在人物或背景上,和畫面融為一體
有時橫跨兩個分格
文字偵測模型大多是用「整齊的字」訓練的,看到這種字,常常根本不覺得那是文字;就算認出來了,也可能只認到一半。
手寫台詞也是同樣的問題。角色的內心獨白、小聲嘀咕、畫面角落的吐槽,常常是作者手寫的,筆畫不規則,辨識錯誤率明顯比印刷字高。
而且效果音還有一個更根本的問題:要不要翻? 很多效果音是畫面的一部分,硬翻反而破壞畫面。這已經不是技術問題,而是翻譯判斷。
難點四:對話框外的文字
漫畫裡不是所有文字都在對話框裡:
旁白框: 方形框裡的敘事文字
心聲: 沒有框、直接寫在角色旁邊的內心話
背景文字: 招牌、海報、手機畫面、黑板上的字
作者的小註解: 畫面角落的補充說明
這些文字的重要性完全不同。旁白和心聲是劇情的一部分,一定要翻;背景招牌有時是劇情線索,有時只是裝飾。通用 OCR 只會把所有字一視同仁地丟給翻譯,結果重要的台詞和無關的招牌混在一起,讀者更難看懂。
難點五:畫質與網點
漫畫是黑白印刷,大量使用網點(表現灰階的小點圖案)。
網點被當成雜訊: 字寫在網點背景上時,OCR 很難分清楚哪些是筆畫、哪些是點點。
截圖被壓縮: 網路上流傳的圖常被多次壓縮、縮小,細小的字和振假名最先糊掉。
掃描品質參差: 自己掃描的紙本書可能歪斜、有陰影、中間彎曲。
畫質差的圖,OCR 第一步就會漏字或認錯,後面全部跟著錯。
韓漫條漫:另一種難
韓國條漫是橫排、由上往下讀,閱讀順序反而比日漫單純。它的難點在別的地方:一話可能是一條幾萬像素長的圖,必須切開來處理,而對話框很容易剛好被切成兩半。詳細可以看:韓漫機翻怎麼做?韓文網漫翻譯完整指南(2026)。
五大難點一覽
難點 | 出錯的步驟 | 讀者看到的結果 |
|---|---|---|
直排與閱讀順序 | 排序 | 問答顛倒、台詞被拆開 |
振假名 | 找字、認字 | 漢字和讀音混成一串 |
效果音與手寫字 | 找字、認字 | 漏翻,或翻出莫名其妙的字 |
對話框外的文字 | 找字、排序 | 台詞和招牌混在一起 |
畫質與網點 | 找字、認字 | 漏字、認錯字 |
專門的漫畫 OCR 怎麼解決
要真正看懂一頁漫畫,AI 不能把圖片當成「一堆字」來讀,而要先理解版面:
先看結構: 偵測分格和對話框的位置,理解整頁的版面。
再排順序: 依照漫畫的閱讀方向,決定分格和對話框的先後。
分類文字: 區分台詞、旁白、心聲、效果音和背景文字,決定哪些要翻、怎麼翻。
最後才認字: 針對直排、振假名、手寫字等不同類型分別處理。
OCR 之後,還有翻譯、修圖、嵌字三個步驟,每一步各自的工作可以看這篇:韓漫機翻到底在做什麼?OCR、翻譯、修圖、嵌字四個步驟。
讀者可以怎麼做
就算用專門的工具,下面幾件事也能讓結果更好:
盡量用原始畫質: 正版電子書的檔案比網路截圖清楚得多。
翻得怪的地方先看原圖: 多半是手寫字、效果音或振假名的位置,確認那幾格就好。
效果音看不懂可以先跳過: 它們很少影響劇情理解。
結語
機翻漫畫看起來像亂碼,問題通常不在翻譯本身,而在翻譯之前:字有沒有找對、認對、排對。漫畫本地化是一場結合電腦視覺和閱讀順序重建的挑戰,這也是一般翻譯軟體很難處理好漫畫的原因。
如果你也常被生肉的亂碼和排版困擾,可以試試專為漫畫打造的 AI Manga Translator,看看先理解版面、再翻譯的效果有什麼不同。