給公務同仁的檔案格式與 OCR 問答。先看三句結論,再依你的情境找問題。
| 格式 | AI 拿到的是什麼 | 實測等待 | 建議 |
|---|---|---|---|
| DOCX | 純文字,直接可讀 | 約 20 至 30 秒開始回應 | 課堂與日常首選 |
| 純文字 PDF | 文字層,平台先抽出文字 | 約 50 秒 | 只能用 PDF 時選這種 |
| 圖片 PDF | 每一頁都是圖,得先 OCR 辨識 | 約 10 分 30 秒 | 盡量避免;不得已就一次一份 |
測試條件:同一組「好公文、壞公文」範例兩份一起上傳,同一句提示詞,同一個波特人。三種檔案都可以在 [ 學員教材 ] 下載,你可以自己重跑一次。
三種東西:文字、圖片、聲音。而且不是每個模型三種都吃。
| 類型 | 吃什麼 | 例子 |
|---|---|---|
| 只吃文字 | 你打的字、貼上的文字、文件裡的文字層 | 多數早期模型、很多輕量地端模型 |
| 文字加圖片 | 除了文字,還能看圖、讀圖上的字 | 商用強模型(如 Claude Sonnet 5)、部分開源模型(如 Gemma 4 31B) |
| 只吃聲音 | 錄音檔、麥克風即時語音 | 語音轉文字模型;美波與波特玩用的不同,見 [ 語音轉文字問答 ] |
你會發現清單裡沒有 PDF。PDF 是一種「排版容器」,裡面可能裝著文字,也可能只裝著圖片。模型看不懂容器本身,只看得懂裡面的東西。
有沒有例外?有極少數商用模型宣稱能直接讀 PDF 的底層結構。但實務上主流做法仍然是「先拆解、再餵給模型」, 而且你在平台上用的是哪一種,你通常不知道。所以把 PDF 當成模型不直接吃的東西來準備資料,永遠不會錯。
因為平台在中間幫你做了一道工,業界叫「解析」(parsing)。流程是這樣:
這道工是獨立於模型的技術。同一個模型,放在解析做得好的平台上跑得快又準;放在沒做好的平台上,可能慢、漏字,甚至卡住。 現在的解析技術常常也是靠另一個「專門看排版的小模型」在幕後幫忙分辨哪裡是表格、哪裡是內文。
| 種類 | 怎麼來的 | 對 AI 來說 |
|---|---|---|
| 文字型 | Word、公文系統直接「另存為 PDF」 | 裡面有文字層,抽出來就能讀,快 |
| 掃描型 | 紙本用掃描器或手機拍進去;或別人傳來的傳真、影印件 | 本質是「包著 PDF 外殼的圖片」,必須 OCR,慢 |
三秒判斷法:用任何 PDF 閱讀器打開,試著用滑鼠拖曳選取一段文字,或按搜尋鍵找一個你看得到的字。 選得起來、搜得到,就是文字型;整頁只能框成一個大方塊、什麼都搜不到,就是掃描型。
公務機關收到的公文很多是掃描型,尤其是外機關來文、附有印章與簽名的那種。這也是為什麼「AI 讀公文很慢」的抱怨特別常見。
回到頁首那張表。同一份內容,三種格式的差距不是幾成,是二十倍。原因在於工作量:
所以在教育訓練現場,我們預設發 DOCX。同樣三分鐘,六十個人用 DOCX 都能跑完看到結果;用圖片 PDF 則全場都在等。
兩種都有「看圖」能力,但差在三件事:
| 面向 | 商用強模型(如 Claude Sonnet 5) | 開源地端模型(如 Gemma 4 31B) |
|---|---|---|
| 看圖認字 | 視覺能力強,整張掃描圖丟進去,多半自己就能把字讀出來 | 能看圖,但遇到傾斜、蓋章、背景髒的掃描件容易漏字或認錯 |
| 能一次讀多長 | 上下文視窗大,整份幾十頁的文字可以一次讀完 | 視窗較小,長文件得切段,切得不好就讀不到全貌 |
| 速度與成本 | 模型大,思考慢一點,還要走網路;按用量計費 | 模型小,在機關內部主機上反應可以很快;不用把資料送出去 |
結論不是「強模型贏」。地端模型的價值在資料不出門,代價是你要幫它把前置工作做好,它才能表現得好。怎麼做,見 [ 第 7 題 ]。
常見的誤會是「模型笨」。更常見的真正原因是它根本沒讀到那一段。
你能做的:長文件先拆章節、一次問一件事、要它「引用原文哪一段」再下結論。文字格式比掃描格式更不容易被切壞,因為切塊時看得到段落結構。
業界有個粗略的經驗:一個 AI 讀文件的系統,前置的文件解析佔七成成敗,模型本身只佔三成。材料沒洗乾淨,再強的模型也是巧婦難為無米之炊。地端模型更是如此。
看任務,不看名氣。
| 任務 | 優先考量 | 建議 |
|---|---|---|
| 例行檢核、格式檢查、摘要 | 快 | 地端模型加上乾淨的文字輸入,通常夠用 |
| 法規交叉比對、長文件找矛盾 | 準 | 強模型,並且要它引用原文 |
| 含個資、未公開、機敏內容 | 資料不出門 | 依機關規定;能在地端做就在地端做,並先做好前置整理 |
不管選哪一種,要進公文、對外發布、當判斷依據的內容,一律回到原始文件核對。這是 [ 三條底線 ] 的第一條,在讀 PDF 這件事上尤其重要。
三個由快到慢的做法,選一個:
第 2 個做法的關鍵是「只做一次」。一份掃描公文每次讓 AI 重新辨識,就是每次都多等十分鐘。
PDF 因為看起來「像一張紙」,反而容易讓人忽略裡面藏了什麼。上傳前請看三件事:
教材裡的公文範例是合成資料,聯絡人與電話在圖片上已經遮蔽,純文字版直接寫「原件已遮蔽」,可以放心拿來練習。
不用相信廣告,準備三份「考卷」丟給它,答案一看便知:
| 考卷 | 放什麼 | 看什麼 |
|---|---|---|
| 結構題 | 雙欄排版、有表格、表格旁有註解的文字型 PDF | 表格的欄位有沒有對齊,第一欄的數字有沒有跟第二欄的文字混在一起 |
| 模糊題 | 有蓋章、有點歪、背景偏灰的掃描件 | OCR 漏了幾個字、錯了幾個字;印章壓到的字有沒有被猜錯 |
| 長文題 | 五十頁的法規或契約,在第四十幾頁埋一條不合理的條款 | 問它「有什麼風險」,看它有沒有真的讀到那一條,還是讀到一半就漏了 |
同一組考卷,換不同模型、不同平台各跑一次,記下時間和錯誤數。這就是一張你自己機關的模型評測表。
會。模型每幾個月換一代,平台的解析技術也在改,今天十分鐘的事情半年後可能變兩分鐘。所以請記住的是原理和倍數關係,不是秒數:
| 頁面 | 用途 |
|---|---|
| [ 實作一:做一個自己的公文助理 ] | 三種格式的公文範例下載與操作步驟 |
| [ 語音轉文字:哪些聲音資料可以用、哪些不能? ] | 另一種輸入:聲音。美波與波特玩用的模型不同 |
| [ 用得安全:三條底線 ] | 什麼能上傳、什麼要核對 |
我們會參考你的意見持續改善教材。
想補充什麼建議嗎?(選填)