波特人教學中心
延伸知識點.學員教材補充——本頁從 [ 實作一:做一個自己的公文助理 ] 延伸出來, 回答「為什麼同一份公文,換個檔案格式,AI 讀起來差了二十倍」。 數字是 2026 年 9 月在平台上的實測,模型與平台會持續更新,請看倍數關係,不要記絕對秒數

AI 讀 PDF 到底快不快、安不安全?

給公務同仁的檔案格式與 OCR 問答。先看三句結論,再依你的情境找問題。

本頁內容
  1. 先講結論
  2. AI 模型到底「吃」什麼?
  3. 那我上傳 PDF 為什麼還是能用?
  4. PDF 有哪兩種?怎麼分辨手上這份是哪一種?
  5. 三種格式到底差多少?
  6. 強模型和地端模型都看得懂圖片,差在哪?
  7. 為什麼長 PDF 特別容易「亂講」?
  8. 用地端模型,怎麼把前置工作做好?
  9. 到底該選強模型還是地端模型?
  10. 手上只有掃描檔,怎麼辦?
  11. 上傳之前要檢查什麼?
  12. 怎麼自己測一個模型讀 PDF 的能力?
  13. 版本落差:這頁的數字會過期嗎?

先講結論

  1. AI 模型不直接讀 PDF。它讀的是文字和圖片。你給它 PDF,平台得先把 PDF 拆成文字或圖片,它才看得到。
  2. 能給文字,就不要給圖片。同一份公文,DOCX 二三十秒就有回應,掃描成圖片的 PDF 要等十分鐘以上。
  3. 先看再送。不管哪種格式,上傳前確認裡面沒有不該出去的東西;掃描檔的黑框遮蔽尤其要親眼確認。
格式AI 拿到的是什麼實測等待建議
DOCX純文字,直接可讀約 20 至 30 秒開始回應課堂與日常首選
純文字 PDF文字層,平台先抽出文字約 50 秒只能用 PDF 時選這種
圖片 PDF每一頁都是圖,得先 OCR 辨識約 10 分 30 秒盡量避免;不得已就一次一份

測試條件:同一組「好公文、壞公文」範例兩份一起上傳,同一句提示詞,同一個波特人。三種檔案都可以在 [ 學員教材 ] 下載,你可以自己重跑一次。

AI 模型到底「吃」什麼?

三種東西:文字、圖片、聲音。而且不是每個模型三種都吃。

類型吃什麼例子
只吃文字你打的字、貼上的文字、文件裡的文字層多數早期模型、很多輕量地端模型
文字加圖片除了文字,還能看圖、讀圖上的字商用強模型(如 Claude Sonnet 5)、部分開源模型(如 Gemma 4 31B)
只吃聲音錄音檔、麥克風即時語音語音轉文字模型(如 Breeze ASR),見 [ 語音安全問答 ]

你會發現清單裡沒有 PDF。PDF 是一種「排版容器」,裡面可能裝著文字,也可能只裝著圖片。模型看不懂容器本身,只看得懂裡面的東西。

有沒有例外?有極少數商用模型宣稱能直接讀 PDF 的底層結構。但實務上主流做法仍然是「先拆解、再餵給模型」, 而且你在平台上用的是哪一種,你通常不知道。所以把 PDF 當成模型不直接吃的東西來準備資料,永遠不會錯。

那我上傳 PDF 為什麼還是能用?

因為平台在中間幫你做了一道工,業界叫「解析」(parsing)。流程是這樣:

  1. 平台收到 PDF,先試著抽文字。抽得到,就把文字交給模型,這一步很快。
  2. 抽不到文字(因為整頁是圖),就把每一頁轉成圖片。
  3. 再對每張圖做 OCR(光學字元辨識),把圖上的字認出來變成文字,或直接把圖丟給看得懂圖的模型。
  4. 最後模型才開始讀。你等的十分鐘,大部分花在第 2、3 步。

這道工是獨立於模型的技術。同一個模型,放在解析做得好的平台上跑得快又準;放在沒做好的平台上,可能慢、漏字,甚至卡住。 現在的解析技術常常也是靠另一個「專門看排版的小模型」在幕後幫忙分辨哪裡是表格、哪裡是內文。

PDF 有哪兩種?怎麼分辨手上這份是哪一種?

種類怎麼來的對 AI 來說
文字型Word、公文系統直接「另存為 PDF」裡面有文字層,抽出來就能讀,快
掃描型紙本用掃描器或手機拍進去;或別人傳來的傳真、影印件本質是「包著 PDF 外殼的圖片」,必須 OCR,慢

三秒判斷法:用任何 PDF 閱讀器打開,試著用滑鼠拖曳選取一段文字,或按搜尋鍵找一個你看得到的字。 選得起來、搜得到,就是文字型;整頁只能框成一個大方塊、什麼都搜不到,就是掃描型。

公務機關收到的公文很多是掃描型,尤其是外機關來文、附有印章與簽名的那種。這也是為什麼「AI 讀公文很慢」的抱怨特別常見。

三種格式到底差多少?

回到頁首那張表。同一份內容,三種格式的差距不是幾成,是二十倍。原因在於工作量:

所以在教育訓練現場,我們預設發 DOCX。同樣三分鐘,六十個人用 DOCX 都能跑完看到結果;用圖片 PDF 則全場都在等。

強模型和地端模型都看得懂圖片,差在哪?

兩種都有「看圖」能力,但差在三件事:

面向商用強模型(如 Claude Sonnet 5)開源地端模型(如 Gemma 4 31B)
看圖認字視覺能力強,整張掃描圖丟進去,多半自己就能把字讀出來能看圖,但遇到傾斜、蓋章、背景髒的掃描件容易漏字或認錯
能一次讀多長上下文視窗大,整份幾十頁的文字可以一次讀完視窗較小,長文件得切段,切得不好就讀不到全貌
速度與成本模型大,思考慢一點,還要走網路;按用量計費模型小,在機關內部主機上反應可以很快;不用把資料送出去

結論不是「強模型贏」。地端模型的價值在資料不出門,代價是你要幫它把前置工作做好,它才能表現得好。怎麼做,見 [ 第 7 題 ]

為什麼長 PDF 特別容易「亂講」?

常見的誤會是「模型笨」。更常見的真正原因是它根本沒讀到那一段

你能做的:長文件先拆章節、一次問一件事、要它「引用原文哪一段」再下結論。文字格式比掃描格式更不容易被切壞,因為切塊時看得到段落結構。

用地端模型,怎麼把前置工作做好?

業界有個粗略的經驗:一個 AI 讀文件的系統,前置的文件解析佔七成成敗,模型本身只佔三成。材料沒洗乾淨,再強的模型也是巧婦難為無米之炊。地端模型更是如此。

  1. 能給 DOCX 就給 DOCX。自己寫的公文、會議紀錄、簽呈,從 Word 直接上傳,不要先轉 PDF 再上傳。
  2. PDF 只給文字型。從系統匯出時選「另存為 PDF」,不要「列印成 PDF」再掃描。
  3. 掃描檔先 OCR 一次,存成文字檔重複用。做法見 [ 第 9 題 ]
  4. 一次一份、一次一件事。不要把十份掃描檔一次全丟,先確定一份跑得順。
  5. 專有名詞先教它。法條名、案號格式、機關簡稱,用勘誤表或在提示詞裡先講,辨識與理解都會準很多。

到底該選強模型還是地端模型?

看任務,不看名氣。

任務優先考量建議
例行檢核、格式檢查、摘要地端模型加上乾淨的文字輸入,通常夠用
法規交叉比對、長文件找矛盾強模型,並且要它引用原文
含個資、未公開、機敏內容資料不出門依機關規定;能在地端做就在地端做,並先做好前置整理

不管選哪一種,要進公文、對外發布、當判斷依據的內容,一律回到原始文件核對。這是 [ 三條底線 ] 的第一條,在讀 PDF 這件事上尤其重要。

手上只有掃描檔,怎麼辦?

三個由快到慢的做法,選一個:

  1. 回頭找文字版。自己機關發的文,公文系統裡一定有原始檔;外機關來文,可以問對方要電子檔。這是最快也最準的。
  2. 讓強模型先幫你轉成文字,存起來重複用。把掃描檔丟給看圖能力強的波特人,請它「逐字轉錄成純文字,不要摘要、不要修改」, 轉完自己對照一遍,存成 DOCX。之後每次要用,都用這份文字檔,不要再讓 AI 重新 OCR 一次。
  3. 真的要直接上傳掃描檔:一次一份、頁數少、解析度夠(文字清楚可讀)、不要歪。跑的時候去做別的事,不要盯著等。

第 2 個做法的關鍵是「只做一次」。一份掃描公文每次讓 AI 重新辨識,就是每次都多等十分鐘。

上傳之前要檢查什麼?

PDF 因為看起來「像一張紙」,反而容易讓人忽略裡面藏了什麼。上傳前請看三件事:

  1. 內容能不能出去。個資、未公開資訊、機敏等級,依機關規定判斷。這與格式無關,是 [ 底線二 ]
  2. 黑框遮蔽有沒有真的遮掉。文字型 PDF 上「畫一個黑色方塊蓋住」,底下的文字通常還在,AI 抽文字的時候照樣讀得到。 真正的遮蔽要把那段文字刪掉,或整頁壓成圖片再蓋。判斷法同 [ 第 3 題 ]:黑框底下如果還能選取到字,就沒遮好。
  3. 有沒有多的東西。附件頁、第二頁以後的簽核流程、檔案屬性裡的作者姓名。一份 PDF 常常不只你看到的那一頁。

教材裡的公文範例是合成資料,聯絡人與電話在圖片上已經遮蔽,純文字版直接寫「原件已遮蔽」,可以放心拿來練習。

怎麼自己測一個模型讀 PDF 的能力?

不用相信廣告,準備三份「考卷」丟給它,答案一看便知:

考卷放什麼看什麼
結構題雙欄排版、有表格、表格旁有註解的文字型 PDF表格的欄位有沒有對齊,第一欄的數字有沒有跟第二欄的文字混在一起
模糊題有蓋章、有點歪、背景偏灰的掃描件OCR 漏了幾個字、錯了幾個字;印章壓到的字有沒有被猜錯
長文題五十頁的法規或契約,在第四十幾頁埋一條不合理的條款問它「有什麼風險」,看它有沒有真的讀到那一條,還是讀到一半就漏了

同一組考卷,換不同模型、不同平台各跑一次,記下時間和錯誤數。這就是一張你自己機關的模型評測表。

版本落差:這頁的數字會過期嗎?

會。模型每幾個月換一代,平台的解析技術也在改,今天十分鐘的事情半年後可能變兩分鐘。所以請記住的是原理和倍數關係,不是秒數:

回到教材

頁面用途
[ 實作一:做一個自己的公文助理 ]三種格式的公文範例下載與操作步驟
[ 麥克風與波會議紀錄,為什麼又安全又好用 ]另一種輸入:聲音。同樣的問題,換成語音轉文字
[ 用得安全:三條底線 ]什麼能上傳、什麼要核對
這篇教學對你有幫助嗎?

我們會參考你的意見持續改善教材。