波特人教學中心
延伸知識點.學員教材補充——本頁從 [ 四種輸入方式 ][ 實作三:錄音變會議紀錄 ] 延伸出來,回答大家平常沒細想、但長官與政風一定會問的問題: 我對著平台講話、上傳錄音,聲音去了哪裡?

麥克風與波會議紀錄,為什麼又安全又好用?

給公務同仁的語音轉文字問答。依你的使用情境找問題,每題先講結論。

本頁內容
  1. 先講結論
  2. 情境一:輸入框的麥克風
  3. 情境二:波會議紀錄上傳錄音檔
  4. 情境三:用工具解析影片裡的聲音
  5. 為什麼選這個模型
  6. 它的限制,以及你能做什麼

先講結論

  1. 聲音在平台自己的伺服器上轉成文字,不會送到國外的商用雲端語音服務。麥克風輸入、上傳錄音、工具解析影片,三條路走的都是同一個語音核心。
  2. 用的是台灣團隊開源的語音模型。聯發科技研究團隊(MediaTek Research)的 Breeze ASR。國語、台語、英語夾雜著講,它都認得。
  3. 它有三個限制:音質差、腔調太冷門、專有名詞沒學過。前兩個靠收音改善,第三個靠你主動教它(勘誤表)。

為什麼平台要這樣設計?因為這個平台是為公務機關而生的。模型的選用、資料走的路線、功能的取捨,都以「公務資料不出門」為前提。語音是最容易被忽略的一條路,所以特別拿出來講。

情境一:輸入框的麥克風

Q1:我對著輸入框的麥克風講公文或陳情內容,聲音會不會傳到國外雲端?

不會。你按下麥克風講的每一句話,是由平台自己的伺服器上的 Breeze ASR 即時轉成文字,轉完文字才進入輸入框。 過程中聲音不會經過 OpenAI、微軟、Google 這類外部語音服務。這也是為什麼平台不用市面上「最有名」的語音辨識,而用可以完全裝在自己主機上的開源模型。

Q2:講台語、國台語夾雜、中間夾幾個英文字,可以嗎?

可以,這正是選這個模型的原因。Breeze ASR 是用台灣的語音資料調校的,對台灣口音的國語、台語、以及國台英三種夾著講的日常語句,辨識率比一般以英文或中國普通話為主的模型好很多, 也比較不會把「健保卡」「1999」「智慧財產局」這類台灣用語聽成別的東西,或寫成中國用語。

Q3:一般麥克風和閃電麥克風,哪一種比較安全?

兩種一樣安全,走的是同一個語音核心。差別在使用方式:一般麥克風的逐字稿停在輸入框,送出前你可以先校對;閃電麥克風講完直接送出,不能改。 要引法條、報案號、講人名的時候,用一般麥克風,看過再送。詳見教材 [ 四種輸入方式 ]

情境二:波會議紀錄上傳錄音檔

Q4:我們想上傳敏感的專案會議、陳情錄音來做會議紀錄,這個工具的資安層級夠嗎?

錄音檔不離開平台的主機。上傳的 MP3、M4A 等錄音檔,由同一個地端部署的 Breeze ASR 轉成逐字稿,再交給波會議紀錄整理成摘要。 音檔與文字都留在平台自己的伺服器上,不會送到外部語音服務,也不會被拿去訓練別人的模型。

但「平台安全」不等於「什麼都能上傳」。什麼等級的會議可以錄、可以上傳,依機關規定;上傳前先讓與會者知道。這是教材 [ 底線二 ]

Q5:錄音有雜音、有長輩講台語、大家搶著講,效果如何?

比多數模型好,但不是萬能。Breeze ASR 針對台灣在地的語音環境調校過,里民大會、機關內部會議這種「有雜音、有台語、有口音」的錄音,比一般商用模型少很多「聽攏無」的情況。 不過,同時多人講話、離麥克風太遠、錄音壓得太小聲,任何模型都會吃力。怎麼讓它更準,見 [ 限制與你能做的事 ]

Q6:跑完之後,音檔和逐字稿存在哪裡?誰看得到?

留在你自己的對話紀錄裡,別人看不到,除非你用分享連結分享出去。保存多久、要不要刪,依機關的紀錄保存規定辦理;不需要留的對話,用完就刪。 另外提醒:逐字稿是原始依據,摘要是整理過的二手資訊,兩份都要留,見教材 [ 三個容易踩的雷 ]

情境三:用工具解析影片裡的聲音

Q7:在波特玩用 Agent 或自動化流程解析宣導影片、稽查影片,裡面「把聲音抽出來轉文字」這一段安全嗎?會不會有外部授權或付費陷阱?

同一個語音核心,沒有外部計費。不管流程串得多複雜,負責把影片裡的聲音抽出來轉成文字的,還是地端的 Breeze ASR。聲音不會在流程中被送到外部第三方的語音 API。

費用方面也不用擔心。市面上的雲端語音服務多半按「每分鐘錄音」計費,大量解析影片會讓預算失控;Breeze ASR 是開源授權(Apache 2.0),不論解析多少影片,都不會另外產生按分鐘計價的費用。

為什麼選這個模型

Q8:語音辨識模型那麼多,為什麼選聯發科技的 Breeze ASR?

四個理由,每一個都對應公務情境:

理由對公務機關的意義
台灣團隊、台灣語料國語、台語、英語三聲道都認得,台灣的專有名詞與用語不會被寫成中國用語
開源、可地端部署整個模型裝在平台自己的主機上,聲音不用出門
開源授權無按量計費不會因為用量大而預算失控,也不必綁信用卡
可以持續調校機關自己的專有名詞可以透過勘誤表教進去,越用越準

它的限制,以及你能做什麼

Q9:它有什麼限制?

誠實講,三個:

限制什麼情況會遇到怎麼辦
音質離麥克風太遠、環境吵、錄音音量太小、多人同時講改善收音:麥克風放中間、一次一人講、錄前先試錄十秒聽看看
腔調台語腔調太特殊、太冷門,或是它沒學過的語言它已是對台語相對友善的模型之一,但遇到冷門腔調仍可能錯;重要段落人工校對
專有名詞法條名稱、智財局專用術語、案號、人名,訓練資料裡沒見過或很少見主動教它:把常用專有名詞建成勘誤表,它下次就會自動修正

Q10:那我可以做什麼,讓辨識更準?

  1. 收音先做好。會議室的麥克風放在桌子中央,主席控制一次一人發言。錄音品質是所有後續步驟的天花板。
  2. 建一張勘誤表。把你們單位常用的法條、案號格式、人名、單位簡稱整理成一張表,教給波會議紀錄與波公文。糾正一次,往後就少錯一次。
  3. 用一般麥克風的時候,送出前看一眼。特別是數字、案號、人名。
  4. 逐字稿留著。摘要有疑問時回去對原文,這是你能自己核對的依據。

再好的模型也會聽錯。會議紀錄要對外、要當決議依據的,一律回到逐字稿或錄音核對。這是教材 [ 底線一 ],在語音這件事上沒有例外。

回到教材

頁面用途
[ 四種輸入方式(含語音) ]一般麥克風與閃電麥克風怎麼選
[ 實作三:錄音變會議紀錄 ]上傳錄音檔的步驟、格式與長度限制、三個容易踩的雷
[ AI 讀 PDF 到底快不快、安不安全 ]另一種輸入:文件。同樣的問題,換成 PDF 與 OCR
這篇教學對你有幫助嗎?

我們會參考你的意見持續改善教材。