給公務同仁的語音轉文字問答。依你的使用情境找問題,每題先講結論。
為什麼平台要這樣設計?因為這個平台是為公務機關而生的。模型的選用、資料走的路線、功能的取捨,都以「公務資料不出門」為前提。語音是最容易被忽略的一條路,所以特別拿出來講。
不會。你按下麥克風講的每一句話,是由平台自己的伺服器上的 Breeze ASR 即時轉成文字,轉完文字才進入輸入框。 過程中聲音不會經過 OpenAI、微軟、Google 這類外部語音服務。這也是為什麼平台不用市面上「最有名」的語音辨識,而用可以完全裝在自己主機上的開源模型。
可以,這正是選這個模型的原因。Breeze ASR 是用台灣的語音資料調校的,對台灣口音的國語、台語、以及國台英三種夾著講的日常語句,辨識率比一般以英文或中國普通話為主的模型好很多, 也比較不會把「健保卡」「1999」「智慧財產局」這類台灣用語聽成別的東西,或寫成中國用語。
兩種一樣安全,走的是同一個語音核心。差別在使用方式:一般麥克風的逐字稿停在輸入框,送出前你可以先校對;閃電麥克風講完直接送出,不能改。 要引法條、報案號、講人名的時候,用一般麥克風,看過再送。詳見教材 [ 四種輸入方式 ]。
錄音檔不離開平台的主機。上傳的 MP3、M4A 等錄音檔,由同一個地端部署的 Breeze ASR 轉成逐字稿,再交給波會議紀錄整理成摘要。 音檔與文字都留在平台自己的伺服器上,不會送到外部語音服務,也不會被拿去訓練別人的模型。
但「平台安全」不等於「什麼都能上傳」。什麼等級的會議可以錄、可以上傳,依機關規定;上傳前先讓與會者知道。這是教材 [ 底線二 ]。
比多數模型好,但不是萬能。Breeze ASR 針對台灣在地的語音環境調校過,里民大會、機關內部會議這種「有雜音、有台語、有口音」的錄音,比一般商用模型少很多「聽攏無」的情況。 不過,同時多人講話、離麥克風太遠、錄音壓得太小聲,任何模型都會吃力。怎麼讓它更準,見 [ 限制與你能做的事 ]。
留在你自己的對話紀錄裡,別人看不到,除非你用分享連結分享出去。保存多久、要不要刪,依機關的紀錄保存規定辦理;不需要留的對話,用完就刪。 另外提醒:逐字稿是原始依據,摘要是整理過的二手資訊,兩份都要留,見教材 [ 三個容易踩的雷 ]。
同一個語音核心,沒有外部計費。不管流程串得多複雜,負責把影片裡的聲音抽出來轉成文字的,還是地端的 Breeze ASR。聲音不會在流程中被送到外部第三方的語音 API。
費用方面也不用擔心。市面上的雲端語音服務多半按「每分鐘錄音」計費,大量解析影片會讓預算失控;Breeze ASR 是開源授權(Apache 2.0),不論解析多少影片,都不會另外產生按分鐘計價的費用。
四個理由,每一個都對應公務情境:
| 理由 | 對公務機關的意義 |
|---|---|
| 台灣團隊、台灣語料 | 國語、台語、英語三聲道都認得,台灣的專有名詞與用語不會被寫成中國用語 |
| 開源、可地端部署 | 整個模型裝在平台自己的主機上,聲音不用出門 |
| 開源授權無按量計費 | 不會因為用量大而預算失控,也不必綁信用卡 |
| 可以持續調校 | 機關自己的專有名詞可以透過勘誤表教進去,越用越準 |
誠實講,三個:
| 限制 | 什麼情況會遇到 | 怎麼辦 |
|---|---|---|
| 音質 | 離麥克風太遠、環境吵、錄音音量太小、多人同時講 | 改善收音:麥克風放中間、一次一人講、錄前先試錄十秒聽看看 |
| 腔調 | 台語腔調太特殊、太冷門,或是它沒學過的語言 | 它已是對台語相對友善的模型之一,但遇到冷門腔調仍可能錯;重要段落人工校對 |
| 專有名詞 | 法條名稱、智財局專用術語、案號、人名,訓練資料裡沒見過或很少見 | 主動教它:把常用專有名詞建成勘誤表,它下次就會自動修正 |
再好的模型也會聽錯。會議紀錄要對外、要當決議依據的,一律回到逐字稿或錄音核對。這是教材 [ 底線一 ],在語音這件事上沒有例外。
| 頁面 | 用途 |
|---|---|
| [ 四種輸入方式(含語音) ] | 一般麥克風與閃電麥克風怎麼選 |
| [ 實作三:錄音變會議紀錄 ] | 上傳錄音檔的步驟、格式與長度限制、三個容易踩的雷 |
| [ AI 讀 PDF 到底快不快、安不安全 ] | 另一種輸入:文件。同樣的問題,換成 PDF 與 OCR |
我們會參考你的意見持續改善教材。
想補充什麼建議嗎?(選填)