會議記錄入面,成日都有一種好安靜嘅唔爽。你嗰個講native美式英文嘅同事,攞到一段乾淨、標點齊全嘅文字。而你——中文為母語,講嘢帶少少台灣腔或者廣東腔口音——攞到嘅嗰段,讀落去好似有人隔住幾層牆聽會議噉,斷斷續續。你個名畀人串錯咗三種寫法。「thirteen」變咗「thirty」。成句嘢直情唔見咗。
好容易將呢件事,睇成係自己發音有問題。但事實唔係咁。呢件事,係而家幾乎每一個自動語音辨識(ASR)系統都有嘅、有數得計、有文獻記錄嘅特性,而且落差嘅幅度,比大部分人以為嘅大好多。
落差,用數字講
語音辨識嘅質素,通常用字詞錯誤率(word error rate,WER)嚟表示:即係系統插入、刪走或者串錯嘅字,佔人手謄寫版本嘅百分比。WER 5%,即係二十隻字入面錯一隻——煩,但都讀得明。WER 30%,即係大約三隻字入面錯一隻——去到呢個位,transcript已經唔再係一份記錄,而係一道謎題。
一份2025年評估non-native英文ASR嘅論文(arXiv:2503.06924),就將呢個落差量化咗。喺讀稿情況之下,native speaker嘅WER係8.0%,non-native speaker就去到24.8%——差唔多係三倍錯字,同一份材料都係咁。一旦由讀稿轉去真實對話——有猶豫、有重講、有搶咀——兩邊都會變差:分別大約去到30.7%同33.8%。實際應用嘅benchmark都講緊同一個故事:乾淨native speech加好嘅咪高峰,通常喺2-8%之間;強口音speech喺一個真實房間入面錄,就成日跌落30-50%嗰個範圍。
呢個偏差,喺native英文入面都存在。《JASA Express Letters》(2024)一份同儕審查嘅OpenAI Whisper評估發現,呢個模型辨識美式英文,一直都比英式或者澳洲英文準確,而且準確度會跟講者一世人接觸英文嘅份量而上升。Whisper正正就係你用緊嗰堆轉錄工具(包括機上轉錄工具)背後嘅模型家族——所以呢個唔係邊個廠商特別衰嘅故事。
呢件事嘅風險,遠遠超過『唔方便』咁簡單。一份2026年刊登喺《npj Digital Medicine》嘅研究,專門睇緊醫療語音轉錄入面口音相關嘅錯誤,發現non-native speaker嘅錯誤率明顯高好多——喺一個一個串錯字就可能等於錯劑量嘅場景入面。
點解模型聽你把聲,特別衰
四個機制,解釋咗大部分落差——搞清楚邊啲你有得改,邊啲冇得改,先知道力應該點使。
一、訓練資料本身唔平衡。大型ASR模型,學嘅係網上大量現成嘅聲音:美式podcast、YouTube、美國廣播新聞。呢堆資料入面口音嘅分佈,同你會議入面班人講嘢嘅口音分佈,完全對唔上。模型偏心,唔係因為邊個特登揀咗偏心,而係因為佢聽某種口音,聽咗多過第啲口音一百倍。
二、你母語嘅音位習慣,搬咗去英文度。每一個講者,都會將唔熟悉嘅音,對應去自己母語最接近嘅音。呢一點,台灣同香港嘅英文使用者聽落應該好有共鳴:講中文嘅人講英文,好多時會將尾音輔音簇簡化——「tests」聽落好似同「test」冇分別;台式國語入面常見嘅l/n不分、-ng/-n合流(例如「難」讀成「藍」、「song」讀成「son」),搬過英文之後,一樣會將本身完全兩件唔同嘅字,變到聽落好似一樣。香港粵語使用者,亦有自己嘅一套尾音同送氣習慣,會令模型將某啲輔音當成噪音刪走。呢啲聲音,一個人類聽者用兩秒就適應返晒,但模型冇呢個適應步驟。
三、聲調同語調嘅干擾。母語有聲調嘅講者(粵語有六至九個聲調、國語有四聲),講英文嗰陣,自然會帶埋嗰啲音高輪廓,模型就將呢啲音高變化,錯讀成句子分界或者強調重音。多份評估反覆發現,母語係聲調語言嘅講者,錯字率係眾多語言背景入面最高嗰批之一。呢一點,對台灣同香港嘅英文使用者嚟講尤其中肯,而且解釋咗點解你transcript入面啲標點,有時明明字冇錯,標點都仲係錯得離譜。
四、口語修補嘅隱藏成本。Non-native speaker用第二語言組織句子嗰陣,好合理噉會有更多中途修正——重講、填充詞、自我糾正。模型主要靠流暢、修剪過嘅speech訓練出嚟,處理呢啲修補嗰陣好差,成日連修正之後嗰句啱嘅嘢都一併刪走。呢就係點解錯誤成日集中喺你最長、最重要嗰啲句子,多過短句。
會議記錄入面,實際壞咗嘅係邊啲位
整體WER會遮住個真實傷勢喺邊。真實會議記錄入面,錯誤唔係平均分佈,佢哋會集中喺你最想keep住嗰啲token度:
- 專有名詞。同事、客戶、產品、城市嘅名,係低頻詞,冇乜上下文可以補救。一場會議,一個同事嘅名可以畀人串出四種寫法。
- 數字同單位。Thirteen/thirty、十五/五十,差別淨係一個重音位置,而口音會影響重音。喺講預算或者藥物劑量嘅場合,呢一類錯誤最危險。
- 行內術語。公司內部縮寫同產品代號,根本冇出現過喺訓練資料入面,模型就會攞最接近嘅常見英文字代替。
- 中英夾雜(code-switching)。呢個先係台灣同香港職場英文轉錄嘅真正惡夢。「呢個deadline我哋push一下」、「你件事follow up咗未」、「等我update返個team」——呢種一句入面中英交替嘅講法,係台灣同香港office日常對話嘅常態,而香港仲有一層粵英夾雜(「你嗰個report壓一壓先」)。大部分ASR系統一開始就鎖定咗一種語言處理成份file,遇到呢種夾雜,結果通常係將中文部分變成一堆聽落似英文、但完全冇意義嘅字,或者索性漏聽晒。
- 發言分界。兩個都帶口音嘅speaker一齊搶咀嗰陣,分辨邊句係邊個講嘅功能(diarization)成日會將佢哋撈埋一齊,搞到一句嘢畀人歸錯咗去第個講者度——呢種錯,比直情漏聽仲差。
真正有效嘅修正方法
你冇得重新訓練個模型,但研究講得好清楚:呢個落差,一部分係聲學問題,一部分係設定問題——而呢兩樣,都係你有得控制嘅。大約按效果排落嚟:
- 將咪高峰同你把口嘅距離拉近。呢一項壓晒其他所有嘢。部電話平放喺六個人張枱中間,錄到嘅殘響同錄到嘅speech一樣多;同一部電話,擺高熒幕、放喺軟身嘅嘢上面而唔係一張會反聲嘅硬枱面,同講者距離30-50厘米,錯字率可以大幅拋離。口音偏差同差聲學係會疊加嘅——修好第二樣,先幫你買返啲空間去頂第一樣。
- 明確揀定語言。自動偵測,只不過係靠開頭嗰幾秒聲音去估——而一開口就帶強烈口音、或者中英夾雜嘅第一句,正正就係佢最容易估錯嗰種情況。如果你部工具容許你手動揀語言,就揀。如果你場會議真係中英夾雜,就揀承載主要內容嗰種語言;對台灣同香港嘅會議嚟講,呢一步嘅重要性,比一般英文母語會議大好多——因為系統一估錯開頭嗰句,成段transcript嘅語言假設可能由頭錯到尾。
- 俾佢一份詞彙表。任何支援自訂詞彙、glossary,或者可以喺開始前輸入與會者名單嘅工具,都會用得着呢啲資料。人名同術語,係最值得優先消滅嘅錯誤類別,亦係最容易做嘅一種,因為喺會議開始之前,你已經知道成張清單有邊啲字。
- 重要數字講多次,拆開嚟講一次。「Thirteen——one three。」呢種做法,一場會議裡面覺得有啲煩,但當佢救返你摘要入面一個唔會錯嘅數字,你就會覺得值得。
- 保留原聲,唔好淨係keep住transcript。任何轉錄設定入面,最有用嗰一項功能,係當文字讀落去唔對路嗰陣,可以即刻跳返去嗰個timestamp嘅原聲。一個處理完就唔留低錄音嘅工具,已經拎走咗你唯一嘅校對方法。
- 之後畀個LLM執一execution。《npj Digital Medicine》嗰份研究發現,喺帶口音嘅transcript上面,加多一層語言模型清理,可以救返一部分口音導致嘅錯誤,因為上下文可以補救聲學補唔到嘅嘢。呢個其實就係一個做得好嘅摘要步驟,一直默默幫你做緊嘅事。
貼身錄音,機上轉錄,原聲留低
Meetly係一個建立喺WhisperKit之上嘅iPhone錄音工具,喺你部電話上面直接跑Whisper——即係話,上面講嘅其中幾項修正方法,你唔使做已經有咗。咪高峰喺你手上而唔係隔一張枱、你可以喺90幾種語言入面手動揀語言,而唔係靠自動偵測去估你把口音、而原聲會同transcript一齊留喺部機度,任何一句讀落去唔對路嘅嘢,一tap就跳返去嗰段原聲。乜都唔上傳,即係話你用第二語言(甚至中英夾雜)開嘅會,唔會同時變成一個擺喺人哋伺服器度嘅檔案。
Download Meetly十分鐘之內,用自己把聲測試一個轉錄工具
已發表嘅benchmark,平均出嚟嘅嗰班speaker,唔會啱啱好係你。廠商講嘅準確度,幾乎清一色都係喺乾淨、native口音、讀稿嗰種最易嘅情況下量度出嚟。不如自己做返個測試——一杯咖啡嘅時間,而且呢個先係真正對你有意義嘅數字:
- 寫一段150字嘅稿,入面包含五個同事嘅名、五個公司內部縮寫,同六個數字,其中要有一組thirteen/thirty(或者中文入面容易錯讀嘅數字,例如「十四」同「四十」)。
- 用同一個工具,錄三次:一次喺安靜房間、距離30厘米;一次同一個房間、距離兩米;一次有正常辦公室背景聲。
- 淨係計人名、縮寫、數字入面嘅串錯同漏聽。填充詞唔使理——冇人care漏咗一個「嗯」。
- 用你候選名單入面第二個工具,同一套音頻條件,重複做一次。
- 最後check返個修復路徑:讀到錯字嗰陣,你可以唔可以聽返嗰段原聲?你可以唔可以修正文字之後keep住個改動?
三個距離掃描出嚟嘅結果,通常比兩個工具嘅比較仲令人意外。如果你30厘米嗰個結果冇問題,兩米嗰個變到冇得用,咁問題由頭到尾都唔係你把口音——係嗰張枱。而如果你仲喺度比較緊具體邊隻產品,雲端轉錄同機上轉錄喺呢條『修復路徑』上面嘅分別,絕對值得放埋落決策入面一齊考慮。
台灣同香港最頭痛嘅問題:中英夾雜嘅會議
最難搞嘅場景,根本唔係口音,而係一場一句入面就中英轉換嘅會議——喺台北、香港、蘇黎世、新加坡,呢係辦公室日常嘅正常狀態,唔係例外。「這個deadline我們push一下」、「你嗰份proposal align咗未」、「幫我book個meeting room」,呢啲混合句,係台灣office國語加英文術語、香港office粵語加英文術語嘅日常構句方式。幾乎每一套ASR pipeline,都要求每個檔案揀定一種語言。呢個決定一做,你句中文入面夾住嘅英文詞(或者反過嚟),就會被轉錄成一堆語言錯位、讀落去似有還無嘅字——再點注意咪高峰擺位,都救唔返呢種錯誤。
實際上得兩種做法。一係將錄音切開——語言一轉就停低再開新檔案,呢個做法麻煩,但真係work;一係接受呢份transcript,只不過係一份記憶提示,而唔係一份完整記錄,靠喺佢上面做嘅摘要去補返個意思。揀第二種做法完全合理,前提係你要有意識噉做呢個決定,而唔係一個禮拜之後重讀個檔案先發現。
點解呢件事值得解決,而唔係將就
記憶科學早已講得清清楚楚:冇一份外部記錄,一場對話大部分細節,一日之內就會消失——呢個亦係我哋成篇文專門講「點解你成日唔記得會議講咗啲乜」嘅原因。如果你成日都要用第二語言開會,你會議入面本身就已經負擔緊多一份認知負荷,之後仲要攞住一份更差嘅transcript。呢兩個問題會疊加,而攞埋單嗰個人,通常就係房入面本身已經做緊最辛苦嗰份工嘅人。
呢就係點解咪高峰距離、明確揀語言,同一份人名詞彙表,值得你認真對待嘅真正原因。呢啲唔係發燒友式嘅吹毛求疵;佢哋係一份你可以信得過嘅記錄,同一份你漸漸唔再會打開嘅記錄,兩者之間嘅分別。如果你想由一開始就用一套將咪高峰同語言設定調啱嘅方案,不如直接揀一個機上處理、支援手動揀語言嘅私隱優先錄音工具開始。個模型唔會就住你行多一步。但你嘅設定可以。
一份你可以check返、用返你真正講嘅語言嘅transcript
Meetly喺你部iPhone上面全機錄音、轉錄同摘要:90幾種語言任揀,每份transcript旁邊都keep住原聲,一秒都唔上傳。冇機械人加入你嘅call,唔使開帳戶,冇雲端。如果AI轉錄一直對你嘅結果,悄悄噉比對同事差——尤其你成日開緊中英夾雜嘅會——就由你有得控制嗰兩樣嘢做起:咪高峰,同埋原聲擺喺邊。
Download Meetly常見問題
點解AI轉錄對口音咁差?
主要係訓練資料本身唔平衡。大型語音模型學嘅聲音,大幅偏向美式英文,聽第啲口音嘅次數少好多。加埋母語嘅音位習慣(尾音濁化、輔音簇簡化、加尾元音,例如台式國語常見嘅l/n或者-ng/-n合流),同聲調語言帶嚟嘅音高干擾,會令個聲音偏離模型預期嘅樣。已發表嘅評估顯示,native讀稿嘅字詞錯誤率大約8%,non-native同一份材料就去到大約25%,強口音、有雜音嘅真實對話更會去到30-50%。
Whisper處理non-native英文,做得好唔好?
比大部分工具好,但唔平均。《JASA Express Letters》一份同儕審查嘅評估發現,Whisper辨識美式英文,一直比英式或者澳洲英文準確,而且準確度會隨講者一世人接觸英文嘅程度上升。Whisper嘅多語言訓練,比起淨係識英文嘅模型幫助好大,但口音落差依然量度得到——所以應該將佢當成一個好嘅起點,但仍然需要貼身嘅咪高峰同明確揀定嘅語言。
點樣先可以改善我把口音嘅轉錄準確度?
按影響力排序:將咪高峰同講者嘅距離拉近到大約30-50厘米、手動揀定轉錄語言而唔係靠自動偵測、如果工具支援就俾佢一份人名同術語嘅詞彙表、關鍵數字講多一次(「十三,一三」)、揀一個keep住原聲嘅工具,方便你check任何睇落唔對路嘅地方。喺原始transcript之上加一層LLM清理或者摘要,一樣可以救返一部分口音導致嘅錯誤,因為上下文可以補救聲學補唔到嘅嘢。
會議轉錄嘅字詞錯誤率,幾多先算好?
低過10%,已經係一份真正用得嘅transcript;低過5%,讀落去好似人手打出嚟噉。10%到20%之間,可以做記憶提示,但唔夠格做逐字引用嘅記錄。高過30%——強口音喺一個回聲重嘅房間錄音,好常見去到呢個數——校正呢份transcript所花嘅工夫,已經多過佢幫到你嘅價值。留意廠商講嘅準確度,幾乎全部都係喺乾淨、native口音讀稿呢種最易嘅情況下量度出嚟。
AI可唔可以轉錄一場中英夾雜嘅會議?
好少可以做得好。幾乎所有系統,都要求每個錄音檔揀定一種語言,所以一句中文入面夾住嘅英文詞(或者相反),經常會被轉錄成一堆語言錯位、讀落去似有還無嘅字——呢個係台灣同香港職場最常見嘅日常講法,亦係最容易畀轉錄工具搞亂嘅情況。可靠嘅做法,係喺語言轉換嗰個位切開錄音,每個檔案分開設定自己嘅語言。否則,就將transcript當成一份粗略嘅記憶提示,靠摘要去補返意思。
