大學專業課程專有名詞辨識實測報告
本次實測聚焦於大學專業授課中最棘手的「專有名詞辨識」問題,針對系統內建的「課堂術語自適應機制」進行跨領域驗證。測試涵蓋不同專業領域的大學線上課程,並依照真實課堂的正常授課方式進行。在不預先建立專有名詞庫、不上傳教材、教師無需進行任何額外設定的零設定條件下,系統即可在背景自動理解授課脈絡、掌握課程關鍵術語,並提升不同專業領域中專有名詞、人名、生僻字及中英混用詞彙的辨識能力。
依真實課堂條件進行的實測
本次評估的是即時字幕,而非可離線反覆處理的後製字幕。系統必須在教師持續講授的同時快速輸出結果,只能依據當下已取得的有限資訊判斷專有名詞,無法預先閱讀完整內容,也沒有充裕時間利用後續語句反覆回頭修正,因此更貼近真實課堂中的辨識挑戰。
選取跨領域課程
由 ChatGPT 5.6 隨機挑選 YouTube 平台上 20 門公開且可自由觀看的國立大學線上課程,課程涵蓋不同專業領域,並以中文授課為主。每門課程截取前 5 分鐘作為測試內容,並由人工製作完整的標準逐字稿;每門課程的標準逐字稿平均約為 1,281 字,以維持課程選取與後續評估的客觀性及一致性。
建立術語評估名單
根據每門課程的完整標準逐字稿,由ChatGPT 5.6擔任獨立判官,自動選出30個最具專業領域代表性的關鍵術語。選詞不以出現頻率為主要依據,而是著重於術語的專業性與領域代表性,20門課程合計評估600個術語。
進行零設定即時辨識
依照課程原始速度播放,在不預先建立專有名詞庫、不上傳教材,且教師無需進行任何額外設定的條件下執行即時中文辨識,以呈現教師初次使用系統時的真實體驗。系統僅能根據當下接收到的語音與課堂情境資訊產生字幕。
比對並計算辨識績效
將系統產生的即時字幕與人工標準逐字稿及600個關鍵術語逐一比對,透過專有名詞辨識的Precision、Recall,以及整體字幕的字正確率三項指標,綜合評估系統的即時字幕辨識品質。
20 門課程、專業領域與辨識績效
測試 20 門國立大學線上教材,橫跨自然科學、生命科學、醫藥、商管、人文、設計與資訊科技等領域。為避免揭露個別課程資訊,下表以匿名編號呈現各課程的專有名詞辨識績效。
系統辨識出的專有名詞中,正確結果所占的比例。
專有名詞被系統正確辨識的比例。
| ID | 專業領域 | Precision | Recall | 字正確率 |
|---|---|---|---|---|
| C01 | 理工與自然科學 | 92.00% | 82.14% | 94.95% |
| C02 | 生命科學 | 85.71% | 73.68% | 87.39% |
| C03 | 人文與哲學 | 96.88% | 86.11% | 87.14% |
| C04 | 農業與商管 | 95.45% | 91.30% | 90.81% |
| C05 | 食品與營養 | 91.67% | 83.02% | 95.37% |
| C06 | 中醫與生理 | 100.00% | 79.66% | 94.88% |
| C07 | 設計與創新 | 97.65% | 93.26% | 96.27% |
| C08 | 藥學 | 81.08% | 42.86% | 69.24% |
| C09 | 藥學 | 100.00% | 59.30% | 74.25% |
| C10 | 財務與金融 | 97.14% | 86.08% | 88.93% |
| C11 | 財務與金融 | 95.52% | 83.12% | 96.00% |
| C12 | 行銷與消費 | 95.51% | 92.39% | 91.58% |
| C13 | 文化與傳播 | 100.00% | 86.96% | 89.43% |
| C14 | 會計 | 98.53% | 94.37% | 98.49% |
| C15 | 資訊與程式設計 | 100.00% | 62.71% | 90.18% |
| C16 | 生物與統計 | 93.88% | 69.70% | 88.48% |
| C17 | 人工智慧 | 97.98% | 96.04% | 97.59% |
| C18 | 設計 | 90.74% | 81.67% | 89.62% |
| C19 | 資訊與經濟 | 97.40% | 92.59% | 94.08% |
| C20 | 會計與財務 | 95.38% | 91.18% | 97.38% |
績效評估與結果分析
在 20 個不同領域的即時字幕測試中,專有名詞辨識的 micro Precision 為 95.55%、micro Recall 為 81.92%,macro Precision 為 95.13%、macro Recall 為 81.41%。Micro 與 macro 結果相近,表示整體表現並非由少數文字量較大的課程主導,模型在多數領域均維持較高的專有名詞精確率;換言之,字幕一旦輸出某個專有名詞,通常能夠完整辨識正確。
Recall 約落後 Precision 13 至 14 個百分點,顯示主要錯誤來源並非大量產生錯誤術語,而是漏失或未完整輸出標準答案中的專有名詞。這也反映即時字幕的核心挑戰:系統必須在有限延遲內完成辨識,無法像後製字幕一樣充分利用完整前後文反覆修正;此外,原始課程影片的收音品質、背景雜音、音量穩定度、講者與麥克風的距離及發音清晰度,也會直接影響辨識結果。
C08 領域邊界案例:藥物動力學
C08 是 20 門課程中辨識難度最高的領域邊界案例,其專有名詞 Precision 為 81.08%、Recall 為 42.86%,字正確率為 69.24%。在 70 次標準術語出現中,系統完整命中 30 次,另有 40 次未完整命中與 7 次錯誤輸出。此結果明顯低於其餘多數課程,屬於特定領域詞彙組成造成的離群表現,不能直接代表系統在一般專業課堂中的整體能力。
錯誤型態高度集中於低頻英文藥名、符號縮寫、醫療實驗術語。例如「微透析」出現 4 次,僅命中 1 次。其他未完整命中的項目亦多屬藥理學低頻實體或專業縮寫。
這種結果高度符合底層通用 ASR 對低頻醫藥詞彙與特殊縮寫涵蓋不足時的典型特徵:若語音辨識階段未產生正確候選字串,後續情境判斷便缺乏足夠依據。系統為維持較高 Precision,不會在證據不足時任意替換成醫藥名詞,因此錯誤主要表現為未完整輸出,而不是大量生成錯誤術語,並直接反映在較低的 Recall。
此分析顯示,C08 的主要改善方向在於建立課程專屬名詞庫。系統提供領域詞彙自行輸入功能,教師可預先加入低頻藥名、專業縮寫與特定術語,協助系統在即時辨識時正確判斷。本報告因此將 C08 視為零設定條件下的領域邊界測試,用以呈現系統現況及明確可行的改善方向。
教師預先輸入關鍵詞的增益實驗
為驗證教師於課前自行輸入課程關鍵詞,是否能有效提升即時字幕的辨識表現,本研究另進行「預先匯入關鍵詞」實驗。實驗中,將前述每門課程的 30 個已知評估術語,視為教師於授課前自行輸入的課程專屬關鍵詞。
這項測試的目的不是宣稱系統能事先知道課程內容,而是模擬實際使用情境:教師若已掌握當週教材中的重要術語、人名、英文縮寫或低頻專業詞彙,可在課前透過關鍵詞輸入介面提供提示;系統於啟動辨識時載入這些詞彙,增加相關候選詞在即時辨識中的辨識機會。
| 評估指標 | 未匯入關鍵詞 | 匯入 600 詞 | 變化 |
|---|---|---|---|
| Micro Precision | 95.55% | 93.12% | -2.43 |
| Micro Recall | 81.92% | 86.82% | +4.90 |
| Macro Recall | 81.41% | 86.62% | +5.22 |
| 字正確率 | 90.70% | 91.39% | +0.69 |
變化單位:百分點
Recall 明顯提升
Micro Recall 由 81.92% 提高至 86.82%,增加 4.90 個百分點;Macro Recall 由 81.41% 提高至 86.62%,依原始未四捨五入數值計算增加 5.22 個百分點。Micro 與 Macro Recall 同時上升,表示改善並非只集中於少數課程,而是多數課程均能從預先載入關鍵詞中受益。
Precision 小幅下降
Micro Precision 由 95.55% 降至 93.12%,減少 2.43 個百分點。這表示較強的關鍵詞提示雖能減少術語漏失,但也可能使音訊證據不足或發音相近的片段更容易被偏向某個已載入詞彙,因而增加錯誤輸出或不當匹配。
實驗結果說明
整體而言,預先載入 keywords 呈現「提高 Recall 與字正確率,但犧牲部分 Precision」的結果。這並非單純追求越多關鍵詞越好,而是反映關鍵詞提示強度與誤匹配風險之間的平衡。實際部署時,教師可優先輸入低頻、容易誤辨、具課程代表性的詞彙,避免加入過多一般詞;系統亦可進一步依語音相似度與課堂脈絡調整提示權重,在維持高 Precision 的同時獲得 Recall 增益。