豐道
← 回知識專區
翻譯・逐字稿

逐字稿怎麼做最划算?AI 與人工的真實差異比較(含價格與委託流程)

豐道團隊・發布 2026-06-12・更新 2026-07-11

TL;DR:純 AI 逐字稿快又便宜,但正確率天花板卡在專有名詞和多人對話這兩個罩門;人工精校正確率最高,單價也最高。對質性研究、正式會議紀錄與要對外的稿子,甜蜜點是「AI 初稿+人工校對」,用 AI 吃掉最耗時的前段聽打,再讓人力集中在校對與語者標記,速度與正確率一起顧到。

逐字稿看起來是件小事,把說出來的話變成文字而已。真正做過的人都知道,卡點從來不在「打字」,而在聽不清楚的那幾秒、兩位發言者搶話的那一段、還有那個怎麼聽都拼不出來的專有名詞。這篇把 AI 與人工的差異拆開講清楚,也把該怎麼選、怎麼委託、怎麼驗收一次說完。

三種做法,三種結果

市面上的逐字稿服務,本質上就是這三種,差別在於「機器做多少、人做多少」:

比較項純 AIAI 初稿+人工校對純人工精校
速度分鐘級數個工作天較長(人工數倍工時起)
正確率中等,受音質影響大人工逐句把關後大幅提升最高
多人對話易混淆語者人工回聽重新標記精確標記
專有名詞常錯認校對時逐一修正最準
適合場景自用、抓重點論文、正式紀錄法律、出版
市場價格帶每分鐘數元/月費制豐道約 15 元/分鐘中文人工市場約 20–40 元/分鐘(豐道同此帶)

要注意的是,這張表裡的「正確率」不是一個固定數字,而是跟著音質浮動。同一套 AI 引擎,錄音清楚的單人演講可以做得很漂亮,換成咖啡廳裡三人邊吃邊聊的錄音,正確率會直接掉一個檔次。這也是為什麼負責任的報價一定要先聽樣本,而不是報一個放諸四海的價格。想了解按分鐘計價背後有哪些變數,可以看逐字稿費用怎麼算的完整拆解

AI 逐字稿的三個罩門

AI 這幾年進步很快,快到很多人以為人工聽打要被淘汰了。但實際交付過就會發現,AI 卡住的地方非常固定,而且這三個罩門剛好都是嚴肅用途最在意的。

罩門一:同音字與專有名詞

這是最隱蔽、也最傷的一種錯。AI 語音辨識的底層是機率模型,它把聽到的聲音對應到訓練資料裡「最常出現」的字詞。問題在於,研究領域的術語、受訪者的人名、機構名、地名,這些都是低頻詞,不在 AI 的高頻預測範圍內。

於是你會看到「質性研究」被寫成「智性研究」,受訪者服務的公司名整個換成另一家,某個專業名詞被拆成兩個毫不相關的字。這類錯誤最難纏的地方是:它讀起來完全通順。你如果不逐句對回音檔,光看文字根本不會發現有問題,等到論文送審、會議紀錄外發才被抓包,代價就大了。

罩門二:多人交談的語者分離

質性研究、焦點團體、座談會,最核心的資訊往往是「這句話是誰說的」。AI 的語者分離技術在單純的一問一答還算堪用,一旦變成三人以上、又有搶話和重疊發言,它就開始亂了:把不同人的話接成同一段、把同一位發言者切成好幾個語者、在插話的地方張冠李戴。

對逐字稿來說,語者標錯不是小瑕疵,而是會直接污染後續分析。你拿著一份語者混亂的稿子去做編碼,等於在錯的地基上蓋房子。這一段幾乎沒有例外,都需要人工回聽音檔重新確認。訪談逐字稿要怎麼銜接後續的質性編碼,我們在訪談逐字稿與編碼銜接的全攻略裡有更完整的說明。

罩門三:口語雜訊與「腦補」

真實的對話從來不是通順的。有語助詞、有講到一半改口、有方言混雜、有講錯又重來。AI 為了讓輸出「好看」,常常自動把這些雜訊補成一句流暢的話。

對一般摘要來說,這種平滑化也許無害。但對逐字稿來說,這是失真,不是優化。質性研究要看的正是受訪者的猶豫、停頓、重複,那些「不通順」本身就是資料。法律用途更是一個字都不能改。AI 的腦補在這些場景裡不是幫忙,而是把證據抹掉。

什麼情況該選哪一種?

把上面的差異對回實際需求,其實選擇很清楚:

  • 自用、抓重點、找段落 → 純 AI 就好。你自己知道音檔內容,看到明顯的錯字會自動修正,省下的錢比省下的校對時間更有價值。
  • 論文附錄、質性編碼、正式會議紀錄 → AI 初稿+人工校對。這是正確率與預算的平衡點,用 AI 處理掉最花時間的前段聽打,人力集中在校對專有名詞和語者標記。
  • 法律用途、出版引用、高度敏感內容 → 人工精校。這類稿子的錯誤成本極高,一個字都不能將就,沒有妥協空間。

一個實用的判斷法:問自己這份稿子「會不會被第三方檢視或引用」。答案是會,就別在校對這關省錢;答案是不會,純 AI 通常綽綽有餘。

逐字稿之後,別忘了下游

很多人把逐字稿當終點,其實它常常只是中繼站。稿子做完之後,往往還要接翻譯、編碼或引用,而逐字稿的品質會一路影響到最後。

如果你的訪談是中文、但論文要投英文期刊,逐字稿定稿後還有一段翻譯要走。這時逐字稿的準確度就更關鍵了:連中文原稿的專有名詞都錯,翻成英文只會錯得更離譜。學術翻譯和一般翻譯的差別、該怎麼挑翻譯方,可以參考學術翻譯的挑選指南。如果只需要處理論文的英文摘要,中翻英摘要的重點整理會更對症。

換句話說,選逐字稿方案時,最好連下游一起想。一份乾淨、語者清楚、專有名詞正確的逐字稿,能讓後面的翻譯、編碼、引用都省事;一份便宜但錯漏百出的稿子,省下的錢會在後面每個環節加倍還回來。

這裡有個常被忽略的細節:時間戳記在下游特別好用。做質性編碼時,你常需要回頭確認某句話的前後脈絡,逐字稿標了時間戳,你就能一秒跳回音檔那個位置,不用從頭聽起。同理,論文引用受訪者原話時,時間戳也讓你和口委、審查者都能快速查證。這種規格花不了多少額外成本,卻能省下大量回聽的時間,委託時值得主動要求。

錄音品質決定一切:開錄前該做的事

不管你打算用 AI 還是人工,逐字稿的天花板都是錄音本身。同一位聽打員、同一套引擎,拿到清楚的錄音和拿到吵雜的錄音,交出來的品質差一大截。開錄前多花五分鐘,後面能省下好幾小時的校對。

  • 靠近音源。 手機或錄音筆放在說話者中間,別塞在包包裡或壓在紙張下。距離每遠一步,背景噪音的占比就上升,AI 最先犧牲的就是離麥克風最遠那位發言者的清晰度。
  • 每人一軌最理想。 條件允許的話,多人座談讓每位發言者各用一支麥克風分軌錄。分軌錄音等於幫語者分離先做好一半,AI 和人工都會輕鬆很多。
  • 避開回音和背景音樂。 空曠會議室的回音、咖啡廳的音樂與人聲,對人耳只是背景,對 AI 卻是直接蓋掉語音的干擾源。挑安靜、有軟裝吸音的空間。
  • 開場先報名字。 請每位受訪者在錄音開頭說一句自己的名字或代號。這一句話能讓後續校對快速對上語者,也方便匿名化時統一換成代號。

這些動作看起來瑣碎,卻是真正拉高逐字稿品質、壓低成本的槓桿。錄壞的音檔,再貴的人工也救不回被噪音蓋掉的那句話。

算一筆實際的帳

假設你有十小時的訪談錄音要處理,用三種做法各自會是什麼光景?

純 AI 跑完,成本可能只是幾杯咖啡的錢,但你得自己花時間逐句校對專有名詞和語者,這段隱形工時往往被低估。研究者的時間不是免費的,把十小時錄音的校對攤下來,省的錢未必划算。

人工精校品質最穩,但十小時錄音乘上每分鐘單價(中文人工約 20–40 元、英文更高),總價會是三種做法裡最高的,交期也最長。適合預算充足、且錯誤成本極高的法律或出版案。

AI 初稿加人工校對落在中間:豐道以每分鐘 15 元計,十小時錄音的價格清楚可算,交期壓在數個工作天,交付的是能直接用的稿子。對多數要寫論文、要做質性分析的研究者,這個組合的每一塊錢都花在刀口上。

真正決定總成本的,從來不只是每分鐘單價,還有你事後要補多少工。便宜的稿子如果逼你重校一遍,那才是最貴的。

委託前的檢查清單

不管你最後選哪一種做法,委託前先確認這幾件事,能省掉大部分糾紛:

  1. 報價是否按分鐘明碼計算? 先聽樣本再報價的服務方,通常比一口價更貼近真實工時,也代表對方認真評估過音質。
  2. 是否標示語者、時間戳記等規格? 這些規格直接影響價格與交付格式,開工前就要講清楚,不要事後才補。
  3. 能否簽保密協議、交付後刪檔? 涉及個資、商業機密或未發表資料時,這一條不能省。
  4. 是否含一次勘誤? 拿到稿子後你需要有回饋修正的空間,確認勘誤範圍與次數。
  5. 交付格式是什麼? Word 還是 PDF、要不要去語助詞的清稿版本,這些先對齊,避免交付後才發現格式不合用。

豐道怎麼做逐字稿

豐道的定位很明確:我們不跟純 AI 拚每分鐘幾塊錢的價格,而是把心力放在「AI 初稿+人工校對」這個對研究者最實用的區間。AI 幫我們吃掉最耗時的前段聽打,人力則專注在專有名詞校對、語者標記與音檔對照,交付的是能直接放進論文、能對外的稿子,不是一份還要你自己重校一遍的半成品。

質性研究的受訪者資訊可依需求匿名化,音檔僅用於該次服務、交付後依約定刪除。如果你正在為訪談或會議錄音找逐字稿方案,翻譯與逐字稿服務頁有明碼價格與方案比較,也可以直接聯絡我們描述你的錄音狀況,我們聽過樣本後給你一個貼近實際工時的報價。

本文由豐道團隊撰寫,內容持續更新。

知識專區 瀏覽更多文章
延伸閱讀
常見問題

本文 FAQ

AI 逐字稿的正確率到底夠不夠用?

看用途。自用筆記、找重點段落、抓時間軸,AI 已經夠用;但要放進論文附錄、法律文件或正式會議紀錄,AI 常見的同音字錯置、專有名詞錯認與語者混淆就不能接受,需要人工逐句校對把關。判斷標準很簡單:這份稿子會不會被第三方檢視或引用,會的話就別省人工這一關。

一小時的訪談錄音,逐字稿要做多久?

純人工聽打一小時音檔常需要數倍工時(依音質、語速、人數而定);AI 初稿+人工校對可大幅縮短前段聽打時間,把人力集中在校對與語者標記,通常數個工作天內可交付,急件可再議。音質差、口音重、多人重疊的錄音會拉長校對時間,這也是報價時要先聽樣本的原因。

訪談錄音涉及個資和敏感內容,怎麼保密?

選擇願意簽保密協議的服務方,並確認音檔的處理與刪除方式。豐道的做法:檔案僅用於該次服務、交付後依約定刪除,質性研究的受訪者姓名、機構名可依需求匿名化或代號化處理,避免逐字稿本身成為個資外洩的破口。

AI 逐字稿為什麼常常把專有名詞聽錯?

AI 語音辨識靠的是機率模型,會把聽到的音對應到「最常見」的字詞。研究術語、人名、公司名、地名這類低頻詞,剛好不在它的高頻預測裡,於是「質性」變「智性」、受訪者的公司名整個換掉。這類錯誤最麻煩的地方是它讀起來很通順,不逐句對音檔根本抓不出來。

多人座談或焦點團體的錄音,AI 分得出誰在講話嗎?

AI 的語者分離(diarization)在兩人以上、又有搶話重疊時,準確度會明顯下降,常把不同人的發言接成同一段,或把同一位發言者切成好幾個語者。對質性研究來說「誰說的」是分析核心,這一段幾乎一定要人工回聽音檔重新標記,不能只信 AI 的自動分段。

我可以自己先用 AI 跑一版,再請人校對嗎?

可以,而且對預算有限的研究者是務實選項。你把 AI 初稿連同原始音檔一起提供,校對方對照音檔逐句修正即可。要注意兩件事:一是初稿品質太差時,校對工時可能接近重打,價格未必省得下來;二是務必附上原始音檔,沒有音檔的稿子無從查證,校對就只能潤飾通順度,不能保證忠實。

免費諮詢

準備好開始了嗎?

免費諮詢不收費、不強迫推銷。說說您的需求,我們給您專業評估與透明報價。

LINE 諮詢