Belin Doc IconBelin Doc

錄音怎麼翻譯?把語音翻譯成字幕與 AI 配音的完整做法

BelinDoc Team2026/09/29

錄音翻譯怎麼做:上傳音檔、選語言,取得翻譯字幕或 AI 配音;也說明語音翻譯 App 和音檔翻譯的差別,以及交付前該檢查的人名、數字與時間軸。

錄音怎麼翻譯?

錄音翻譯的做法很簡單:把音檔上傳到音檔翻譯工具,選好原語言和目標語言,再決定只要翻譯字幕,或是字幕加 AI 配音。工具會先辨識語音、再翻譯,選了配音還會用新的聲音念出譯文。下載後,先核對人名和數字再使用。

流程一句話就說完了。這篇要談的是上傳和下載之間發生了什麼、字幕和配音該怎麼選,以及在別人聽到成品之前,哪些錯誤最值得先抓出來。

一段音訊波形轉成原文字幕、翻譯字幕與配音音軌


先分清楚:你要的是「語音翻譯」還是「錄音翻譯」?

在台灣搜尋「語音翻譯」,多數人想找的是即時口譯:出國點餐、問路、跟外國客戶當面溝通時,對著手機講一句,馬上翻給對方聽。這類 App 為對話而設計,追求的是快,通常不會產出檔案。

「錄音翻譯」是另一件事:你手上已經有一個音檔,可能是 Podcast、訪談、線上課程、會議錄音或語音備忘錄,想要一份可以保存、校對、分享的翻譯成果。這時需要的是能處理整個檔案、給出帶時間軸字幕,甚至能生成完整配音的工具。

兩者沒有誰比較好,只是用途不同。本文談的是第二種:把現成的錄音翻譯成字幕或配音。

音檔翻譯背後的三道工序

音檔翻譯不是一個模型做一件事,而是一條三段的流水線,每一段的輸出都是下一段的輸入。

第一段是語音辨識:軟體把錄音「聽寫」下來並加上時間戳記,也就是原文字幕。第二段是翻譯:把字幕逐句翻成目標語言,同時參考上下文讓句子連貫。第三段是可選的語音合成:由 AI 聲音把譯文念出來,得到一條目標語言的新音軌。

這帶來一個關鍵後果:錯誤會往下游傳遞。辨識階段把品牌名稱聽錯,翻譯就會忠實翻出那個錯字,配音再清清楚楚地念出來。翻譯救不了一個一開始就沒被辨識正確的詞。所以錄音品質往往比多數人想像的更重要,交付前的檢查也該鎖定辨識最容易出錯的地方。

也因此,就算你只在意譯文,原文字幕仍然有用。某句譯文讀起來怪怪的,拿去和辨識出的原文對照,馬上就能判斷問題出在辨識還是翻譯。

只要字幕,還是加上 AI 配音?

大部分音檔翻譯工具提供的都是同一個選擇:翻譯完就停,只拿文字;或是再多走一步,生成譯文配音。兩者沒有絕對優劣,服務的是不同對象。

只要翻譯字幕字幕 + AI 配音
會拿到什麼翻譯後的字幕檔目標語言音檔 + 原文字幕 + 翻譯字幕
適合情境對照閱讀、整理逐字稿與筆記、引用、自行上字幕需要「聽」而不是「看」的人,例如 Podcast 聽眾、教育訓練音檔
工作量流程較短,要檢查的東西較少多一道工序,還要聽語速和發音
修改文字之後修改只會更新字幕可以重新配音,讓聲音和修正後的文字一致
計費邏輯依音檔長度同樣依音檔長度;修改後重新配音會另外消耗點數

簡單的判斷方式:譯文是拿來看、引用或貼到別處的,字幕就夠了;需要有人聽的,例如想把一段英文訪談分享給不看英文的同事,就打開配音。

拿不定主意的話,先從字幕開始。讀一遍翻譯字幕,是判斷「這段錄音和譯文值不值得再配音」最快的方法。

錄音翻譯前,先把音檔準備好

動手前花幾分鐘準備,通常比事後修半天更省事。

格式要對。 Belin Doc 的音檔翻譯支援 MP3、WAV、M4A、AAC、FLAC 五種格式。OGG、Opus、WMA、AMR 不支援,需要先轉成上述任一種。iPhone 語音備忘錄常見的 M4A 可以直接上傳;其他格式用常見的免費音訊轉檔工具匯出成 MP3 或 WAV 即可。

人聲要清楚。 語音辨識通常在「一次一個人說話、離麥克風近、沒有大聲背景音樂」的條件下表現最好。多人搶話的會議錄音、背景音樂壓過人聲的片段,一般辨識錯誤會比較多。同一段內容若有更乾淨的版本,優先用那個。

把用不到的剪掉。 開頭的長時間靜音、正式開始前的閒聊、十分鐘的測試雜音,都會和正文一樣被處理、被計費。上傳前剪掉,成品更短、更好檢查,也更省點數。

太長的錄音可以拆開。 三小時的講座分段檢查會輕鬆很多;某一段音質特別差,也能單獨處理。工具每個任務只收一個檔案,拆開後還能先翻最重要的段落。

確認錄音裡說的是哪種語言。 選對原語言能幫辨識一把。錄音若中英夾雜,另一種語言的部分要多花點時間核對。

交付前要檢查的四件事

語音的自動翻譯,把大意傳達到位通常沒問題;出錯的地方卻很有規律,針對性地檢查一遍就能擋下大部分問題。

先查人名和專有名詞。 人名、公司名、產品名和業界術語,是辨識模型最少「聽過」的詞,常被換成讀音相近的常用詞。你知道一定會出現的名字,逐一在翻譯字幕裡搜尋。

再查數字。 價格、日期、百分比、數量,容易聽錯也容易翻錯,而一個錯的數字惹出的麻煩,遠比一句稍嫌生硬的句子大。每個數字都和原文字幕對一次。

接著看時間軸和每行長度。 譯文和原文長度往往不同,一句翻長了,那行字幕停留的時間就可能不夠讀完。打算公開發布字幕的話,對著音檔完整播一次。

選了配音的,至少完整聽一遍譯文音檔,重點聽人名的念法、語速是否自然。要留意:你改了字幕裡的一句,配音音軌不會自己跟著變。在 Belin Doc 上,任務完成後可以編輯翻譯字幕,再重新生成配音,讓聲音和修改後的文字一致。重新配音會另外消耗點數,建議把所有修改集中起來一次重配。

音檔翻譯、影片翻譯和即時語音翻譯 App 怎麼選

前面提過即時語音翻譯 App 適合對話;如果你手上的是檔案,還要再分一次:是純音檔,還是影片。

音檔翻譯處理 Podcast、訪談、課程、語音備忘錄、會議錄音這類只有聲音的檔案,給出可編輯的帶時間軸字幕,也能生成完整配音音軌。

影片翻譯對影片檔做同樣的事,另外還要讓字幕和配音跟畫面同步。手上是 MP4 之類的影片,直接用影片翻譯,不必自己先把音訊抽出來;完整流程可以參考這篇線上影片翻譯指南。沒有畫面可看的錄音,直接用音檔翻譯即可。

在 Belin Doc 翻譯錄音的步驟

第一步:上傳音檔

打開音檔翻譯頁面,上傳一個 MP3、WAV、M4A、AAC 或 FLAC 檔案。每個任務只收一個檔案,多段錄音請分別送出。在首頁的「文件」或「影片」分頁拖入音檔,也會自動轉到音檔翻譯。

第二步:選擇語言與是否配音

設定錄音裡說的語言和想要的目標語言,接著選一個 AI 配音聲音,或選擇不配音、只要翻譯字幕。上傳完成後,頁面會依音檔長度立即顯示預估消耗的點數,實際扣點在送出時進行。

第三步:送出並查看進度

送出任務後,在音檔翻譯頁的「最近任務」查看進度,這個清單和影片任務是分開的。語音辨識、字幕翻譯,以及(有選的話)配音會依序完成。

第四步:校對、修改並下載

任務完成後,檢查翻譯字幕裡的人名、術語和數字,有錯就改。有開配音的,改完可以重新配音。最後下載目標語言音檔和原文、翻譯兩份字幕;沒開配音的,下載翻譯字幕即可。

常見問題(FAQ)

錄音翻譯支援哪些音檔格式?

支援 MP3、WAV、M4A、AAC、FLAC。OGG、Opus、WMA、AMR 不支援,上傳前請先轉成上述任一種格式。

音檔翻譯怎麼計費?

依音檔長度從帳戶的翻譯點數扣除。上傳後立刻能看到預估點數,實際扣點發生在送出時。

翻譯完成會拿到哪些檔案?

開了配音:目標語言音檔、原文字幕、翻譯字幕。沒開配音:只有翻譯字幕。

譯文可以修改後重新配音嗎?

可以。任務完成後可以編輯翻譯字幕,再重新生成配音,重新配音會另外消耗點數。沒開配音的任務,修改只會更新字幕。

語音翻譯 App 和錄音翻譯有什麼不同?

語音翻譯 App 多半是即時口譯,適合面對面對話;錄音翻譯處理的是現成的音檔,產出可以校對、下載的字幕或配音。要把一段錄音完整翻好並保存下來,選錄音翻譯。

一次可以翻譯多個音檔嗎?可以翻影片嗎?

每個任務只收一個檔案,多段錄音請分別送出;時長上限和可同時進行的任務數與影片翻譯規則相同,音檔和影片任務合併計算。影片檔請改用影片翻譯,字幕和配音才會跟畫面同步。

推薦閱讀