録音した音声を翻訳するには?
音声翻訳は、録音ファイルを音声翻訳ツールにアップロードし、話されている言語と翻訳先の言語を選んで、「翻訳字幕だけ」か「字幕+AI吹き替え」かを決めるだけです。ツールが音声を文字起こしして翻訳し、吹き替えを選んだ場合は新しい声で読み上げます。ダウンロードしたら、まず人名と数字を確認しましょう。
流れ自体はこれだけです。この記事では、アップロードからダウンロードまでの間に何が起きているのか、字幕と吹き替えのどちらを選ぶべきか、そして誰かに聞かせる前に見つけておきたいミスについて説明します。

音声翻訳の中身は「文字起こし→翻訳→音声合成」の3段階
音声翻訳は、ひとつのモデルがひとつの作業をしているわけではありません。3つの工程が順番につながったパイプラインで、前の工程の出力が次の工程の入力になります。
1つ目は音声認識、つまり文字起こしです。録音を聞き取ってテキストにし、タイムスタンプを付けます。これが原文字幕になります。2つ目は翻訳で、字幕を1行ずつ、前後の文脈も踏まえながら翻訳先の言語に訳します。3つ目は任意の音声合成で、AIの声が訳文を読み上げ、翻訳先言語の新しい音声トラックができあがります。
ここで大事なのは、ミスは下流に流れていくという点です。文字起こしの段階で製品名を聞き間違えると、翻訳はその間違った語を忠実に訳し、吹き替えははっきりとした発音で読み上げます。最初に正しく認識されなかった語を、翻訳の工程で直すことはできません。「文字起こし 翻訳」とセットで検索されることが多いのもそのためで、録音そのものの品質は想像以上に結果を左右します。
同じ理由で、訳文だけが目的でも原文字幕は役に立ちます。不自然な訳が見つかったら、認識された原文と見比べれば、問題が文字起こしにあるのか翻訳にあるのかがすぐにわかります。
翻訳字幕だけか、AI吹き替えまでか
多くの音声翻訳ツールで選べるのは、翻訳が終わった時点でテキストを受け取るか、さらに訳文の音声まで生成するかの2択です。どちらが優れているというより、届ける相手が違います。
| 翻訳字幕のみ | 字幕+AI吹き替え | |
|---|---|---|
| 受け取れるもの | 翻訳された字幕ファイル | 翻訳先言語の音声+原文字幕+翻訳字幕 |
| 向いている用途 | 読みながら確認、議事録やメモ、引用、自分で字幕を付ける | 読むより「聞く」相手向け。ポッドキャストのリスナーや研修用音声など |
| 手間 | 工程が短く、確認する項目も少ない | 工程がひとつ増え、話す速さや発音も確認が必要 |
| テキストを直したあと | 修正は字幕に反映されるだけ | 再度吹き替えを生成し、声を修正後のテキストに合わせられる |
| 料金の考え方 | 音声の長さに応じて | 同じく音声の長さに応じて。修正後の再吹き替えは追加でクレジットを消費 |
判断の目安はシンプルです。訳文を読む、引用する、どこかに貼るのであれば字幕で十分です。誰かに聞いてもらう必要があるなら、たとえば英語のインタビューを英語を読まない同僚に共有したい場合などは、吹き替えをオンにしましょう。
迷ったら字幕から始めるのがおすすめです。翻訳字幕を一度読めば、その録音と訳文が吹き替えまでする価値があるかどうか、すぐに判断できます。
翻訳する前に録音を整えておく
事前の数分の準備が、あとで修正に使う時間を大きく減らしてくれます。
対応形式にする。 Belin Doc の音声翻訳は MP3、WAV、M4A、AAC、FLAC に対応しています。OGG、Opus、WMA、AMR は非対応なので、先にいずれかの形式へ変換してください。スマートフォンのボイスメモでよく使われる M4A はそのままアップロードできます。そのほかの形式は、一般的な無料の音声変換ツールで MP3 か WAV に書き出せば大丈夫です。
声をはっきり録る。 音声認識は一般に、一度に一人が話し、マイクに近く、大きなBGMがない条件でもっともよく働きます。発言が重なる会議の録音や、音楽が声に被っている素材は、認識ミスが増えがちです。同じ内容でよりクリアな録音があるなら、そちらを使いましょう。
不要な部分はカットする。 冒頭の長い無音、本題前の雑談、10分間のセッティング音なども、本編と同じように処理され、料金の対象になります。アップロード前に削っておけば、確認する量も減り、クレジットの節約にもなります。
長い録音は分けてもよい。 3時間の講演は分割したほうが確認しやすく、音質の悪い部分だけ別に扱うこともできます。1タスクにつき1ファイルなので、分割しておけば重要な部分から先に翻訳できます。
話されている言語を確認する。 原語を正しく選ぶと認識の助けになります。複数の言語が混ざる録音では、もう一方の言語の部分を重点的に確認しましょう。
共有する前に確認したい4つのポイント
音声の自動翻訳は、大意を伝えるのは得意です。一方で間違えやすい箇所にはパターンがあるので、狙いを絞って見直せば大半の問題は防げます。
まず人名と専門用語。 人名、社名、製品名、業界用語は、認識モデルにとってなじみの薄い語で、発音の似た一般的な語に置き換えられがちです。登場するはずの名前は、翻訳字幕の中で一つずつ検索しましょう。
次に数字。 価格、日付、割合、数量は聞き間違えやすく訳し間違えやすいうえ、数字のミスは多少ぎこちない文よりもずっと大きな問題になります。数字はすべて原文字幕と照らし合わせてください。
続いてタイミングと1行の長さ。 訳文は原文と長さが変わることが多く、長くなった行は表示時間内に読み切れないことがあります。字幕を公開するなら、音声に合わせて一度通しで再生しましょう。
吹き替えを選んだ場合は、訳文の音声を最後まで一度は聞くこと。人名の読み方や話す速さが自然かどうかに注意します。なお、字幕の一文を直しても、音声トラックは自動では変わりません。Belin Doc では、タスク完了後に翻訳字幕を編集し、吹き替えを再生成して音声を修正後のテキストに合わせられます。再吹き替えは追加でクレジットを消費するので、修正はまとめて一度に行うのが効率的です。
音声翻訳ツール、動画翻訳、リアルタイム翻訳アプリの違い
「音声翻訳」で検索すると、ポケットサイズの翻訳機や会話用のアプリも多く見つかります。似た言葉で呼ばれていても、役割は別物です。
リアルタイムの音声翻訳アプリは会話のためのものです。スマートフォンに一言二言話すと訳してくれ、相手が返事をする。速さを重視しており、ファイルを作ることは目的ではないため、タイムスタンプ付きの字幕や完成した吹き替え音声は基本的に得られません。
音声ファイルの翻訳ツールは、すでに手元にある録音が対象です。ポッドキャスト、インタビュー、講義、ボイスメモ、会議の録音などをファイル単位で処理し、編集できるタイムスタンプ付き字幕や、完成した吹き替え音声トラックを出力します。成果物を保存・確認・共有したいときはこちらです。
動画翻訳は、動画ファイルに対して同じことを行い、さらに字幕と吹き替えを映像と同期させます。MP4 などの動画なら、自分で音声を抜き出さずに動画翻訳を使ってください。映像のない録音は、そのまま音声翻訳で処理できます。
Belin Doc で音声を翻訳する手順
ステップ1:音声ファイルをアップロードする
音声翻訳のページを開き、MP3、WAV、M4A、AAC、FLAC のいずれかのファイルを1つアップロードします。1タスクにつき1ファイルなので、複数の録音はそれぞれ別のタスクとして送信してください。トップページの「ドキュメント」または「動画」タブに音声ファイルをドロップした場合も、自動で音声翻訳に引き継がれます。
ステップ2:言語と吹き替えの有無を選ぶ
録音で話されている言語と、翻訳先の言語を設定します。次に吹き替え用のAI音声を選ぶか、翻訳字幕だけが必要なら「吹き替えなし」を選びます。アップロード直後に、音声の長さにもとづく消費クレジットの見積もりが表示されます。実際の消費は送信時に確定します。
ステップ3:送信して進行状況を確認する
タスクを送信したら、音声翻訳ページの「最近のタスク」で進行状況を確認します。この一覧は動画のタスクとは別になっています。文字起こし、字幕の翻訳、そして選んだ場合は吹き替えが順に進みます。
ステップ4:確認・修正してダウンロードする
完了したら、翻訳字幕の人名、用語、数字を確認し、誤りがあれば修正します。吹き替えありの場合は、修正後に再度吹き替えを生成できます。最後に、翻訳先言語の音声と原文・翻訳の字幕をダウンロードします。吹き替えなしの場合は翻訳字幕のみです。
よくある質問(FAQ)
音声翻訳に対応しているファイル形式は?
MP3、WAV、M4A、AAC、FLAC です。OGG、Opus、WMA、AMR には対応していないため、アップロード前にいずれかの形式へ変換してください。
料金はどのように決まりますか?
音声の長さに応じて、アカウントの翻訳クレジットから消費されます。見積もりはアップロード直後に表示され、実際の消費は送信時に行われます。
翻訳後に受け取れるファイルは?
吹き替えありの場合は、翻訳先言語の音声、原文字幕、翻訳字幕の3つです。吹き替えなしの場合は翻訳字幕のみです。
文字起こしや翻訳を修正して吹き替え直せますか?
はい。タスク完了後に翻訳字幕を編集し、吹き替えを再生成できます。再吹き替えは追加でクレジットを消費します。吹き替えなしのタスクでは、編集内容は字幕にのみ反映されます。
複数の音声ファイルをまとめて翻訳できますか?
1タスクにつき1ファイルなので、録音ごとに別のタスクとして送信してください。長さの上限と同時に進められるタスク数は動画翻訳と同じルールで、音声と動画のタスクは合算されます。
音声翻訳と動画翻訳はどう使い分けますか?
ポッドキャスト、インタビュー、ボイスメモなど映像のない録音は音声翻訳へ。動画ファイルは動画翻訳を使うと、字幕と吹き替えが映像と同期します。

