音声を変換すると音質が落ちることがある理由
非可逆エンコーダーを通すたびに少しずつ情報が捨てられ、二度と戻りません。それが問題になるのはどんなときか、そして本当に問題にならないのはどんなときかを知っておけば、音質を守れるうえに、無駄な変換も大幅に減らせます。
最終確認日:
非可逆圧縮が実際に削っているもの
MP3、AAC、Vorbis、Opusは、原理的にはどれも同じ仕組みで動いています。人間の聴覚が感じ取れるものと感じ取れないものをモデル化し、聞いて気づく部分だけを保存するのです。大きな音の直後の小さな音はマスキングされるので捨てられます。素材に含まれていない高い周波数にはビットを割り当てる必要がありません。左右のチャンネルでほぼ同じステレオ情報は、1回分だけ保存すれば済みます。
その結果、驚くほどの圧縮が実現します。CDの1曲が、聞いて分かる違いもなく約10分の1のサイズになるのです。そしてこれは元に戻せません。捨てられた情報はファイルから消えており、どんなデコーダーも変換ツールも補正処理も、それを取り戻すことはできません。これこそが「非可逆」の意味であり、以下の話はすべてここから導かれます。
世代劣化:2回目の変換が1回目より大きく響く理由
多くの人が驚くのはここです。きれいな録音を十分なビットレートでMP3にエンコードしても、ほとんど劣化は分かりません。ところがそのMP3をデコードしてもう一度エンコードすると、同じビットレートでも、同じエンコーダーを使っても、はっきり聞き取れるほど悪くなります。それには明確な理由があります。
2回目のエンコーダーは、1回目のエンコーダーが生んだノイズと本物の音を区別できません。受け取るのは元の録音ではなく、元の録音から削られた部分を除き、削ったことで生じた小さな歪みが加わったものです。心理音響モデルにとって、その歪みはごく普通の音声データです。そのためエンコーダーは律儀にビットを使ってそれを保存し、同時に残りの部分からさらに一部を捨ててしまいます。
異なるコーデック間ではさらに悪くなります。何が聞こえないかについての判断がコーデックごとに違うからです。AACをMP3に、あるいはOpusをMP3に変換すると、2回目のエンコーダーは、自分とは異なる理由で1回目が下した判断まで保存することになります。変換を重ねたファイルが、きれいな音源から半分のビットレートでエンコードしたどちらのコーデックよりも悪く聞こえることがあるのはこのためです。
たった1つのルール
ロスレスの元ファイルを残しておき、配布用のコピーはすべてそこから作ること。
守るべきことはこれだけです。FLACやWAVがあれば、そこから作るMP3はすべてきれいな1世代目になります。あとで別のビットレートや別の形式、あるいはMP3の次に登場する形式が必要になっても、元ファイルからもう一度変換すれば余計な劣化はありません。FLAC MP3変換は、非可逆エンコーダーにとって考えうる最良のケースです。保存すべき過去の劣化がまったくないからです。
ロスレスの元ファイルを削除すれば、その後の変換はすべて、すでに劣化したものから始まることになります。これは長く尾を引く決断で、たいていは音楽そのものより安いディスク容量を節約するために下されています。
本当に問題にならないとき
この点を正確に知っておくことは、警告と同じくらい役に立ちます。この分野のアドバイスには迷信のようなものが多いからです。
適切なビットレートでの1回の再変換は、たいてい聞き分けられません。古いカーステレオで再生するために192 kbpsのAACを256 kbpsのMP3に変換するのは問題ありません。世代劣化の話を聞いて、どんな変換でもファイルが台無しになると考える人がいますが、そんなことはありません。2回目のエンコーダーに十分な余裕を与えさえすればよいのです。
元より少し高いビットレートでエンコードしましょう。元が128 kbpsなら、128でエンコードすると同じ予算で2回分の劣化が重なります。192でエンコードすれば2回目に十分なビットが与えられ、聞いて分かる劣化は加わりません。320にしても元より良くなるわけではありません(元以上の品質にはなりえません)が、2回目の変換で何かが失われることはなくなります。
音楽より話し声のほうがはるかに寛容です。講義やポッドキャストなら、96 kbpsのモノラルでも十分明瞭で、再変換してもほとんど影響はありません。低いビットレートや2世代目の劣化が目立つのは、シンバル、拍手、深い残響といった音です。
WAVでできること、できないこと
非可逆のファイルをWAVに変換する意味は理解しておく価値があります。見当違いの効果を期待してWAVを選ぶ人が多いからです。MP3 WAV変換は、デコードした音声を非圧縮で保存します。これによってそれ以上の劣化は止まりますが、最初の劣化は元に戻りません。WAVはサイズが10倍になり、中身はMP3とまったく同じ音です。
それでも、編集の前にはこれが正しい手順です。カット、ミックス、調整をするとファイルを何度も保存することになり、非可逆ファイルでは保存するたびに1世代ずつ劣化します。WAVに変換してすべての作業を済ませ、最後に一度だけエンコードすれば、5世代分ではなく1世代分の劣化で済みます。
実用上の制限が1つあります。一般的な形式のWAVファイルは4 GBを超えられず、高解像度の長時間録音ではこれに達することがあります。長時間の作業には、それに適した形式を使いましょう。
よくある質問
高いビットレートに変換すればMP3の音質は良くなりますか?
いいえ。ファイルが大きくなり、同じ音に新しいエンコーダーの推測が加わるだけです。捨てられた情報を取り戻す方法はありません。ビットレートを上げたMP3は、大きくなったファイルであって、良くなったファイルではありません。
何回変換すると聞いて分かるようになりますか?
中程度のビットレートの音楽では、シンバルや拍手、音数の多いミックスといった難しい素材だと2世代目で聞き取れることが多く、3世代目ならたいてい分かります。話し声なら何回か変換しても問題ないこともあります。正直なところ素材次第であり、だからこそ回数を数えるのではなく、そもそもそうした状況を避けることがルールになっているのです。
2026年でもMP3を選ぶべきですか?
互換性のためだけです。ただし、それは正当な理由です。AACはどのビットレートでもMP3より優れ、Opusはその両方より優れていて、現在のスマホやパソコンはどれもこれらを再生できます。MP3は、途中にある古い機器などがそれを必要とするときに選び、何となくの初期設定として選ばないようにしましょう。
動画から音声を抽出すると再エンコードされますか?
何を指定するかによります。既存のトラックをそのままコピーして取り出すなら、何もデコードしないのでロスレスで一瞬です。MP3やWAVを明示的に指定すると変換になります。音声だけが欲しいなら、元のトラックをコピーするほうが速く、品質も上です。
320 kbpsのMP3が128 kbpsの元ファイルより悪く聞こえるのはなぜですか?
ほぼ間違いなく、すでに非可逆だったものから変換されたからです。ビットレートは最後のエンコーダーにどれだけ余裕があったかを示すだけで、元の音源の良さを示すものではありません。96 kbpsの元ファイルから作った320 kbpsのファイルは、元ファイルの劣化をすべて抱えたまま、ずっと大きなファイルになっているだけです。