音声ファイルが実際に保存しているもの
録音を表す数値は3つありますが、1つのファイルに当てはまるのはそのうち2つだけです。サンプリングレートは、音をどれくらいの頻度で測ったかです。CDは44.1 kHz、動画から取り出したものは48 kHzです。ビット深度は、1回の測定値をどれくらい細かく記録するかで、意味があるのは非圧縮の形式だけです。16ビットがCDの標準、24ビットは後の処理のための余裕を残し、32ビット浮動小数点はミキシング用です。ビットレートは圧縮形式でのみ意味を持ち、エンコーダーが1秒あたりに使えたビット数を表します。
だからこそ、サイズの決まり方がまったく違います。WAVのサイズは単純な計算で決まります。レート×ビット深度×チャンネル数なので、44.1 kHz・16ビットのステレオは、中身が無音でも1分あたり約10 MBです。MP3のサイズは選んだビットレートで決まり、192 kbpsで1分あたり約1.4 MB、96 kbpsならその半分です。WAVは聴くための形式ではなく作業用の形式で、この違いこそがどちらの方向にも変換する理由です。
MP3をWAVに変換しても何も元には戻りませんし、今後も戻ることはありません。エンコーダーはMP3を作るときに細部を捨てており、そこから作ったWAVはその損傷をフル解像度で保持するだけです。この変換の目的は、それ以上の劣化を止めることです。WAVにしてからは、編集、カット、保存し直しを何度しても何も失われません。可逆圧縮であるFLACも同じで、受け取ったサンプルをそのまま小さく保存する方法であって、音を良くする方法ではありません。MP3をFLACにしたものは、MP3が入った大きなファイルにすぎません。
非可逆エンコーダーを通すたびに、さらに情報が捨てられ、二度と戻りません。AACからMP3、OGGからMP3、あるいはMP3から別のMP3への変換は、どれもそうした処理の1回です。元のファイルと同じかそれ以上のビットレートでエンコードすれば(どのページでも、ファイルをドロップすると元のビットレートが表示されます)、劣化を小さく抑えられます。元よりはるかに高くしても、最初のエンコーダーの誤りを保存するためにビットを使うだけです。録音にいくつもの処理をするなら、まずWAVに変換してから作業し、最後に1回だけエンコードしてください。
カットと結合は、再エンコードする必要がまったくありません。圧縮された音声は小さなフレーム(MP3なら約26ミリ秒)の単位で保存されており、音声カットはそのフレームをデコードせずにコピーします。そのため、カットしたMP3は元のMP3とビット単位で同じで、長い録音も読み込むのとほぼ同じ速さでカットできます。その代わり、コピーによるカットは最も近いフレームの境目から始まり、指定した位置から前後に100分の数秒ずれます。「正確にカット」にチェックを入れると再エンコードして、指定したサンプルの位置でカットします。音声結合も同じ仕組みで、コーデック、サンプリングレート、チャンネル数が同じファイルはコピーで結合し、異なるファイルはデコードして最初のファイルに合わせて再エンコードします。
音量の底上げはラウドネスノーマライズではなく、ダイナミックレンジ圧縮でもありません。音量調整はファイル内で最も大きい瞬間を測り、全体をその一定量だけ持ち上げて、ピークが上限のすぐ下に来るようにします。これはピークノーマライズで、全体的に音が小さすぎるだけの録音には正しい解決策です。ポッドキャストや配信プラットフォームが指定するLUFSの測定とは違います。LUFSは番組全体で知覚される音の大きさを評価するもので、同じピークにノーマライズした2つのファイルでも、聞こえる音量がはっきり違うことがあります。また、ファイル全体を持ち上げると小さい部分と大きい部分が一緒に動くので、その2つの間を行き来する録音を均一にすることもできません。それはダイナミックレンジ圧縮という別の作業で、これらのツールでは行いません。
ブラウザが本当に適さない場面
録音を外部に出さないことこそ、これらのツールの目的です。ただし、それで処理能力が上がるわけではまったくありません。これらのツールができるのは、変換、カット、結合、音量の設定です。音そのものの編集はできません。
修復も音作りもできません。ノイズ除去、ハムノイズやクリックノイズの除去、EQ、ディエッサー、ダイナミックレンジ圧縮、フェード、マルチトラックのミキシングはありません。結合した部分の間のクロスフェードもないため、大きな音楽の途中でカットするとプツッと音がすることがあります。Audacityは無料で、どのデスクトップでも動き、これらすべてをきちんとこなします。ヒスノイズの多いインタビューや、背後で冷蔵庫がうなっている録音には、ここではなくAudacityが必要です。
ピークは測りますが、ラウドネスは測りません。音量調整は処理前後のピークを表示し、上限を超えそうな分は抑えますが、トゥルーピークのリミッターもLUFSの目標値もありません。仕様に合わせて納品する場合(ポッドキャストなら−16 LUFS、配信プラットフォームなら−14 LUFS)は、ピークではなくラウドネスを測るツールが必要です。
タグは引き継がれません。タイトル、アーティスト、アルバムアート、チャプターは、ここでの変換ではまだ引き継がれません。音声は変換されますが、ライブラリのメタデータは残りません。音楽ライブラリを変換するなら、変換しながらタグを書き直してくれるデスクトップの管理ソフトを使えば、何時間ものタグの付け直しが省けます。
1つのファイルに、1回のクリック。800件のボイスメモを変換するのは、ffmpegをシェルのループで回す仕事です。ffmpegは無料で、人がクリックして午後いっぱいかかる作業を1分で片付けます。
そして、どのブラウザにもできないこともあります。保護された購入コンテンツ(古い.m4pファイル、Apple Musicのダウンロード、サブスクリプションで入手したもの)はここでは開けません。また、その保護を解除するお手伝いはしていません。MP3自体は最大2チャンネル・最大48 kHzしか扱えないため、サラウンドや高サンプリングレートの音源は、変換の過程でダウンミックスされます。
似た名前のツールの選び方
音声圧縮とWAV MP3変換。同じファイルを作れることもありますが、正しい使い方は片方だけです。WAV MP3変換は非圧縮の音源からの最初のエンコードで、最も劣化の少ないエンコードです。音声圧縮はどんなファイルでも受け取り、選んだビットレートで再エンコードします。WAVからなら同じ作業ですが、MP3からだと2回目の非可逆処理になります。指定したビットレートではファイルを小さくできない場合は警告が出ます。128 kbpsのMP3を192 kbpsで圧縮しようとしたときがそうです。
音声の世界で「圧縮」は2つの意味を持ち、ここにあるのはそのうち1つだけです。音声圧縮は、ビットレートを下げてファイルを小さくします。ダイナミックレンジ圧縮は、大きい部分に対して小さい部分を相対的に大きくするもので、ポッドキャストの制作者がこの言葉で指すのはこちらです。音声圧縮も音量調整も後者は行いません。音量調整はファイル全体を一定量だけ動かします。
AAC MP3変換とM4A MP3変換。ほぼ同じページです。.aacファイルはAACのストリームそのもので、.m4aはアートワークやチャプターも収められるMP4の箱に入ったAACです。どちらのページも両方を読み込め、中の音声は同じです。M4AのページはiPhoneのボイスメモ向けに書かれています。ボイスメモはもともと低ビットレートのモノラルAACなので、書き出しは128 kbpsのモノラルが適しています。
MP3 WAV変換とFLAC MP3変換。逆方向で、どちらも一方通行です。MP3 WAV変換は、それ以上劣化させずに編集できる作業用のコピーを作ります。音が良くなるわけではなく、ファイルは約10倍に増えます。FLAC MP3変換は、手元に残しておくべきマスターから持ち運び用のコピーを作ります。MP3を元のFLACに戻すことは決してできないからです。
音声カットと音声結合。カットは1つのファイルから部分を切り取り(途中の部分も含めて)、残りをつなぎます。結合は別々のファイルを、ドラッグで決めた順番につなげます。3回に分けて録音し、2回目に咳が入ったインタビューなら両方の作業が必要です。咳をカットしてから、3つを結合してください。