音声からテキストへ

音声をテキストに変換

会議、インタビュー、ポッドキャストなどの音声を文字起こしし、TXT または SRT にエクスポートします。 ブラウザ内の Whisper (Transformers.js / WASM) のローカル転写に基づきます。オーディオはアップロードされず、モデルを初めてダウンロードした後はオフラインで再利用できます。

音声文字起こしツールを読み込んでいます…

音声からテキストへは何に適していますか?

音声からテキストへの変換は、会議、インタビュー、コース、ボイスメモ、ポッドキャストの整理に適しています。このツールは、Transformers.js を使用して、ブラウザーで Whisper 音声認識モデルを実行し、認識結果を TXT ドキュメントまたは時間情報付きの SRT 字幕としてエクスポートできます。

音声コンテンツは The Browser AI のサーバーへアップロードされません。初回の文字起こしでは CDN からモデルファイルをダウンロードしますが、以降はブラウザのキャッシュを再利用できます。認識速度と精度は、録音の明瞭さ、背景ノイズ、言語、音声の長さ、デバイスの性能に左右されます。長いファイルほど多くのメモリと時間を必要とします。

サポートされている形式: MP3, WAV, M4A, WebM;単一ファイルの制限: ブラウザの利用可能なメモリ内で。

音声からテキストへの使い方

  1. ステップ1

    音声をアップロードまたは録音する

    一般的なオーディオ ファイルとビデオ ファイルを選択するか、マイクの許可を許可した後に直接録音します。

  2. ステップ2

    ローカル文字起こしを実行する

    認識言語を選択し、文字起こしを開始します。 Whisper モデルは、最初の使用時にダウンロードされ、キャッシュされます。

  3. ステップ3

    校正とエクスポート

    認識テキストとタイムラインを確認して、用途に応じて TXT または SRT をエクスポートします。

よくある質問

音声をテキストに変換するには録音をアップロードする必要がありますか?

必要ありません。オーディオ デコードと Whisper 推論は両方ともブラウザーでローカルに実行されます。ネットワーク接続は主に、音声モデルと関連する実行ファイルを初めてダウンロードするために使用されます。

最初の文字起こしが遅いのはなぜですか?

ブラウザーは、最初に使用するときにモデルをダウンロードし、デバイスのパフォーマンスに基づいてローカル推論を完了する必要があります。モデルのキャッシュにより、後で再利用する際のダウンロードの待機時間が短縮されます。

音声認識の精度を向上させるにはどうすればよいですか?

クリアなボーカル、少ない背景ノイズ、安定した音量での録音を優先し、正しい言語を選択してください。複数の人が重なって話している場合、強い騒音、専門用語がある場合、認識エラーが増加する可能性があります。

テクノロジーとデータソース

  • Transformers.js ブラウザーで機械学習モデルを実行するための公式ドキュメント。
  • Whisper ローカル音声認識で使用されるモデル アーキテクチャのオープンソース プロジェクト。