読むのは聞くよりも速いです。テキストの文字起こしは役立ちますが、音声の文字起こしのためだけにアプリをインストールするのはスペースの無駄です。これらのオンライン ツールを使用すると、ダウンロードすることなく即座に実行できます。

クイックリンク
1. レボルディブ
レボルディブ 使いやすく、完全に無料で、オーディオ ファイルやビデオ ファイルを数秒でテキストに変換できるため、私のお気に入りのプラットフォームです。使用するためにアカウントを作成する必要はありませんが、アカウントがあれば、ファイルが保存され、変更がクラウドに保存されることが保証されます。

ほとんどの音声テキスト変換ツールと同様に、Revoldiv は正確で高速な変換のために OpenAI の Whisper テクノロジーやその他のモデルを使用します。複数の話者を識別し、歓声、スピーチ、拍手を検出できます。また、エラーや冗長な単語を削除するテキスト編集もサポートしています。オーディオまたはビデオ ファイルはテキストと同時に編集できます。テキストはプレーンテキスト ファイルまたは翻訳としてエクスポートできます。組み込みのリンク共有オプションを使用してプロジェクトを公開することもできます。
Revoldiv は Chrome (およびその他の Chromium ブラウザ) と Mozilla Firefox をサポートしています。直接テキスト変換できる Chrome 拡張機能も利用できます。ただし、Revoldiv は一括アップロードをサポートしておらず、メディア ファイルごとに 2 時間の制限があります。
2. Otter.ai

と見なされる Otter.ai 最も人気のある音声テキスト変換ツールの 1 つで、ユーザーと一緒に会議に出席し、代わりにメモを取る「スマート会議アシスタント」として販売されています。 Otter は主に即時の文字起こしに使用されますが、録画されたビデオの文字起こしや字幕を生成することもできます。
Otter.ai は、話者識別と AI 生成の要約を備えた自動ライブ文字起こしを提供します。無料で音声ファイルやビデオファイルを書き起こすことも、有料プランを選択することもできます。
Otter.ai はフリーミアム価格モデルで運営されており、無料プランでは最大 3 つの音声ファイルまたはビデオ ファイルをインポートして書き起こすことができます。プロフェッショナル プラン (月額 8.33 ドル) では、オーディオ ファイルの制限が 10 個に増加し、ビジネス プランではアップロードされたファイルの文字起こしが無制限に提供されます。
Otter は価格面で最高の価値を提供しているわけではありません。コピー制限にすぐに達してしまう可能性があります。ただし、独自のコラボレーション ツールとワークフロー統合を必要とする個人やチームにとっては、最適なオプションです。
3.Youtubeにアップロード
プロセスにはより多くの手順が必要ですが、YouTube の自動文字起こし機能を使用して、オーディオ ファイルやビデオ ファイルのテキストを作成できます。

オーディオ ファイルを YouTube に書き起こすには、アップロードする前にまずビデオに変換する必要があります。一度に最大 15 本の動画をアップロードできますが、24 時間以内にアップロードできる動画の数には制限があります。アップロード後、「テキストを表示」ボタンを使用してテキストを生成できます。
スクリプトを作成する前にビデオを公開する必要はありません。
ファイルを一括でアップロードすることはできますが、私の経験では、YouTube のトランスクリプトの品質は Revoldiv よりも低いことがよくあります。また、デフォルトでは句読点は含まれておらず、生成されたテキストをエクスポートするにはコピーアンドペーストしか方法がありません。 YouTube スクリプトは、YouTube に費やす時間を短縮するのに最適な方法でもあります。
4. 回転

と見なされる 回転 文字起こしと音声翻訳の分野における大手プラットフォームであり、人工知能と人間の専門家を活用してサービスを提供しています。このプラットフォームでは、自動文字起こしと校正者による手動文字起こしを選択でき、複数の言語への字幕作成および翻訳サービスも提供されます。
Rev は VoiceHub プラットフォームの一部として文字起こしサービスを提供しており、Otter.ai と同様のフリーミアム価格モデルを採用しています。無料プランでは、最大 30 分の音声とビデオのアップロードが可能で、月間最大 300 分までアップロードできます。
ベーシック プランの料金は、10 か月あたり 90 分の通話と最大 1200 分の文字起こしで、月額約 1.50 ドル (年払い) です。手動による文字起こしには XNUMX 分あたり XNUMX ドルかかります。もちろん、手動での文字起こしは精度が高くなりますが、配信に時間がかかります。
Rev には次のような利点もあります: 会議の要約を自動生成 Zoom やその他の同様のプラットフォームでのライブ文字起こしサービス。
5. ターボスクライブ
考えられます ターボスクライブ Otter.ai や Rev に代わるコスト効率の高い代替手段を提供する効率的な音声テキスト変換プラットフォームです。 TurboScribe は OpenAI の Whisper テクノロジーを搭載しており、最大 98 種類の言語をサポートしています。

無料プランでは、30 ファイルあたり最大 10 分間、10 日あたり XNUMX 回の変換が可能です。待ち時間に関しては有料プランのユーザーが優先されます。有料プランの Turbo Unlimited は、月額 XNUMX ドルで Rev と同じですが、最大 XNUMX 時間のオーディオ ファイルをアップロードでき、変換回数も無制限と、はるかにお得です。
TurboScribe は、特にテキストに変換する必要があるオーディオ ファイルやビデオ ファイルが大量にある場合に、非常に優れた価値を提供します。
6. ウィスパー
仲介業者を避けて直接ソースにアクセスしたい場合は、アプリ ウィスパー OpenAIは無料で使用でき、現在 音声をテキストに変換する際の精度の最適な基準。多くの音声文字変換ツールは、 ウィスパーモデルよりシンプルなインターフェースと、スピーカーの選択、オーディオとビデオの同時編集、自動チャプターなどの便利な機能が追加されました。

興味深い補足情報: OpenAI は、大規模な言語モデルをトレーニングするために YouTube 動画やポッドキャストを簡単に抽出できるように Whisper を開発しました。
モデルは自分のマシンで実行できますが、最良の結果を得るには、専用の GPU、Python 3.7 以降、ffmpeg がインストールされたコンピューターが必要です。ただし、Whisper には、ローカルにアプリケーションをインストールしたり実行したりすることなく、完全にオンラインで動作するオンライン アプリケーションがあります。

準備 グーグルコラボ Whisper をオンラインで素早く簡単に使用できます。それはサービスです。 ジュピターノート Hosted を使用すると、Web ブラウザから直接コードを記述して実行できます。 Google ColabでWhisperを使用するには、 このノート そして、指示に従ってください。
最終的な結果はテキストを含むテキストファイルであり、 ファイル。 「txt」を「srt」、「json」、「vtt」、または「all」(使用可能なすべての出力形式)に変更できます。
この方法は、以前の文字起こしツールほど直感的ではないかもしれませんが、高度にカスタマイズ可能で、より正確であることが多いです。
完全にクラウド上で実行されるオーディオ ファイルまたはビデオ ファイルをバックアップするためのオプションがいくつかあります。個人的には Revoldiv が一番好きで、Whisper が 2 番目に好きですが、ニーズに応じて、ここに挙げたオプションのどれでも使えるかもしれません。










