OpenAI の Whisper for Windows を使用して音声をテキストに変換する方法

OpenAI の Whisper は、独自の方法で音声をテキストに変換できる、AI を活用した新しいソリューションです。何よりも、費用はかかりません。

ただし、比較的小さな問題があります。それは、インストールと使用が通常の Windows ツールを使用するよりも難しいということです。特に、Nvidia グラフィックス カードの Tensor コアを使用してパフォーマンスを向上させたい場合は特にそうです。確認する あなたの文章から無料でアートを作成するための最高の AI ベースのツール.

ただし、絶望する必要はありません。だからこそ私たちはここにいるのです!この記事を読んで、インストール方法と使用方法を学びましょう。また、Nvidia グラフィック カードを所有している場合、Whisper がどのようなメリットをもたらすかも説明します。

OpenAIのWhisperとは何ですか?

ChatGPT はユーザーの間で急速に人気が高まっており、その使用方法はすでに見てきました。 OpenAIによるChatGPT。ただし、OpenAI による興味深いプロジェクトはこれだけではありません。

Whisper は、深層学習とニューラル ネットワークを活用した自然言語処理システムで、音声を「理解」してテキストに変換できます。しかし、その分野では多くのカスタム構成も備えており、以下のおかげで同様のソリューションすべてを上回ります。

  1. Whisper は、自然言語で「トレーニングされた」 AI ソリューションです。したがって、「自然な」人間の音声を理解することは、古いソリューションよりも優れています。
  2. Whisper にはインターフェースが付属しておらず、音声を録音することもできません。既存のオーディオ ファイルのみを取得し、テキスト ファイルを出力できます。
  3. Whisper は「言語理解」に優れているため、自動翻訳も断然得意です。
  4. Whisper はオンライン サービスではないため、完全にオフラインで動作します。
  5. Nvidia グラフィック カード (GTX970 以降) を使用している場合は、Whisper をハードウェア アクセラレーション モードで実行して応答性を高めることができます。
  6. 登録、ライセンスの購入、またはサブスクリプションの購入は必要ありません。

AMD グラフィックス カードがサポートされていないのはなぜですか?

GPU がグラフィックス出力以外にも役立つようにするには、GPU が完全にプログラム可能なプロセッサーとして機能する必要があります。 Nvidia が公式に「並列コンピューティング プラットフォームおよびプログラミング パラダイム」とみなされる CUDA アーキテクチャを作成したのはそのためです。

CUDA は Nvidia 独自のテクノロジーであり、Nvidia GPU とのみ互換性があります。 AMD に最も近い代替手段は、OpenCL と Radeon Compute Platform です。

代替手段と比較して、CUDA はより成熟しており、パフォーマンスが高く、使いやすいです。したがって、ほとんどの開発者は CUDA のみをターゲットにしており、これはアプリケーションが Nvidia GPU のハードウェア機能のみを利用することを意味します。これにはウィスパーも含まれます。確認する Linux での AMD と NVIDIA グラフィックス カードの比較: どちらを使用するべきですか?

Whisperのダウンロードとインストール方法

残念ながら、Whisper はダウンロード、インストール、実行できるスタンドアロン アプリではありません。これは、インストールする必要がある他の依存関係にも依存します。

Windows の場合、このガイドをわかりやすくするために、広く普及している Chocolatey を使用して、必要なアプリケーション パーツのほとんどをインストールします。についてのガイドをご覧ください Windows アプリケーションをインストールする最速の方法 Chocolateyの詳細については、こちらをご覧ください。

Linux と Mac の両方で、インストール プロセス (Windows のパス変数とこれから作成する便利なバッチ ファイルを除く) は似ているはずです。

  • Whisper をインストールして使用するには、Python とその PIP ツールをインストールし、Windows の「Path」変数に追加する必要があります。詳細については、に関する記事を参照してください。 Windows に Python PIP をインストールする方法 و MacとLinux.
  • インストール FFMPEG Chocolatey 経由で次のコマンドを使用します。
choco ffmpeg をインストール

  • また、次を使用して Python バージョンをインストールします。
pip3 python-ffmpeg をインストール
  • 最後に、以下を使用して Github ページから Whisper をインストールします。
pip3 git+https://github.com/openai/whisper.git をインストール

Whisper の CUDA 対応バージョンを入手する

Whisper はネイティブに Nvidia GPU を使用しませんが、ベースとなる Torch パッケージは CUDA アクセラレーション バージョンを提供します。 Whisper の「通常」バージョンの代わりにこれを使用すると、Nvidia グラフィック カードの助けを借りて音声文字起こしをより速く完了できます。

Nvidia の CUDA を使用する Whisper を入手するには:

  • Torch の「バニラ」バージョンがすでにインストールされている場合は、次のコマンドを使用してそれをアンインストールし、残りのファイルを削除します。
pip3 アンインストール トーチ
  • 完了したら、次のコマンドを実行します。
pip キャッシュパージ
  • 次のコマンドを使用して、Torch の CUDA 対応バージョンをインストールします。
pip3 インストール torch torchvision torchaudio — extra-index-url https://download.pytorch.org/whl/cu117

  • Whisper が Nvidia GPU を使用して実行できるかどうかを確認するには、次を使用します。
whisper — ヘルプ | findstr -i pytorch

(デフォルト: cpu) ではなく (デフォルト: cuda) が表示されるはずです。確認する ChatGPT がコンテンツ作成の仕事を引き受けるべきではない理由の強化.

トーチのインストールが失敗した場合の対処方法

Torch のインストール中に「バージョンが見つかりません」エラーが発生した場合は、現在のバージョンと並行して古いバージョンの Python をインストールする必要がある場合があります。

これを行うには、次のコマンドを使用します。

choco install python — バージョン OLDER_VERSION — サイドバイサイド

「OLDER_VERSION」を 3.10 などのバージョンに置き換えます。

次に、すべての「汎用」Whisper コマンドにセカンダリ バージョンのパスを使用します (例:c:\Python310\Scripts\pip.exe単に「ピッ」ではなく「」。

自分の声を録音する方法

任意の音声録音アプリを使用して、音声を WAV または MP3 ファイルに変換できます。 Windows にはそのようなアプリケーションが含まれています。詳細については、「その使用方法」を参照してください。 Windows 10 のオーディオ レコーダー アプリ.

フル機能のオプションが必要な場合は、Audacity をお試しください。のガイドでこれを行う方法を学びましょう Audacityの使い方 Windows および Mac でオーディオを録音するには。

Whisper で書き始める方法

Whisper には簡単な GUI は付属していませんが、その使用は非常にスムーズです。

c:\MyAudioFiles フォルダーに、ギリシャ語の音声を含む MostNote.mp3 ファイルがあり、それを英語に翻訳してテキスト ファイルにコピーするとします。

cd C:\MyAudioFiles
  • 以下を使用してファイル内で Whisper を実行します。
whisper — モデルベース — 言語 gr — タスク翻訳 LatestNote.mp3

処理が完了すると、テキスト ファイル (「latestNote.mp3.txt」という名前) が同じフォルダーに表示されます。メモ帳などのテキスト エディタで開くと、翻訳されたテキストが表示されます。

英語の音訳がより明確であるため、翻訳例を使用しました。タグ「lose」、「- language」、および「-task」を使用するだけです。したがって、単純な音声転写の場合、上記のコマンドは次のようになります。

ささやき — モデルベース LatestNote.mp3

Whisper はさまざまなオプションのいずれかを使用するため、「model」タグが必要です。お客様のニーズに最適なものを選択できるよう、それを拡張してみましょう。確認する 音声文字起こしの機能は何ですか?その役割と仕組みは何ですか?

どのモデルを選ぶべきですか?

Whisper はさまざまな言語モデルを提供します。モデルが大きくなるほど解像度は高くなりますが、ハードウェア要件も高くなります。それは次のとおりです。

  • 小さな。
  • 基礎。
  • 小さい。
  • ミディアム。
  • 大。

ほとんどの英語話者にとって、Tiny 形式または Base 形式は問題ありません。英語を母国語としない人は、中規模や大規模などの大きなモデルの方が良い結果が得られる可能性があります。

ただし、中型および大規模モデルには 8 GB を超える VRAM が必要であることに注意してください。GPU メモリ」)から生じた、裁判所により認定され、または和解により合意されたすべての損失、損害、賠償金、費用と出費(合理的な弁護士費用および訴訟費用を含む)について、貴社を防御、免責し、貴社に損害を与えない。

これらのいずれかを選択するには、コマンドの「—model」キーの後にモデルを指定します。

whisper — モデル tiny/small/medium/large [ファイル]

例えば:

ささやき声 — 小型モデル My_Voice_Note.mp3

音声文字起こしを簡素化する方法

音声を書き写すたびに Whisper コマンド全体を入力する必要があると、すぐに退屈になってしまうことがあります。プロセスを簡素化するために、グローバルにアクセス可能なバッチ ファイルを作成しましょう。

  • Windows エクスプローラーを起動し、ドライブにアクセスします。 C:.
  • スクリプト用のフォルダーを作成し、そのパスをクリップボードにコピーします。
  • Windows のスタート メニューで「パス」を検索し、選択します システム環境変数の変更.

  • ابحثعن パス変数 YOUR_USERNAME のユーザー変数の下。ダブルクリックして編集します。クリック جديد をクリックし、スクリプト フォルダーへのパスを貼り付けます。 「OK」をクリックして変更を受け入れます。

  • Windows エクスプローラーの Scripts フォルダーに戻ります。そこに「wht.bat」という名前の新しいバッチ ファイルを作成します。 「その中に」、次のコマンドを追加します。
ささやき — 小さなモデル — %1の言語

  • 「whs」と「whm」という 2 つのバッチ ファイルを作成します。
  • 最初のファイル内に次のコマンドを追加します。
ささやき — 小型モデル — %1の言語
  • このコマンドを 2 番目のファイル内に追加します。
ささやき — モデル媒体 — 言語 en %1

おめでとうございます。オーディオ ファイルで小規模、中規模、基本の Whisper モデルを簡単に使用できる 3 つのファイルが完成しました。音声ファイルをテキストに変換するには:

  • Windows ファイル エクスプローラーを使用してファイルを見つけます。
  • 空のスペースを右クリックし、「ターミナルで開く」を選択します。
  • 小文字または中言語形式を使用するには、「wht」を「whs」または「whm」に置き換えて次のコマンドを入力します。
あなたのオーディオファイル.mp3

Whisper を使用してオーディオ コンテンツをすばやく作成する

最も速いタイピストでも、私たちが話す速度には太刀打ちできません。しかし、最近まで、文書作成には書くことよりも話すことが最適ではありませんでした。

ほとんどの音声からテキストへのソリューションでは、平凡な結果しか得られませんでした。試してみる価値はあるものの、使い方が複雑であったり、高価だったりするソリューションがいくつか見つかるかもしれません。幸いなことに、Whisper がすべてを変えてくれました。

上記の手順を完了すると、コマンド 1 つを使用するだけで、音声を高精度に文字起こしまたは翻訳できるようになります。今すぐ閲覧できます メモ取り、会議、講義に最適な音声からテキストへの変換アプリ.

トップボタンに移動