Whisper by OpenAI

のための语音認識的神经网络,音声認識を変革するオープンソースの革命

詳細レポート

  • OpenAI Whisper は、2022 年 9 月にリリースされたオープンソースの自動音声認識 (ASR) モデルです。680,000 時間の多言語音声データでトレーニングされ、99 言語の音声テキスト変換および音声翻訳をサポートしています。これは OpenAI 研究チームによって開発され、MIT ライセンスの下でオープンソースであるため、誰でも無料でダウンロードしたり、ローカルに展開したり、自分の製品に統合したりできます。 Whisper の核となる価値は、認識、翻訳、言語検出、タイムスタンプの調整といった断片化された音声処理タスクを単一のエンドツーエンド モデルに統合することにあります。特定のシナリオに合わせて繰り返し調整する必要があった以前の音声認識ソリューションとは異なり、Whisper は非常に堅牢で、アクセント、背景雑音、専門用語への適応性が高く、そのまま使用できます。

  • Whisper の画期的な進歩は、OpenAI によって構築された非常に大規模なトレーニング データセットによってもたらされます。研究チームは、99 言語をカバーする 680,000 時間の音声をインターネットからクロールし、対応するテキスト注釈を付けた弱教師ありトレーニングを実施しました。 「弱い監視」とは、トレーニング データがプロのアノテーターによって注意深く注釈付けされておらず、自然に分散されたインターネット コンテンツから取得されたものであることを意味します。これにより、データのサイズが大幅に拡大し、モデルが実際のシーンでのさまざまなノイズや変化に対処する方法を学習できるようになります。 このモデルは、Transformer の Encoder-Decoder (seq2seq) アーキテクチャに基づいています。入力はメル スペクトログラム、出力はテキスト トークン シーケンスです。特別な制御トークンを介して、同じモデルの重みセットを、転写、翻訳、言語検出などの異なるタスク間で切り替えることができます。

  • Whisper には合計 9 つのモデル バリアントがあり、さまざまなハードウェア環境と精度要件をカバーします。 最小の小型モデルにはパラメータが 3,900 万個しかなく、占有ディスク容量は約 75 MB、ビデオ メモリは 1 GB のみ必要で、最大のモデルよりも 10 倍高速で、Raspberry Pi などの低電力デバイスで実行できます。英単語のエラー率は約 7.6% で、リアルタイムのプロトタイプ検証や低リソースのデバイスに適しています。 基本モデル (7,400 万パラメータ) は、英語の精度を小さなベースで約 5% に向上させますが、消費するリソースはほぼ同じです。これは、エントリーレベルのアプリケーションでは一般的な選択です。 小規模モデル (2 億 4,400 万のパラメーター) は、ほとんどの個人ユーザーおよび開発者にとって開始点として推奨されており、最新のラップトップでスムーズに動作し、英単語のエラー率は約 3.4% にまで下がります。 中モデル (769M パラメータ) はプロの文字起こしシナリオに適しており、約 5GB のビデオ メモリを必要とし、多言語処理能力が大幅に強化されており、単語エラー率は約 5% です。 large-v3 (パラメータ 1.55B) は主力バージョンで、英語の単語エラー率が約 2.4%、多言語の単語エラー率が約 3.5% で、約 10GB のビデオ メモリが必要です。医療記録や法的文書の転記など、非常に高い精度が要求される専門的なシナリオに適しています。 Turbo (パラメータ 809M) は、2024 年 9 月にリリースされた新しいメンバーです。ラージ v3 から知識蒸留技術によって洗練されています。精度はラージレベル(英語WERは2.5%程度)に近いですが、速度はラージの8倍と非常にコストパフォーマンスに優れています。唯一の制限は、音声翻訳タスクをサポートしておらず、文字起こしのみができることです。

  • コンテンツ作成の分野では、Whisper はポッドキャスターやビデオブロガーにとっての標準ツールとなっています。 1 時間のポッドキャスト音声をテキストに変換する作業は、専門家であれば数時間かかっていましたが、現在では Whisper ターボ モデルの助けを借りて、通常のラップトップで 10 分以内に完了することができ、.srt および .vtt 字幕形式での直接エクスポートもサポートされています。 企業オフィスのシナリオでは、会議記録の自動文字起こしにより、書面による記録の負担が大幅に軽減されます。発言者分離ツール (WhisperX など) と組み合わせると、さまざまな発言者を区別して、構造化された会議議事録を生成することもできます。 アクセシビリティの観点からは、Whisper は聴覚障害者にリアルタイムの字幕を提供するために広く使用されています。システムの内蔵マイクを通じてビデオ再生音声をキャプチャし、画面にオーバーレイする字幕を自動的に生成します。 ローカル展開は、商用クラウド サービス API に対する Whisper の主な利点です。データ プライバシーに敏感な法律事務所、病院、金融機関、その他の業界は、Whisper をローカル サーバーに導入して、データ漏洩ゼロの音声トランスクリプションを実現できます。 Whisper.cpp (C++ 実装) または Faster-whisper (CTranslate2 バックエンド) のおかげで、GPU なしでも CPU 上でスムーズに動作します。

  • これを使用する最も簡単な方法は、公式の Python パッケージをインストールすることです。 pip インストール openai-whisper ささやき録音.mp3 --モデル ターボ --言語 zh インストールと転写は 3 行のコマンドで完了します。 ローカルにデプロイしたくないユーザーのために、OpenAI は 1 分あたり約 0.006 ドルの Whisper API を提供します。音声ファイルをアップロードすると、GPU リソースを必要とせずに文字起こし結果を取得できます。 開発者は、Python SDK を通じてこれを任意のアプリケーションに統合できます。 輸入ささやき モデル = ささやき.load_model("ターボ") result = model.transcribe("audio.mp3") print(結果["テキスト"])

  • 2024 年 10 月、フォーチュンや TechCrunch などのメディアは、ウィスパーの幻覚問題について報告しました。このモデルは、元の音声に存在しない単語やフレーズを書き起こしに作成することがありました。この問題は、無音部分、背景ノイズ、および低品質オーディオで最も顕著です。ある開発者は、処理された 26,000 件のトランスクリプトのほぼすべてに幻覚コンテンツが含まれていることを発見しました。 幻覚の問題は、医療現場では特に危険です。医師が存在しない薬名や診断の説明を医療記録に口述した場合、悲惨な結果が生じる可能性があります。 OpenAIは改善を続けていると回答したが、修正の具体的なスケジュールはまだ明らかにしていない。 現在の緩和オプションには、音声アクティビティ検出 (VAD) を使用して Whisper に入力する前に非音声セグメントを削除することや、特にリスクの高いシナリオでの文字起こし結果の手動レビューが含まれます。

  • Whisper がオープンソースになってから 3 年間で、非常に活発なサードパーティのエコシステムが Whisper を中心に成長してきました。 Whisper.cpp は GitHub 上で 47,000 以上のスターを獲得しており、現時点では Apple Silicon Mac でのローカル デプロイメントに最適なソリューションです。 Faster-Whisper は、量子化と CTranslate2 バックエンドを使用して、同じ精度で速度を 4 ~ 10 倍向上させ、ビデオ メモリ要件を 50% 削減します。強化された単語レベルのタイムスタンプ機能と話者分離機能を備えた WhisperX は、字幕作成シナリオによく選ばれています。 Whisper Web もあります。WebGPU 経由で完全にブラウザ内で実行され、サーバーは不要で、プライバシーを完全に保護します。

  • Whisper は、近年最も影響力のあるオープンソース AI ツールの 1 つです。これにより、音声をテキストに変換するための技術的な敷居が低くなり、もともと大企業が所有していたプロレベルの音声認識機能が手の届くところにあります。コンテンツ作成者、開発者、研究者にとって、これは現在最もコスト効率の高い ASR ソリューションです。 幻覚の問題により、手動によるレビューなしで高リスク分野 (医療、法律) で直接使用するのは適さないことに注意してください。リアルタイム パフォーマンスも商用ストリーミング認識サービスほど良くありません。これらの特殊なシナリオでは、特定のニーズに基づいて慎重に評価する必要があります。 全体として、OpenAI Whisper は、オープン ソース、無料の強力な多言語サポート、ローカル展開という 3 つの主要な利点により、音声認識の分野で無視できないインフラストラクチャ レベルのツールとなっています。

ユーザーレビュー

  • 头像
    Bruce.Diaz_2020
    Whisper を使用して、ポッドキャストの 1 年分のアーカイブ、数百時間の音声を文字に起こします。実行には1週間以上かかりましたが、最終的な結果には非常に満足しています。各ポッドキャストには検索可能なテキスト バージョンがあります。

  • 头像
    ElzeárioMonteiro
    Whisper GUI ツールである Vibe は、登場以来、本当に救世主となっています。ついに、コマンドラインを扱う必要がなくなりました。ダウンロードして使用すると、音声をドラッグ アンド ドロップするだけでテキストが生成されるため、周囲の人にとっても便利です。

  • 头像
    Alexander.Murray_Plus
    Whisper changed my daily workflow completely. I spend most of my day voice typing now. The accuracy is a massive leap over older dictation tools.

  • 头像
    RRussell_77
    Whisper is a game changer for podcast transcription. I process 3 hours of audio daily on my M1 Mac and it handles everything flawlessly. Cant beat free and local.

  • 头像
    8kosok
    Whisperの中国語認識は本当に優れています。四川訛りの音声作品で試してみました。中型モデルでは、予想外の 90% 以上の精度を達成できます。

  • 头像
    DBell_Pro
    Whisper自体は強力ですが、一般ユーザーにとってはあまりにも不親切です。私のガールフレンドは、授業の録音を文字に起こすためにこれを使用したいと考えていましたが、Python とコマンド ラインをインストールする必要があることがわかり、断念しました。公式が絶対確実なクライアントをリリースしてくれることを願っています。

  • 头像
    杨心怡
    The hallucination issue is real though. I had it make up an entire paragraph about a patient's medication history in a medical transcript. Always double check sensitive content.

  • 头像
    枫叶398
    Whisper を数か月間使用した後、最大の感想は、無料でオフラインであるということです。機密性が必要な会社の録音を第三者にアップロードする必要がなくなり、データのセキュリティが非常に重要になります。

  • 头像
    Richard.Castillo_2022
    Whisperlarge-v3を使って日本のアニメのセリフを実行してみたところ、日本語の認識精度はかなり高かったです。早口の会話でも正確に文字に起こすことができました。オープンソースモデルがこのレベルに到達したことは驚くべきことです。

  • 头像
    Jordan.Powell7
    Whisper は、低ビットレートのオーディオを処理する場合にも優れたパフォーマンスを発揮します。 8kbps の通話録音があり、large-v3 はそれを実際に 7788 に転写できます。これは予想よりもはるかに優れています。

  • 头像
    Thomas_Wilson
    Whisperlarge-v3 をローカルにデプロイすると、RTX 3060 は問題なく動作しますが、ビデオ メモリが不足します。 1 時間の音声を処理するには約 6 分かかりますが、これは許容範囲内です。

  • 头像
    BMoralesX666
    I switched from Google Speech-to-Text to Whisper for my startup. Cost went from ~$300/month to essentially zero. The accuracy is comparable for clean audio.

  • 头像
    RGonzalez_66
    Whisper をデプロイする際には、主に互換性のない ffmpeg バージョンと Python の依存関係の競合が原因で、多くの落とし穴がありました。多くの心配を省くため、conda を直接使用して仮想環境を構築することをお勧めします。

  • 头像
    NFTCollector54
    ウィスパーを使用すると、もう元には戻れません。私はいつも iFlytek を使用していましたが、毎月の自由時間が足りませんでした。 Whisper は無制限でオフラインであるため、ヘビー ユーザーにとっては非常に重要です。

  • 头像
    BMurphy_778
    Whisper's multilingual support is unmatched. We handle 8 languages for our customer service transcripts and it handles accents remarkably well. Big fan.

  • 头像
    DeFiMgx
    iFlytek と比較すると、Whisper の中国語の精度は確かに少し劣りますが、無料であり、多言語サポートが充実しているため、より優れています。国境を越えたビジネスを行う場合、中国語、英語、日本語、韓国語を使用する必要があることが多いのですが、Wh​​isper は素晴らしいツールです。

  • 头像
    MelissaKingSr
    Whisper は、複数の人が同時に話している状況では少し盲目になるため、話者分離モデルと併用する必要があります。そうは言っても、単一音声チャンネルのパフォーマンスは本当に印象的です。

  • 头像
    Robert.Flores_7754
    What surprises me most about Whisper is how well it handles technical vocabulary. I dictate code documentation and API specs all day and it gets them right 95% of the time.

  • 头像
    Teresa.Lewis_99945
    ポッドキャストの字幕をバッチ文字起こしするために使用しています。 Whisper は毎日数十の音声ファイルを処理できます。 Python スクリプトの自動化を使用すると、手動介入なしで一連のプロセスを実行できます。

  • 头像
    CYhar
    Running Whisper large-v3 on CPU is painful. 1 hour of audio takes about 30 minutes even with whisper.cpp. But for batch processing it's absolutely worth the wait.

  • 头像
    丁贞
    Whisper では専門用語がひっくり返ることもあり、医学用語や法律条文の認識率はあまり良くありませんが、日常会話や通常の会議メモなどには全く問題ありません。

  • 头像
    sfvr1qm
    私は Whisper を使用して授業の録音を書き起こしましたが、中型モデルでは 45 分の授業を実行するのに約 7 ~ 8 分かかります。 SRT 字幕をエクスポートし、メモ作成ソフトウェアで使用すると、レビューの効率が 2 倍になります。

  • 头像
    iJorisSchmitt_dev
    Whisper + pyannote for diarization is the killer combo for meeting transcription. Not as polished as Otter but way more control over your data.

  • 头像
    Jason.RuizJr2
    量子化バージョンの Faster-Whisper を試してみたところ、推論速度はほぼ 2 倍になり、精度はほとんど低下しませんでした。大規模な文字起こしが必要なユーザーは、ぜひ試してみてください。

  • 头像
    BRuizSr
    Whisper API は Alibaba Cloud Function Compute にデプロイされ、通話量に応じて料金が発生するため、非常に低コストです。 50 万分の音声処理のコストは 2,000 元未満で、商用サービスを購入するよりもはるかに費用対効果が高くなります。

  • 头像
    高雅
    I built a small desktop app wrapping Whisper for my non-tech colleagues. They love it. The underlying model is amazing — it just needs better UI to reach mainstream users.

  • 头像
    trueMoniqueHanke_dev
    Whisper の幻覚の問題は存在しますが、VAD 前処理を追加することで基本的に解決できます。録音をクラウドにアップロードし、データの処理方法を教えてくれない人よりも優れています。

  • 头像
    wef3bkdk
    ウィスパーが中国の古典詩や古代詩を認識していたことも驚くべきことでした。 「三字古典」と「滕太子亭序文」の朗読音声を試してみましたが、大型モデルは基本的に一語一語です。このトレーニング データは非常に豊富です。

  • 头像
    HariniSaldanha
    Tested Whisper against Deepgram Nova-3 on noisy field recordings. Whisper held its own surprisingly well. The gap has narrowed a lot since 2024.

  • 头像
    Terry.Fisher007014
    Dragon NaturallySpeaking から Whisper に切り替えて、導入には少し手間がかかりましたが、現在の音声文字起こしの効果は旧製品よりも優れており、無料です。