IBM、新音声認識が3.5時間音声を1秒で文字起こし
AI要約 Unite.AI 元記事を読む
IBMは2026年8月25日、コンパクトな英語音声認識モデル「Granite Speech 5.0 TurboCTC」とその非商用版をリリースしました。これらのモデルは、3.5時間以上の音声をわずか1秒で文字起こしできる、これまでにない高スループットを達成したとIBMは主張しています。それぞれ4.7億のパラメータを持つこれらのモデルは、単一のNVIDIA H200 GPU上で12,600 RTFxを超える集計スループットを記録しました。
なぜ重要か
この画期的な高速処理能力は、音声AIのリアルタイム処理や大規模データ処理の効率を飛躍的に向上させます。また、モデルがコンパクトであるため、リソースの制約がある環境や多様なデバイスでのAI活用がさらに加速されると期待されます。
背景
近年、音声認識技術はコンタクトセンター、議事録作成、スマートデバイスなど、多岐にわたる分野でその重要性を増しています。業界全体では、より高速かつ高精度でありながら、軽量で効率的なモデルの開発が主要なトレンドとなっており、これはAIの普及と実用化を推進する上で不可欠です。
今後の注目点
今後、この超高速音声認識技術がクラウドベースのAIサービスやオンデバイスAI、さらには新たなAIアプリケーションの進化をどのように加速させるか注目されます。
原題: IBM Says Granite Speech 5.0 Transcribes 3.5 Hours of Speech in One Second