STT

AI概念
約1分で読めます

音声信号をコンピュータが理解できるテキストデータに変換するAI技術です。近年では、WhisperやGeminiなどのディープラーニングモデルを通じて、騒音のある環境でも高い精度を提供し、自動字幕の生成や議事録作成などに活用されています。

別名
音声認識Speech-to-TextASR自動音声認識音声認識

詳しい説明

STT(Speech-to-Text)は、人の音声をリアルタイムまたは非リアルタイムでテキストに変換する人工知能技術で、自動音声認識(ASR)とも呼ばれます。過去の統計的モデルから脱却し、現在はOpenAIのWhisper、GoogleのChirpといったニューラルネットワークベースのエンドツーエンド(End-to-End)モデルが主流となっています。この技術は、多言語認識、話者分離(Speaker Diarization)、リアルタイムストリーミング処理などで飛躍的な発展を遂げました。特にLLMと結合することで、単純なテキスト変換を超えて会議の要約、感情分析、外国語翻訳などへとサービス領域が拡張されており、セキュリティが重視される企業向けのオンプレミス構築型モデルの導入も活発に行われています。

ツール選定において重要な理由

STTツールを選定する際の重要な指標は単語誤り率(WER, Word Error Rate)です。単なる認識率だけでなく、背景のノイズ除去能力、専門用語(ドメイン用語)の認識性能、そして遅延時間(Latency)を考慮する必要があります。特に、発言者が複数いる会議の状況では、各話者を正確に区別する「話者分離」の性能が業務自動化のレベルを左右します。

確認すべき点

  • 韓国語特有の敬語表現や同音異義語の認識精度が高いか?
  • 話者分離(Speaker Diarization)機能をサポートしているか?
  • セキュリティのためにローカル環境(On-premise)にインストール可能なモデルか?
  • API呼び出しあたりのコストまたは時間あたりのコストが予算に適しているか?

活用例

CLOVA Note(クローバノート)のようなサービスは、STTを活用して複数人の会議をテキストで記録し、変換されたテキストをAIが要約してレポートを生成します。また、YouTube의 自動字幕生成サービスは、世界中の視聴者にリアルタイムに近いアクセシビリティを提供します。

混同しやすい用語

TTS (Text-to-Speech)

STTとは反対に、テキストデータを人の声(音声)として出力する技術です。

NLP (Natural Language Processing)

テキストを理解し分析する技術で、STTが変換したテキストの文脈を把握するために使用されます。

関連用語

TTS話者分離 (Speaker Diarization)