↑: [[G検定に関する知識]]
- 音声データ(波形)をテキストに変換するAIタスク
- [[話者識別]](誰が話しているか)とは異なる(何を言っているか)
- 音声合成(TTS:Text-to-Speech)の逆方向タスク
- 音声の特徴抽出
- フーリエ変換 → 周波数成分に分解
- STFT(短時間フーリエ変換)→ スペクトログラム生成
- MFCC(メル周波数ケプストラム係数)→ 人間の聴覚特性に基づく特徴量
- 活用例:スマートスピーカー(Alexa, Siri)・自動文字起こし・音声入力
- 深層学習([[Transformer]]ベースのWhisperなど)で精度が大幅向上