↑: [[G検定に関する知識]] - 音声データ(波形)をテキストに変換するAIタスク - [[話者識別]](誰が話しているか)とは異なる(何を言っているか) - 音声合成(TTS:Text-to-Speech)の逆方向タスク - 音声の特徴抽出 - フーリエ変換 → 周波数成分に分解 - STFT(短時間フーリエ変換)→ スペクトログラム生成 - MFCC(メル周波数ケプストラム係数)→ 人間の聴覚特性に基づく特徴量 - 活用例:スマートスピーカー(Alexa, Siri)・自動文字起こし・音声入力 - 深層学習([[Transformer]]ベースのWhisperなど)で精度が大幅向上