↑: [[G検定に関する知識]]
- Mel-Frequency Cepstral Coefficients(メル周波数ケプストラム係数)
- 音声認識・話者認識で最もよく使われる特徴量
- メル尺度(人間の聴覚特性)に基づいて音声の特徴を抽出 ← 周波数成分をそのまま使わない
- 処理: 音声波形 → [[フーリエ変換]] → メルフィルタバンク → DCT変換 → MFCC
- 音声波形を生成するモデルではなく、特徴量抽出の手法
- 音声合成専用ではない←音声認識・話者認識の入力特徴量として広く利用(誤答パターン注意)
- 1フレーム(数十ミリ秒)を十数個の数値で表現
- 計算手順:[[FFT]] → メルフィルタバンク → 対数 → 逆DCT
- [[隠れマルコフモデル|HMM]]時代から現在の[[DNN]]まで広く使われる
- cf. [[メル尺度]], [[FFT-G検定]], [[隠れマルコフモデル]], [[音声処理]]