音声分類
おんせいぶんるい
意味
音声分類とは、デジタル化された音声信号から物理的・統計的な特徴量を抽出し、あらかじめ定義された特定のカテゴリへと自動的に割り当てる機械学習および信号処理技術の総称です。この技術は、入力された波形データに対して、周波数スペクトルやメル周波数ケプストラム係数といった音響的特徴を計算し、深層学習モデルなどの分類器を用いて、それが何であるかを判定します。対象となる音の種類は多岐にわたり、特定の人間による発話かどうかの識別、感情の推移、発せられている言語の種類、あるいは背景にある環境音の特定までを広範にカバーします。現代の音声処理システムにおいて、高度な自動認識を実現するための基盤となる重要なプロセスです。
類義語
音声認識、音声分析