�
応用音響学
第12回 話者認識システム
情報理工学系研究科 システム情報学専攻 講師
齋藤 佑樹
2026年度 応用音響学 講義スケジュール
2
第01回 | 04/10 | 猿渡 |
第02回 | 04/17 | 猿渡 |
第03回 | 04/24 | 猿渡 |
第04回 | 05/01 | 猿渡 |
第05回 | 05/08 | 猿渡 |
第06回 | 05/15 | 猿渡 |
第07回 | 05/29 | 齋藤 |
| 06/05 | 休講 |
第08回 | 06/12 | 齋藤 |
第09回 | 06/19 | 齋藤 |
第10回 | 06/26 | 齋藤 |
第11回 | 07/03 | 齋藤 |
第12回 | 07/10 | 齋藤 |
第13回 | 07/24 | 猿渡・齋藤 (試験) |
前半
後半
応用音響学 講義の目的
3
ここから本日の内容
[復習] 音声のもつ情報と, それを扱う主な技術
5
Linguistic
(言語情報)
Para-linguistic
(パラ言語情報)
Non-linguistic
(非言語情報)
音声認識
話者認識�など
音声感情認識�など
物理
情報
物理
テキスト�音声合成
話者制御�音声合成など
感情音声合成�など
音声の認識と合成は対比される技術 (前者は抽象化, 後者は具現化)
こんにちは
こんにちは
本講義で学ぶこと: 音声の話者を計算機で認識するには?
6
最近の話者認識は本当にすごい
Microsoft Group Transcribe
(2021)
本日の講義内容
7
話者認識 (Speaker Recognition)
8
話者認識
こんにちは
話者識別 (Speaker Identification)
9
話者識別
こんにちは
…
…
確率
話者照合 (Speaker Verification)
10
話者照合
こんにちは
確率
話者ダイアライゼーション (Speaker Diarization)
11
話者ダイアライゼーション
こんにちは
Hi!
時刻
本講義でカバーする技術
12
音声
話者ID
…
認証結果
or Not
話者識別
話者照合
検出結果
or Not
なりすまし
音声検出
話者認識
本日の講義内容
13
話者識別・話者照合の基本的な処理フロー
14
音声
結果
特徴量
抽出
統計
モデル
識別/照合
話者識別・話者照合の難しさ
15
本講義では, GMM / DNN ベースの話者識別・話者照合技術を紹介
音声
結果
特徴量
抽出
統計
モデル
識別/照合
GMM ベースの話者識別/話者照合
音声
結果
特徴量
抽出
GMM
混合正規分布モデル (GMM) を用いた�話者識別・話者照合 (GMM 話者識別/照合)
17
…
混合正規分布モデル (GMM) を用いた�話者識別・話者照合 (GMM 話者識別/照合)
18
識別:�各話者の GMM 尤度を計算し,�尤度最大の GMM に�対応する話者 ID を出力
照合:�対象話者 GMM と�非対象話者 GMM の
尤度比を計算し, 検定
[Reynolds95]
混合正規分布モデル (GMM) を用いた�話者識別・話者照合 (GMM 話者識別/照合)
19
P(o は照合対象話者 c の声)�P(o は非照合対象話者の声)�の対数を変形すると,
> θ (閾値) then ACCEPT
「非照合対象話者の声」を近似する複数話者
[Reynolds95]
GMM Universal Background Model を用いた�話者識別・話者照合 (GMM-UBM 話者識別/照合)
20
GMM
学習
GMM-UBM
GMM
適応
GMM-UBM の最大事後確率 (Maximum A Posteriori) 適応
21
GMM-UBM の最大事後確率 (Maximum A Posteriori) 適応
22
i-vector を用いた話者識別・話者照合
23
DNN ベースの話者識別/話者照合
音声
結果
特徴量
抽出
DNN
GMM から DNN へ
25
d-vector / x-vector を用いた話者識別・話者照合
26
d-vector
x-vector
[Variani+14]
[Snyder+18]
GE2E 学習を用いた話者識別・話者照合
27
[Wan+18]
話者識別/話者照合システムの評価
音声
結果
特徴量
抽出
or
識別/
照合
話者照合システムの評価
| 正解 | ||
照合対象 | その他 | ||
予測 | 照合対象 | True Accept�(本人受入) | False Accept�(他人受入) |
その他 | False Reject�(本人拒否) | True Reject�(他人拒否) | |
他人受入率 (False Acceptance Rate) と�本人拒否率 (False Rejection Rate)
| 正解 | ||
照合対象 | その他 | ||
予測 | 照合対象 | True Accept�(本人受入) | False Accept�(他人受入) |
その他 | False Reject�(本人拒否) | True Reject�(他人拒否) | |
他人を照合対象として受け入れた割合
照合対象をその他として拒否した割合
等価エラー率 (Equal Error Rate)
FAR
FRR
閾値 (これより小さい場合棄却)
0
1
EER
話者識別システムの評価
| 話者1 | 話者2 | 話者3 |
話者1 | N11 | N12 | N13 |
話者2 | N21 | N22 | N23 |
話者3 | N31 | N32 | N33 |
正解
予測
本日の講義内容
33
34
最近のなりすまし音声は本当にすごい
Elon Musk’s deepfake
(2022)
代表的な音声なりすまし攻撃手段
35
なりすまし音声検出の基本的な処理フロー
36
ACCEPT
照合�対象
話者照合
その他
REJECT
攻撃者
攻撃�(e.g., VC)
なりすまし
音声検出
REJECT
なりすまし音声検出タスクの種類
37
攻撃者
攻撃�(e.g., VC)
なりすまし
音声検出
REJECT
音声なりすまし攻撃への対処
38
攻撃者
攻撃�(e.g., VC)
なりすまし
音声検出
REJECT
なりすまし音声検出モデルの構築
39
攻撃者
攻撃�(e.g., VC)
なりすまし
音声検出
REJECT
なりすまし音声検出は難しい
[Wang+20]
まとめ
まとめ
42
参考文献
43