← SSI archive · Review rubric

2025 · arXiv · Field expert review · confidence medium

Articulatory Feature Prediction from Surface EMG during Speech Production

Jihwan Lee, Kevin Huang, Kleanthis Avramidis, Simon Pistrosch, Monica Gonzalez-Machorro, Yoonjeong Lee, Björn Schuller, Louis Goldstein, Shrikanth Narayanan

BibTeX
@misc{articulatory-feature-prediction-from-surface-emg-during-speech-production,
  title = {Articulatory Feature Prediction from Surface EMG during Speech Production},
  author = {Jihwan Lee and Kevin Huang and Kleanthis Avramidis and Simon Pistrosch and Monica Gonzalez-Machorro and Yoonjeong Lee and Björn Schuller and Louis Goldstein and Shrikanth Narayanan},
  year = {2025},
  note = {arXiv},
  eprint = {2505.13814},
  archivePrefix = {arXiv},
  url = {http://arxiv.org/abs/2505.13814v2},
}

発声時の筋電から舌・唇・顎などの調音表現を推定して音声に戻す研究。音声由来の代理正解との相関は約0.9だが、単語誤り率は既存方式12.6%に対し15.5%。男性1人の有声発話で、実測調音や無声の意思伝達を検証した結果ではない。

Verdict: full-text draftPriority: highConfidence: mediumBasis: full text + summaryCoverage: high

Reading guidance

Verdict
full-text draft · priority high · confidence medium
Why it matters
筋電と音声の間を解釈できる形にする設計と、電極を減らす際の特徴予測と発話内容の誤りを別々に測る点。相関が高いことと、言いたい内容が正しく伝わることを分けて読める。
What to trust
Basis: full text + summary. Coverage: high. 20 evidence records back the review.
What is weak
教師と評価基準の調音位置は音声モデルの推定に依存し、生理的な位置の正確さを独立に確認していない。モデルは合成に必要な話者特徴を予測せず外部モデルから得る。特徴相関の高さだけでは発話内容の復元や制御可能性を保証しない。 同一男性話者、試験99発話。表2・3は95%信頼区間付きだが、算出単位・反復手順・統計的有意差の詳細は不明。元音声でも単語誤り率8.6%があり、合成誤差と認識器の誤差を区別する必要がある。人の聞き取り評価はなく、電極選択の独立した検証分割も明記されない。 無声調音、患者、話者間汎化、装着し直し、歩行、長時間利用、携帯端末、実時間の会話は未検証。電極を減らした成績を装着装置の実用性と同一視できない。 固定arXiv 2505.13814v2の全5ページを読み、図1–5・表1–3をPDF画像で照合。著者GitHubのREADMEとファイル一覧の公開を確認したが、コード実行、データ・モデルの完全性、音声の聴取評価、独立実験再現は行っていない。書誌情報は固定コンテキストの値を保持。 Overclaim risk: high:約0.9の相関を正解率90%や実測調音の精度に読み替えない。音声類似度の向上を内容認識の改善に置き換えず、発声データの成績を無声SSIの性能としない。4電極でも伝達精度を維持したとはいえない。.
Read before
SSI review rubric
Read next
SSI archive

Axes

Task
発声筋電から舌・唇・顎の位置に対応する12次元特徴、声の高さ、音量を予測し、既存の調音合成器で音声波形を再構成する。電極を減らした場合も比較する。
Modality
surface electromyography (sEMG):発声時の顔・顎・首の表面筋電。学習・評価の調音特徴は同時音声から推定した代理正解であり、実測の調音センサー入力ではない。
Hardware
既存データの8電極表面筋電1000 Hzと内蔵マイク音声16 kHz。筋電は60 Hz雑音除去、2 Hz高域通過、突発雑音抑制後689 Hzへ再標本化。装置型番などの詳細は先行研究に委ねられる。
Body site
顔・顎・首の8電極。頬、顎の角、顎下、喉頭付近など。電極位置は表1・図1、調音表現の6点は図2に記載。
Output
中間出力は12次元の調音位置、声の高さ、音量と学習補助の音素予測。最終評価は再構成した音声波形。文字起こしは評価用認識器による。
Vocabulary
open-vocabulary:本文が明記する有声の連続発話。閉じた単語分類ではないが、未知単語だけを分けた試験ではない。
Metrics
8電極の調音位置・音量の相関は約0.9、声の高さは本文で約0.6。表2:提案の音素誤り率36.0±2.7%、単語誤り率15.5±3.5%、SpeechBERTScore 84.4±0.7%。既存Gaddy方式は33.9±3.1%、12.6±2.2%、77.9±0.8%。音声からの再合成は32.9±4.7%、10.6±3.7%、86.1±0.9%。元音声は30.1±5.3%、8.6±3.7%、100%。表3:4電極の調音位置/音量/高さの相関0.882±0.017/0.904±0.057/0.538±0.342、単語誤り率22.9±3.7%。3電極31.6±3.9%、2電極46.9±5.1%。±は著者記載の95%信頼区間で、正解率や人の評点ではない。
Evaluation mode
オフラインの同一話者内評価。音声由来の代理正解とのPearson相関、音素認識器による音素誤り率、Whisper large-v3による単語誤り率、参照音声とのSpeechBERTScoreを測定。電極1個の除去・単独使用と4/3/2電極条件を比較。
Review confidence
medium
Overclaim risk
high:約0.9の相関を正解率90%や実測調音の精度に読み替えない。音声類似度の向上を内容認識の改善に置き換えず、発声データの成績を無声SSIの性能としない。4電極でも伝達精度を維持したとはいえない。

Expert take

この論文の問いは、筋電を音声へ直接変換する代わりに、舌・唇・顎の動きに対応する表現を挟めば、変換過程と電極の役割を読み解けるか、というものだ。顔や首の8電極から得た筋電を畳み込み層とTransformerで処理し、12次元の調音位置、声の高さ、音量を予測する。その特徴を既存の合成器で音声に戻す。重要なのは、調音の正解が同時に計測した舌や唇の動きではなく、音声から別モデルで推定した代理正解である点だ。位置と音量の相関は約0.9だが、これは動作の実測精度90%を意味しない。声の高さの相関は本文で約0.6と低い。米国英語の男性1人、7565発話・15.6時間の有声発話で学習し、試験は99発話。単語誤り率は提案15.5%に対し既存方式12.6%で、発話内容の認識は改善していない。一方、参照音声との特徴類似度を測るSpeechBERTScoreは77.9%から84.4%へ上がる。これは人の聞き取り正解率でも、直接の聴取評点でもない。電極を2・3・4・6番の4個に絞ると、調音位置の相関0.882、音量0.904を保つが、単語誤り率は22.9%に増える。さらに3電極で31.6%、2電極で46.9%となり、特徴の似方だけでは伝達品質を判断できないことが分かる。電極除去や単独使用で得た関連を生理的な因果関係とせず、配置を考える手掛かりと読むのが妥当だ。合成にはモデル外で得る話者の特徴も必要で、その抽出条件は本文だけでは十分に特定できない。価値は解釈しやすい中間表現と電極選択の検討にあり、無声発話、未知の利用者、患者、日常の会話や実時間処理への有効性は未確認である。

True value

筋電と音声の間を解釈できる形にする設計と、電極を減らす際の特徴予測と発話内容の誤りを別々に測る点。相関が高いことと、言いたい内容が正しく伝わることを分けて読める。

What changed

Canon before

既存の筋電音声合成は音響特徴や潜在表現への変換が中心で、筋活動と調音の対応を解釈しにくい。十分な同期筋電・実測調音データがない一方、音声から調音表現への変換とその逆変換は先行研究にある。

Delta from canon

既存の筋電符号化器と音声由来調音モデルを接続し、調音位置・高さ・音量を明示的な中間表現にする。電極数だけでなく各電極がどの位置の予測に関係するかを調べる。

Position in field

声を出さずに伝えるSSIに関連する筋電音声合成の基盤研究。ただし実験は発声中のみであり、無声調音や発声困難者の意思伝達を実証した研究ではない。

Evidence

“ 著者は表面筋電から調音特徴を経て音声波形を復号する初の方法と主張する。初出性を独立に網羅検証した結果ではない。 ”

author_claim · p.1 Abstract; §1 Introduction · confidence 0.98

“ 3個のResNetブロックと6層Transformerからなる符号化器を用い、隠れ次元768。調音位置、高さ、音量、補助音素の4予測器は線形投影層。 ”

fact · p.2 §2.1; Figure 3 · confidence 0.99

“ 調音位置・高さ・音量はL2損失、音素はフレーム単位交差エントロピー。高さ・音量・音素の係数は0.5・1.0・0.5。 ”

fact · p.2 §2.2; Equation (1) · confidence 0.99

“ 米国英語の男性1人による有声発話7565発話・15.6時間。検証200発話、試験99発話で、実験は有声のopen-vocabulary発話に限定する。 ”

validation_scope · pp.2–3 §3.1 Dataset · confidence 0.99

“ 顔・顎・首の8電極で1000 Hzの筋電を記録し、前処理後689 Hzへ変換。音声は内蔵マイクの16 kHz。電極位置を表1に記載する。 ”

fact · p.2 §3.1; Figure 1; Table 1 · confidence 0.99

“ 調音教師は実測EMAではなく同時音声から推定。舌3点、唇2点、顎1点の各x/yで12次元、高さ、音量を含む。50 Hzから86.16 Hzへ変換し、高さは130を引き70で割る。 ”

fact · p.2 §3.1; Figure 2 · confidence 0.99

“ AdamW、バッチ32、学習率0.0005、重み減衰10^-7で学習し80エポック時点を評価。実験はNvidia A40 GPU 1台。推論時間の測定ではない。 ”

fact · p.3 §3.2 Experimental Setup · confidence 0.99

“ 音声から推定した代理正解とのPearson相関は調音位置と音量で約0.9、高さは本文表現で約0.6。生理的な動きの実測精度や認識正解率ではない。 ”

metric · p.3 §4.1; Figure 4 · confidence 0.98

“ 電極を1個除いた条件と1個だけ用いる条件を全8電極と比較し、特徴相関の低下率を評価する。図5左右は色の尺度の向きが逆。関連の比較であり生理的な因果介入ではない。 ”

validation_scope · p.3 §4.2; p.4 Figure 5 · confidence 0.99

“ 喉頭付近の電極4単独では音量相関0.73、高さ0.32で、単独電極の中では最も高い。全8電極の成績とは別条件。 ”

metric · p.3 §4.2, electrode 4 paragraph · confidence 0.99

“ 音素誤り率はWav2Vec2-XLSR、単語誤り率はWhisper large-v3で評価し、MFAの転記と比較。SpeechBERTScoreは元音声を参照にする特徴類似度で、今回の人の聴取評点ではない。 ”

validation_scope · p.3 §4.3 Intelligibility of Decoded Speech · confidence 0.99

“ 提案の音素誤り率36.0±2.7%、単語誤り率15.5±3.5%、SpeechBERTScore 84.4±0.7%。既存Gaddy方式は33.9±3.1%、12.6±2.2%、77.9±0.8%。認識誤りは悪化する一方で音声類似度は高い。±は95%信頼区間。 ”

metric · p.3 Table 2; §4.3 · confidence 0.99

“ 元音声の音素誤り率30.1±5.3%、単語誤り率8.6±3.7%、SpeechBERTScore 100%。音声由来の目標調音から再合成した条件は32.9±4.7%、10.6±3.7%、86.1±0.9%。いずれも筋電から予測する条件ではない。 ”

metric · p.3 Table 2; §4.3 Ground truth/Resynthesis definitions · confidence 0.99

“ 電極2/3/4/6の4個で調音位置・音量・高さの相関0.882±0.017、0.904±0.057、0.538±0.342。音素誤り率39.7±5.2%、単語誤り率22.9±3.7%、SpeechBERTScore 83.2±0.7%。 ”

metric · p.4 Table 3, Set of 4 row; §4.4 · confidence 0.99

“ 3電極2/4/6の相関は位置0.859±0.021、音量0.892±0.048、高さ0.562±0.343、音素誤り率46.1±6.0%、単語誤り率31.6±3.9%、SpeechBERTScore 82.1±0.8%。2電極2/4では相関0.816±0.023、0.870±0.078、0.576±0.286、音素誤り率52.1±4.6%、単語誤り率46.9±5.1%、SpeechBERTScore 79.9±0.7%。±は95%信頼区間。 ”

metric · p.4 Table 3, Set of 3 and Set of 2 rows · confidence 0.99

“ 著者は調音特徴への関連をもとに4電極を選び、同じ組合せが先行研究でも良好だったと述べる。配置選択の考え方を示すが、全配置に対する最適性や探索時間削減の定量結果は示さない。 ”

actual_novelty · p.4 §4.4 Ablation Study · confidence 0.96

“ 著者自身が、調音位置が実測ではなく音声からの推定に依存すること、1話者に限定されることを明記する。実測運動との一致や未知話者への汎化は未確認。 ”

limitation · p.4 §4.5 Limitations · confidence 0.99

“ モデルは合成器が必要とする話者特徴を生成せず、外部モデルから取得する。抽出元や試験音声の使用範囲は本文だけでは十分に特定できない。 ”

limitation · p.4 §4.5 Limitations · confidence 0.99

“ 本稿の評価は有声発話・単一話者の自動指標で、無声調音、患者、歩行、長期装着、携帯端末、実時間遅延や人の聞き取りの試験は報告しない。SSIへの関連は基盤技術としての位置付けにとどまる。 ”

limitation · pp.2–4 §§3.1–4.5; p.4 §5 Conclusion · confidence 0.97

“ 表2・3は95%信頼区間を掲げるが、算出単位・反復手順や電極選択のための独立検証分割の詳細は不明。区間の重なりだけで同等性や有意差を結論しない。 ”

limitation · p.3 §3.2, Table 2; p.4 §4.4, Table 3 · confidence 0.96

Limits

Technical limits

教師と評価基準の調音位置は音声モデルの推定に依存し、生理的な位置の正確さを独立に確認していない。モデルは合成に必要な話者特徴を予測せず外部モデルから得る。特徴相関の高さだけでは発話内容の復元や制御可能性を保証しない。

Evaluation limits

同一男性話者、試験99発話。表2・3は95%信頼区間付きだが、算出単位・反復手順・統計的有意差の詳細は不明。元音声でも単語誤り率8.6%があり、合成誤差と認識器の誤差を区別する必要がある。人の聞き取り評価はなく、電極選択の独立した検証分割も明記されない。

Deployment limits

無声調音、患者、話者間汎化、装着し直し、歩行、長時間利用、携帯端末、実時間の会話は未検証。電極を減らした成績を装着装置の実用性と同一視できない。

Scope limits

固定arXiv 2505.13814v2の全5ページを読み、図1–5・表1–3をPDF画像で照合。著者GitHubのREADMEとファイル一覧の公開を確認したが、コード実行、データ・モデルの完全性、音声の聴取評価、独立実験再現は行っていない。書誌情報は固定コンテキストの値を保持。