AESSI: An Around-Ear Silent Speech Interface for Cross-Day Online Reuse without Test-Day Calibration
BibTeX
@misc{aessi-an-around-ear-silent-speech-interface-for-cross-day-online-reuse-without-test-day-calibrat,
title = {AESSI: An Around-Ear Silent Speech Interface for Cross-Day Online Reuse without Test-Day Calibration},
author = {Xiran Xu and Mochu Dong and Yujie Yan and Chenxi Wang and Yu Jiao and Jing Chen},
year = {2026},
note = {arXiv},
eprint = {2609.21436},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2609.21436v1},
} 耳周囲cEEGridで25の固定中国語文を認識。テスト日較正なしの別日ホルドアウトで平均92.24%、21日以上後のライブ250試行で98.00%。開語彙会話や患者適用は未実証。
Reading guidance
- Verdict
- full-text draft · priority high · confidence high
- Why it matters
- 皮膚接触の耳周囲SSIについて、電極再装着後もテスト日較正なしで履歴モデルをオンライン再利用できるかを、別日セッション保留と前向きライブで示した点。
- What to trust
- Basis: full text + summary. Coverage: high. 14 evidence records back the review.
- What is weak
- 混合信号の音源分離なし。緑十字固視で眼球運動を抑えるが非構音寄与を排除できないと著者も認める。ベースラインは元論文の想定と異なる制約下で再実装。 オフラインは参加者マクロ平均と3シード。ライブはseed 42のみ。チャンス率4%。クラス不均衡や被験者別オフラインの分散、統計検定の詳細は限定的。P024はスケジュール都合でライブ未実施。 開始はスペースキー、正誤は1/0キー。遮へい室または会議室。歩行・騒音・長時間装着・患者利用は未評価。電極装着と信号確認に平均約5分26秒かかるが、較正収集はない。 arXiv v1全文(要旨、方法、Table 1–4、図1–8、Discussion 5.7、Conclusion)と抽出テキストを確認。図表はテキスト抽出と要旨数値を照合。著者コードの実行や実験の独立再現、未公開補足動画の全確認はしていない。 Overclaim risk: High:92.24%や98%を開語彙認識率や較正不要の汎用SSI性能とすること、カメラVTP・EPG・超音波・鼻パッドと同列の万能比較に使うこと、脳卒中後構音障害への有効性を断定することは根拠を超える。.
- Read before
- SSI review rubric
- Read next
- SSI archive
Axes
- Task
- 3秒の無声構音窓から、事前定義25の中国語日常文のうちどれかを選ぶ閉集合文認識。開語彙の音声認識や文章生成ではない。
- Modality
- 両側耳周囲の非侵襲電気生理(混合;著者は構音関連の顔面・顎筋電や脳波成分を含むとしつつ寄与は分離しない)。3秒窓のlog-STFT。
- Hardware
- TMSi SAGA 32+、両側cEEGrid計20電極のうち接触不良で18・20を除外し18チャネル、1 kHz、平均参照、左腕接地。インピーダンスは実験前に18チャネルとも20 kΩ未満。
- Body site
- 両側耳周囲の皮膚(cEEGrid)。口腔は塞がない。左腕に接地電極。
- Output
- 25クラスの文ラベル(事前定義の中国語短文)。音声波形や自由テキストは出力しない。
- Vocabulary
- 日常行動・社会的やりとり・身体/感情状態をカバーする事前定義の中国語短文。開語彙ではない。
- Metrics
- クロスデイ(6人・3シード平均)AESSI 92.24±3.81%。Aug/MCRPなし74.16±12.62%。ベースライン例:ATCNet 41.67±12.59%、SpeechNet 35.60±18.33%、InoueNet 30.87±21.70%、チャンス4.00%。ライブ:245/250=98.00%(参加者別46/50/50/50/49)。CPU再生中央値31.70 ms(95パーセンタイル35.1 ms)。H=0・G=fullのLOPO 68.44%。共有10文事前学習からの転移で全体51.18%→81.56%。著者報告値であり独立再現ではない。
- Evaluation mode
- 歴史セッションで学習し完全な後日セッションを保留するクロスデイ評価(6人)と、電極再装着後の前向きライブ50試行×5人。テスト日のラベル付き/なし適応なし。ターゲットはRANDOM.ORGで現場生成。
- Review confidence
- high
- Overclaim risk
- High:92.24%や98%を開語彙認識率や較正不要の汎用SSI性能とすること、カメラVTP・EPG・超音波・鼻パッドと同列の万能比較に使うこと、脳卒中後構音障害への有効性を断定することは根拠を超える。
Expert take
AESSIはカメラ唇読取やSilentSpellerの口蓋電極、SottoVoceの超音波、Nasovoceの鼻パッドではなく、両側cEEGridによる耳周囲の混合電気生理で無声構音を読む。課題は開語彙会話ではなく、6文字程度の中国語日常文25クラスの文選択である。24人・44セッションから学習し、6人の完全な後日セッションをテスト日較正なしで測ると参加者マクロ平均正解率は92.24%(チャンス4.00%、Table 4では±3.81)。AugとMCRPなしの文監督のみでも74.16%で、最強適応ベースラインATCNetの41.67%を上回る。著者報告のベースライン差50.57ポイントは、元モデルの想定課題やフィルタ境界の変更も踏まえて読む必要がある。前向き評価では、履歴最終収録から少なくとも21日後に5人が電極を再装着し、凍結モデルで各50試行・計250試行を行い245正解(98.00%)。CPU再生の前処理+文予測中央値は31.70 ms。価値は「付け直した当日に較正コーパスを取らずに履歴モデルを使えるか」を耳周囲レイアウトで具体化した点にある。一方、著者自身が開語彙・自由文入力は未対応、健常者のみ、脳卒中後構音障害への適用は今後と明記する。人口事前学習なしの本人履歴0では68.44%まで落ち、本人履歴が薄いときの人口データの寄与が大きい。したがって92%や98%を、誰でも装着するだけで開語彙会話ができる性能や、顔・頸部EMG・VTPと直接比較できる汎用数字として読むべきではない。
True value
皮膚接触の耳周囲SSIについて、電極再装着後もテスト日較正なしで履歴モデルをオンライン再利用できるかを、別日セッション保留と前向きライブで示した点。
What changed
Canon before
耳周囲配列によるオンライン無声発話はInoueらが64語で示した一方、健常者はテスト日に640ラベル試行の個人較正を要した。顔・頸部sEMGやSilentSpeller、SilentWearも別日再利用の証拠を持つが、レイアウトと再装着条件ごとに評価が必要とされていた。
Delta from canon
耳周囲SSIで、テスト日の個人較正コーパスやモデル適応を禁止したドメイン汎化設定を前面に出し、完全な後日セッション保留と21日以上後の前向きオンラインを同じ系で示した。
Position in field
非侵襲の耳周囲/ウェアラブル電気生理SSIにおける、閉集合文認識と別日・再装着再利用の研究。KimuraらのSilentSpeller(EPG)・SottoVoce(超音波)・Nasovoceとはセンサ部位が異なる。
Evidence
“ 課題は事前定義25の中国語短文の閉集合認識であり、開語彙や自由作文の入力ではない。著者もLimitationで開語彙非対応を明記する。 ”
validation_scope · Abstract; §1; §5.7 Limitations · confidence 0.99
“ センサはTMSi SAGA 32+と両側cEEGrid(計20電極、実用18チャネル、1 kHz)。カメラ唇、EPG、超音波、鼻パッドではない。 ”
fact · §3.2 Participants, Equipment; Fig.3 · confidence 0.99
“ 24人から44セッション・11,000試行を収集。各セッションは10ブロック×25文=250試行。クロスデイ対象は複数セッションの6人。 ”
fact · §3.2; Abstract · confidence 0.98
“ テスト日較正なしのクロスデイ評価でAESSI平均正解率92.24±3.81%(6人・3シードの参加者マクロ平均)。チャンス率4.00%。 ”
metric · Abstract; §1; Table 4 · confidence 0.99
“ Table 4の適応ベースライン最高はATCNet 41.67%。AESSI完全系との差は著者が50.57ポイントと報告。Aug/MCRPなしのAESSIでも74.16%。 ”
metric · Table 4; §5.3 · confidence 0.98
“ 履歴最終収録から≥21日後、5人が電極再装着し凍結モデルで各50試行。245/250正解でオンライン精度98.00%(内訳46/50/50/50/49)。 ”
metric · §3.11; §4.5; Abstract · confidence 0.99
“ ライブではモデル・フロントエンド・クラス対応を訪問前に凍結し、テスト日の適応や較正収集は行わない。ターゲットは独立タブレットのRANDOM.ORGで生成。 ”
deployment_claim · §3.11 Live Online Evaluation · confidence 0.97
“ 250本の生ライブ録音を配備CPUで再生した前処理+文予測時間の中央値は31.70 ms(95パーセンタイル35.1 ms)。全予測はライブログと一致。 ”
metric · §4.5; Abstract · confidence 0.98
“ MCRPはマスクした時間周波数入力から凍結教師表現を予測する経路で、Augありでは74.16%→92.24%、Augなしでも74.16%→89.67%へ平均精度が上がると報告。 ”
actual_novelty · §3 Method MCRP; §4.2; Fig.6c · confidence 0.95
“ 本人履歴なしの厳格LOPO(H=0, G=full)では平均68.44%。H=1で人口データなし13.29%→full 73.62%と、個人履歴が薄いときの人口データの寄与が大きい。 ”
metric · §4.3; Fig.7 · confidence 0.96
“ 著者は脳卒中後構音障害などへの短文コミュニケーション支援を動機に挙げるが、検証参加者は健常者のみで、想定利用者への適用は今後の課題と明記する。 ”
author_claim · §1; §3.2; §5.7 · confidence 0.97
“ Limitation: 開語彙・自由文非対応、健常者のみ、開始/確認がキーボード依存、混合信号の筋電・脳波寄与未分離、固視指示だけでは非構音運動の影響を排除できない。 ”
limitation · §5.7 Limitations and Future Work · confidence 0.99
“ 関連研究対比として、Inoueらの耳周囲64語オンラインはテスト日に健常者640ラベル試行の微調整を含む。本論文はその較正を禁じた再利用設定を主眼とする。 ”
validation_scope · §1; §2.1 · confidence 0.96
“ 対比上、本系はSilentSpellerのEPG、SottoVoceの顎下超音波、カメラVTP、Nasovoce鼻パッドではなく、口腔を塞がない耳周囲皮膚電極である(著者のSSI分類整理と装置記述)。 ”
fact · §2.1; §3.2; Fig.1/3 · confidence 0.95
Limits
Technical limits
混合信号の音源分離なし。緑十字固視で眼球運動を抑えるが非構音寄与を排除できないと著者も認める。ベースラインは元論文の想定と異なる制約下で再実装。
Evaluation limits
オフラインは参加者マクロ平均と3シード。ライブはseed 42のみ。チャンス率4%。クラス不均衡や被験者別オフラインの分散、統計検定の詳細は限定的。P024はスケジュール都合でライブ未実施。
Deployment limits
開始はスペースキー、正誤は1/0キー。遮へい室または会議室。歩行・騒音・長時間装着・患者利用は未評価。電極装着と信号確認に平均約5分26秒かかるが、較正収集はない。
Scope limits
arXiv v1全文(要旨、方法、Table 1–4、図1–8、Discussion 5.7、Conclusion)と抽出テキストを確認。図表はテキスト抽出と要旨数値を照合。著者コードの実行や実験の独立再現、未公開補足動画の全確認はしていない。