← SSI archive · Review rubric

2025 · arXiv · Field expert review · confidence medium

LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning

Kang Yang, Yifan Liang, Fangkun Liu, Zhenping Xie, Chengshi Zheng

BibTeX
@misc{lta-l2s-lexical-tone-aware-lip-to-speech-synthesis-for-mandarin-with-cross-lingual-transfer-lear,
  title = {LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning},
  author = {Kang Yang and Yifan Liang and Fangkun Liu and Zhenping Xie and Chengshi Zheng},
  year = {2025},
  note = {arXiv},
  eprint = {2509.25670},
  archivePrefix = {arXiv},
  url = {http://arxiv.org/abs/2509.25670v1},
}

中国語の口元映像からの音声合成で、英語の事前学習と声調を意識した生成を組み合わせ、比較対象より文字・声調の誤りを減らした。ただし文字誤り率61.2%が残り、実際の無声発話や実時間会話の成功を示したわけではない。

Verdict: full-text draftPriority: highConfidence: mediumBasis: full text + summaryCoverage: high

Reading guidance

Verdict
full-text draft · priority high · confidence medium
Why it matters
音質の高さだけでは中国語の内容や声調の正確さを保証できないことを、比較表と構成要素の検証から区別できる点。SSIでは、声調を持つ言語への転移と生成表現を検討する材料になる。
What to trust
Basis: full text + summary. Coverage: high. 16 evidence records back the review.
What is weak
視覚的に似た音や見えにくい声調を、学習済み表現と生成モデルで補うため、自然に聞こえても内容の誤りは残る。事前学習モデル、音声単位の教師情報、話者表現、音声合成器に依存する。話者表現を何の音声から得るかが明確でないため、完全に映像だけで声を再現できるとは断定しない。 CERとTERはFunASRによる転記とg2pM処理に依存し、テストの正解文字ラベルもFunASRで再作成している。機械認識による評価の影響を切り分けた検証はない。MOSは中国語母語話者15人・モデル当たり30標本だが、±の定義、標本選択・提示順、反復学習数、検定は不明。 実験は既存の音声映像データを使う。声を出さずに口を動かした専用収録、発声障害のある利用者、移動・遮蔽・撮影角度変化、端末内処理、実時間対話の評価は報告されない。話者表現に用いる参照音声の取得条件も不明。 固定対象arXiv v1全5ページの本文・図1・表1–4・参考文献に基づく。図1と表1–4はPDF描画でも照合。書誌情報は保存済みコンテキストを維持する。論文の報告値と設計の評価であり、デモ試聴・実装実行・原データによる独立再現ではない。 Overclaim risk: High:音質評定を内容の正解率に、声調誤り率をF0の直接精度に、未知話者分割を参照音声不要に、音声を使わない映像推論を実際の無声調音での成功に読み替えると過大評価になる。.
Read before
SSI review rubric
Read next
SSI archive

Axes

Task
中国語の口元映像から音声を合成するlip-to-speech。語の識別と声調を含む内容の伝わりやすさ、自然さ、話者の声の類似度を評価する。
Modality
口元映像。学習には音声映像の対データを使い、音声合成には話者表現も条件として与える。
Hardware
CN-CVSの音声映像を利用。dlibで68顔特徴点を検出し、位置合わせ後に口元中心の96×96画素を白黒化する。収録カメラ機種や撮影距離は本論文では不明。
Body site
lip; face
Output
合成音声。文字列の入力装置や命令分類器ではない。
Vocabulary
CN-CVSの中国語の連続発話。固定少数命令の分類ではないが、未知語を含む自由会話への性能は未確認。
Metrics
Table 1:LTA-L2SはSTOI-Net 0.907、DNSMOS 3.200、CER 61.2%、TER 40.9%、SECS 0.828。IntelligibleはCER 74.9%、TER 50.3%。LTBSはSTOI-Net 0.909、DNSMOS 3.291でLTA-L2Sを上回るが、CER 87.3%、TER 56.4%。Table 2:自然さ3.95±0.34、内容の伝わりやすさ3.88±0.30、話者類似度3.89±0.42。真の音声は自然さ4.48±0.16、内容の伝わりやすさ4.54±0.15。±の定義は不明。
Evaluation mode
CN-CVSの未知話者用分割を使うオフライン音声合成比較。客観指標はSTOI-Net、DNSMOS、文字誤り率CER、声調誤り率TER、話者埋め込みのコサイン類似度SECS。中国語母語話者15人がモデル当たり30標本を5段階で自然さ・内容の伝わりやすさ・話者類似度について評定する。部品除去と初期重み・音声単位の置換比較も行う。
Review confidence
medium
Overclaim risk
High:音質評定を内容の正解率に、声調誤り率をF0の直接精度に、未知話者分割を参照音声不要に、音声を使わない映像推論を実際の無声調音での成功に読み替えると過大評価になる。

Expert take

LTA-L2Sの価値は、口元映像からの音声合成で、音が自然に聞こえることと、言葉・声調が正しく伝わることを分けて扱う点にある。英語で事前学習した視覚表現を中国語へ調整し、音声認識で調整済みの音声単位から声の高さの変化を生成する。CN-CVSの未知話者用分割では、比較対象Intelligibleの文字誤り率74.9%・声調誤り率50.3%に対し、61.2%・40.9%を報告する。中国語母語話者15人の5段階評定でも、自然さ3.95、内容の伝わりやすさ3.88、話者類似度3.89と、掲載された比較方式を上回る。ただし文字誤り率はなお高く、声調指標も認識文字列を変換して求めており、音響的な声調を直接正しく復元した割合ではない。後処理を外すとDNSMOSは3.200から2.942へ下がる一方、文字誤り率は61.2%から61.0%、声調誤り率は40.9%から40.7%へわずかに改善するため、全構成要素が全指標を改善するとはいえない。音声映像データでの合成評価を、声を出さずに口を動かした利用者の意思伝達へそのまま拡張することもできない。参照音声の条件、分割の詳細、統計的な確かさ、実時間性は未確認であり、声調を持つ言語向けの設計を比較する研究として読むのが適切である。

True value

音質の高さだけでは中国語の内容や声調の正確さを保証できないことを、比較表と構成要素の検証から区別できる点。SSIでは、声調を持つ言語への転移と生成表現を検討する材料になる。

What changed

Canon before

口元映像から音声を合成する研究には、事前学習した視覚表現、音声単位の教師情報、生成モデルを使う方式が既にある。本論文は、中国語では見た目が似た音の区別と意味を変える声調が特に難しいと位置付ける。

Delta from canon

英語1759時間で事前学習したAV-HuBERT Baseの重みを中国語へ転用し、音声認識で調整済みのwav2vec 2.0第9層から得る2000種類の音声単位を用いる。音声単位と視覚・話者表現からF0を生成し、粗い音響特徴を二段階目の生成モデルで精細化する。

Position in field

映像を用いたSSIに関連する中国語の音声再構成研究。脳波や筋電からの解読ではなく、収録済みの発話映像から音声を合成する評価である。

Evidence

“ 著者は中国語の口元映像からの合成に対し、英語からの転移学習、声調情報を含む音声単位に条件付けたF0生成、二段階の音響特徴精細化を提案する。 ”

author_claim · p.1 Abstract, Introduction, Section 2; p.2 Figure 1 · confidence 0.99

“ 視覚符号化器はAV-HuBERT Baseに基づき、英語1759時間で事前学習した重みで初期化して中国語の第一段階学習で調整する。 ”

fact · p.2 Section 2.1 Visual Encoder · confidence 0.99

“ 音声単位は音声認識で調整済みのwav2vec 2.0第9層の特徴をk-meansで2000群に分けて得る。4層のConformerで予測し、平滑化係数0.1の交差エントロピーで学習する。2000は単語数ではない。 ”

fact · p.2 Section 2.2 and Eq.1; p.3 Section 3.2 · confidence 0.99

“ F0と有声・無声ラベルをYAAPTで抽出し、視覚特徴・音声単位・話者埋め込みからF0を生成する。話者埋め込みは事前学習した話者照合モデル由来だが、参照音声の出所・長さ・テスト音声との独立性は本文に明記されない。 ”

fact · pp.2–3 Section 2.3, Figure 1, Eqs.2–3 and footnote 2 · confidence 0.99

“ 第一段階の音声単位・有声無声・F0・メル音響特徴の損失重みは0.1/1/1/1。第二段階では第一段階を固定してフローマッチングによる後処理だけを学習する。音声合成器はCN-CVSで事前学習したHiFi-GANを使用する。 ”

actual_novelty · p.3 Sections 2.4–2.5, Eq.5 and Section 3.2 · confidence 0.98

“ CN-CVS speech subsetの規模は273.4時間・2529話者。未知話者用の元分割に従い、中国語以外を除き、テストの文字ラベルをFunASRで再転記する。除外後の分割別規模・IDや語彙非重複の確認は本論文では示されない。 ”

validation_scope · p.3 Section 3.1 Datasets · confidence 0.99

“ 68顔特徴点で位置合わせし口元の96×96画素を白黒化する。音声は16 kHz、80メル帯域、窓40 ms・間隔10 ms。2台のNVIDIA 4090で各段階100 epochを学習し、F0と後処理の推論にはそれぞれNFE 24を用いる。実測の生成遅延は記載されない。 ”

fact · p.3 Section 3.2 Implementation Details · confidence 0.99

“ CERとTERはFunASRの転記とg2pM処理から計算すると記載される。TERは音響波形の声調を直接聴取・判定した正解率ではなく、機械転記に依存する。テストの正解文字ラベルもFunASRで再作成している。 ”

limitation · p.3 Sections 3.1 and 3.4 Evaluation Metrics · confidence 0.98

“ Table 1でLTA-L2SのCERは61.2%、TERは40.9%。Intelligibleの74.9%・50.3%より低い。LTA-L2SのSTOI-Net 0.907、DNSMOS 3.200はLTBSの0.909・3.291を下回る。SECSは0.828で掲載された合成方式中で最も高い。 ”

metric · p.4 Table 1 and Section 4.1; PDF table visually checked · confidence 0.99

“ 中国語母語話者15人がモデル当たり30標本を5段階評価。LTA-L2Sは自然さ3.95±0.34、内容の伝わりやすさ3.88±0.30、話者類似度3.89±0.42。真の音声は自然さ4.48±0.16、内容の伝わりやすさ4.54±0.15。±の定義は本文にない。 ”

metric · p.3 Section 3.4; p.4 Table 2 and Section 4.2; PDF table visually checked · confidence 0.99

“ 後処理を除くとDNSMOSは3.200から2.942へ下がるが、CERは61.2%から61.0%、TERは40.9%から40.7%へわずかに改善する。後処理による音質向上と内容誤りの改善は同一ではない。 ”

metric · p.4 Table 3, w/o postnet row, Section 4.3; PDF table visually checked · confidence 0.99

“ F0生成のフローマッチングをL1損失へ替えるw/o f0 cfmではCER 63.2%、TER 42.0%。ピッチ予測全体を外すw/o pitchではCER 61.5%、TER 40.9%、STOI-Net 0.877、DNSMOS 2.731。ピッチの導入が全指標を一様に改善するとはいえない。 ”

metric · p.4 Table 3 and Section 4.3; PDF table visually checked · confidence 0.99

“ 音声単位の教師情報を外すとCER 69.2%、TER 46.2%、SECS 0.660。英語の事前学習で初期化しないRandom Init.ではCER 74.6%、TER 49.1%。これらの比較は音声単位と転移学習の有用性を支持するが、誤りのない合成を意味しない。 ”

metric · p.4 Tables 3–4 and Section 4.3; PDF tables visually checked · confidence 0.99

“ 音声単位を事前学習HuBERT第9層の2000群へ置換するとCER 64.4%、TER 42.8%となり、提案方式の61.2%・40.9%より悪化する。一方DNSMOS 3.206とSECS 0.831は提案方式の3.200と0.828を上回る。 ”

metric · p.4 Table 4, HuBERT Unit row, Section 4.3; PDF table visually checked · confidence 0.99

“ 本文は改善をsignificantと表現するが、検定、学習反復数、MOSの±の定義は示さない。4.3節の初期化比較の説明にCER/PERとある一方、Table 4の列はCER/TERであり、独立したPERの測定値は提示されない。 ”

limitation · pp.3–4 Sections 3.3–3.4 and 4.1–4.3, Tables 1–4 · confidence 0.97

“ 評価はCN-CVSの音声映像を使う音声合成である。実際に声を出さず調音した専用データ、発声障害のある利用者、移動時や端末内・実時間対話の評価は本文にない。中国語の別方言・アクセントへの拡張は今後の課題とされる。 ”

deployment_claim · pp.1–4 Sections 1–5, especially Section 3.1 and Section 5 Conclusion · confidence 0.97

Limits

Technical limits

視覚的に似た音や見えにくい声調を、学習済み表現と生成モデルで補うため、自然に聞こえても内容の誤りは残る。事前学習モデル、音声単位の教師情報、話者表現、音声合成器に依存する。話者表現を何の音声から得るかが明確でないため、完全に映像だけで声を再現できるとは断定しない。

Evaluation limits

CERとTERはFunASRによる転記とg2pM処理に依存し、テストの正解文字ラベルもFunASRで再作成している。機械認識による評価の影響を切り分けた検証はない。MOSは中国語母語話者15人・モデル当たり30標本だが、±の定義、標本選択・提示順、反復学習数、検定は不明。

Deployment limits

実験は既存の音声映像データを使う。声を出さずに口を動かした専用収録、発声障害のある利用者、移動・遮蔽・撮影角度変化、端末内処理、実時間対話の評価は報告されない。話者表現に用いる参照音声の取得条件も不明。

Scope limits

固定対象arXiv v1全5ページの本文・図1・表1–4・参考文献に基づく。図1と表1–4はPDF描画でも照合。書誌情報は保存済みコンテキストを維持する。論文の報告値と設計の評価であり、デモ試聴・実装実行・原データによる独立再現ではない。