Turn-Taking Detection Models β€” Collection complete v4

Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraines sur Smart Turn v3.2 (synthetique) et/ou AppTek (audio reel de centre d'appel, 14 accents anglophones).

Table des matieres

Architecture et composants

  1. Comparaison globale avec les modeles de reference
  2. Ablation : acoustique seule vs semantique seule vs fusion
  3. Comparaison d'architectures acoustiques a budget variable
  4. CPC : encodeur audio pre-entraine (self-supervised)
  5. CPC Frozen vs CPC Partial (fine-tuning du GRU contextuel)
  6. Choix de l'encodeur semantique : Whisper vs HuBERT
  7. Ablation du mecanisme de fusion (Cross-Attention vs Avg Pool vs Gated Pool)
  8. Extension : architectures alternatives en config mixte (BiGRU, CPC+Whisper+Transformer)

Configurations de donnees 9. Trois configurations d'entrainement (mixte / Smart Turn seul / AppTek seul) 10. Experience de reequilibrage synthetique/reel

Curriculum de diversite d'accents 11. Curriculum de diversite d'accents β€” premiere exploration 12. Curriculum de diversite d'accents (V3) β€” Leave-One-Out avec volume fixe 13. Curriculum de diversite d'accents (V3 a V5) β€” evolution methodologique et resultat final

Synthese et annexes 14. Resultats cles globaux (synthese) 15. Fichiers de resultats bruts 16. Limites connues


1. Comparaison globale β€” 4 modeles, test officiel Smart Turn v3.2

Modele Params Accuracy ROC-AUC Notes
LiveKit v1-mini ~0.5B (distille) 61.02% 0.7324 Limite a 1.2s de contexte audio
Smart Turn v3.2 (officiel) ~8M 73.33% 0.7962 Whisper-tiny fine-tune complet
Phase 1 (notre, from scratch) 462K 87.36-87.93% 0.9439-0.9483 Selon config, Whisper gele
Phase 2 (notre, fusion) ~360K (+8M geles) 92.06-92.60% 0.9744-0.9776 Meilleure architecture

2. Ablation : Phase 1 (acoustique) vs Whisper-frozen-head (semantique) vs Phase 2 (fusion)

14 accents, config mixte (94% Smart Turn / 6% AppTek).

Accent OOD P1 Test WF Test P2 Test P1 OOD WF OOD P2 OOD
en-AU 84.21% 83.63% 90.01% 66.44% 70.04% 80.76%
en-CA 84.27% 83.75% 89.77% 64.70% 71.04% 78.66%
en-CN 84.29% 83.47% 90.18% 56.12% 67.89% 72.97%
en-GB 84.14% 82.78% 90.48% 60.29% 65.29% 73.43%
en-GB_SCT 84.57% 83.64% 90.52% 57.98% 60.65% 70.39%
en-GB_WLS 83.87% 83.48% 90.05% 57.35% 65.03% 75.58%
en-IE 84.35% 83.37% 90.11% 63.68% 76.04% 84.52%
en-IN 84.31% 83.56% 90.55% 61.05% 69.43% 70.57%
en-MX 84.26% 83.71% 90.58% 56.85% 64.38% 75.99%
en-SG 84.57% 83.54% 90.44% 63.38% 71.14% 76.58%
en-US_Aave 84.20% 83.70% 90.07% 58.56% 65.64% 71.83%
en-US_General 84.45% 83.47% 90.08% 62.39% 71.20% 79.05%
en-US_Southern 84.60% 83.68% 90.60% 65.61% 66.60% 76.32%
en-ZA 84.56% 83.84% 90.54% 57.71% 67.48% 76.62%
Moyenne 84.39% 83.61% 90.21% 60.86% 68.03% 76.02%

Resultat cle : ni l'acoustique seule ni la semantique seule n'atteignent la performance de la fusion complete β€” la cross-attention genere une synergie reelle.


3. Comparaison d'architectures acoustiques a budget de parametres variable

Config AppTek seul, 3 accents (en-CN, en-GB_WLS, en-IE), mode seul et mode fusion (avec Whisper gele).

Moyennes sur 3 accents β€” architectures from-scratch

Architecture Budget (params) Seul Test Seul OOD Fusion Test Fusion OOD
ECAPA-TDNN 1x (462K) 64.68% 57.42% 78.97% 78.21%
ECAPA-TDNN 2x (911K) 64.51% 57.46% 78.05% 77.40%
BiGRU 1x (461K) 70.19% 65.50% 75.70% 74.48%
BiGRU 2x (909K) 70.54% 65.76% 76.61% 74.04%
Conformer 1x (430K) 67.99% 61.59% 77.95% 75.93%
Conformer 2x (904K) 72.22% 68.93% 78.32% 77.78%
Conformer 3x (1.36M) 70.74% 70.09% 77.18% 77.04%
Conformer 4x (1.83M) 65.14%* 63.13%* 78.08% 78.34%

*Instabilite d'entrainement isolee sur en-CN a 4x, affectant la moyenne.

Resultats cles :

  • A budget egal (~460K), BiGRU domine en mode seul, mais ECAPA-TDNN reprend l'avantage en mode fusion.
  • Conformer beneficie d'un budget accru jusqu'a ~900K parametres (2x), avec un gain marque vs 1x.
  • Au-dela de 2x, Conformer ne progresse plus de facon monotone (possible surapprentissage sur ~17K exemples train).
  • En mode fusion, la performance reste stable a travers tous les budgets (77-78%).

4. CPC : encodeur audio pre-entraine (self-supervised)

Contrairement aux architectures precedentes (entrainees from-scratch), CPC (Contrastive Predictive Coding, Riviere et al. 2020) est un encodeur pre-entraine sur de la parole brute en self-supervised, sans supervision texte. Checkpoint officiel FAIR charge et entierement gele β€” seule une tete de classification legere (mode seul) ou le module de fusion (mode fusion) sont entraines.

Architecture reelle du checkpoint utilise : 1 843 456 parametres au total (encodeur convolutif + GRU contextuel, sortie 256-dim) β€” note : ce chiffre differe de certaines estimations plus elevees (~5.8M) parfois citees pour cette famille de modeles ; il correspond aux poids du checkpoint officiel effectivement charge et verifie.

Accent Seul Test Seul OOD Fusion Test Fusion OOD
en-CN 64.31% 53.42% 80.64% 74.96%
en-GB_WLS 62.69% 57.61% 79.91% 77.56%
en-IE 62.40% 66.95% 79.15% 85.70%
Moyenne 63.13% 59.33% 79.90% 79.41%

Comparaison finale β€” toutes architectures, mode fusion, moyennes sur 3 accents

Architecture Params (encodeur) Fusion Test Fusion OOD
BiGRU (1x, from scratch) 461K 75.70% 74.48%
Conformer (1x, from scratch) 430K 77.95% 75.93%
ECAPA-TDNN (1x, from scratch) 462K 78.97% 78.21%
Conformer (2x, from scratch) 904K 78.32% 77.78%
CPC (pre-entraine, gele) 1.84M 79.90% 79.41%

Resultat cle : CPC (pre-entraine, gele, jamais affine sur la tache) obtient le meilleur score en mode fusion, devant toutes les architectures from-scratch testees β€” suggerant que son pre-entrainement self-supervised capture deja des informations acoustiques/prosodiques pertinentes, complementaires a la semantique de Whisper. En mode seul cependant, CPC reste modeste (63.13% test, 59.33% OOD), moins bon que BiGRU ou Conformer entraines specifiquement β€” le gain de CPC provient donc presque entierement de la fusion, pas de sa capacite de classification isolee.


5. CPC Frozen vs CPC Partial (fine-tuning du GRU contextuel) β€” config mixte, 14 accents

Extension de l'experience CPC (section 4) : comparaison entre l'encodeur CPC entierement gele ("frozen") et une variante ou le GRU contextuel (couche recurrente apres l'encodeur convolutif) est degele et fine-tune sur la tache ("partial"), tandis que l'encodeur convolutif reste toujours gele dans les deux cas.

Parametres entraines : 33,154 (frozen, tete de classification seule) vs 559,490 (partial, tete + GRU contextuel).

CPC Frozen (14 accents)

Accent Seul Test Seul OOD Fusion Test Fusion OOD
en-AU 65.06% 61.63% 80.75% 84.02%
en-CA 64.63% 63.11% 80.21% 82.30%
en-CN 63.00% 52.70% 80.35% 73.77%
en-GB 63.66% 59.60% 79.99% 78.17%
en-GB_SCT 64.86% 59.44% 80.24% 74.86%
en-GB_WLS 64.53% 56.19% 79.83% 76.85%
en-IE 63.79% 66.02% 78.79% 87.83%
en-IN 64.55% 60.92% 80.53% 71.34%
en-MX 64.10% 60.79% 80.06% 78.02%
en-SG 64.99% 62.29% 80.60% 78.14%
en-US_Aave 64.63% 57.31% 80.32% 76.24%
en-US_General 63.79% 59.83% 80.49% 80.97%
en-US_Southern 63.84% 63.65% 80.42% 78.05%
en-ZA 65.19% 56.09% 80.55% 76.63%
Moyenne 64.33% 59.97% 80.23% 78.37%

CPC Partial (14 accents)

Accent Seul Test Seul OOD Fusion Test Fusion OOD
en-AU 63.02% 61.45% 79.45% 85.89%
en-CA 63.18% 59.70% 79.22% 80.98%
en-CN 60.84% 50.87% 79.96% 72.50%
en-GB 63.50% 52.29% 80.75% 76.33%
en-GB_SCT 64.46% 55.81% 79.86% 75.18%
en-GB_WLS 63.69% 57.23% 79.46% 77.05%
en-IE 63.62% 59.23% 79.21% 85.75%
en-IN 62.45% 55.53% 79.98% 71.14%
en-MX 64.69% 62.91% 79.18% 77.41%
en-SG 63.92% 58.69% 80.35% 77.28%
en-US_Aave 62.54% 53.12% 79.68% 75.53%
en-US_General 63.32% 56.39% 80.33% 80.72%
en-US_Southern 63.44% 57.41% 80.33% 77.98%
en-ZA 63.87% 56.10% 79.24% 79.43%
Moyenne 63.33% 56.91% 79.79% 78.08%

Comparaison synthetique

Mode Seul Test Seul OOD Fusion Test Fusion OOD
Frozen 64.33% 59.97% 80.23% 78.37%
Partial 63.33% 56.91% 79.79% 78.08%
Ecart (frozen - partial) +1.00 +3.06 +0.44 +0.29

Resultat cle : le fine-tuning partiel du GRU contextuel de CPC n'apporte aucun benefice, et se revele legerement contre-productif sur toutes les metriques, particulierement pour la generalisation OOD en mode seul (+3.06 points en faveur du frozen). Ceci suggere que les representations pre-entrainees de CPC captent deja l'essentiel du signal utile pour cette tache, et qu'un fine-tuning limite (peu de donnees specifiques face a un espace de parametres relativement large) ajoute du bruit d'optimisation sans gain reel.

Tableau recapitulatif β€” toutes architectures en fusion, config mixte, moyennes 14 accents

Architecture Params (acoustique) Fusion Test Fusion OOD
CPC frozen 1.84M (gele) 80.23% 78.37%
CPC + Whisper + Transformer 1.84M (gele) + 500K (fusion) 80.02% 78.04%
CPC partial 1.84M (559K entraines) 79.79% 78.08%
Phase 2 (ECAPA + Cross-Attn+TCN) 462K (from scratch) 90.21% 76.02%
BiGRU 461K (from scratch) 88.78% 74.71%

Interpretation finale : pour la performance maximale sur donnees connues (synthetique + reel vu), Phase 2 (ECAPA, from scratch) reste la meilleure architecture. Pour la generalisation a un accent totalement inconnu, CPC gele (sans aucun fine-tuning) offre la meilleure robustesse parmi toutes les architectures testees β€” confirmant qu'un encodeur pre-entraine en self-supervised sur de la parole brute capture une information acoustique/prosodique qui generalise mieux qu'un apprentissage from-scratch specifique a la tache, meme avec beaucoup moins de parametres entraines (33K vs 462K).


6. Choix de l'encodeur semantique : Whisper vs HuBERT β€” config Smart Turn seul

Ablation testant si le choix de l'encodeur semantique gele (dans la fusion Phase 2) influence les resultats. Meme protocole que l'experience "Smart Turn seul" (train/val/test officiels Smart Turn v3.2, aucune donnee AppTek), avec Phase 1 (ECAPA-TDNN) identique dans les deux cas, seul l'encodeur de fusion change.

Whisper-tiny : encodeur pre-entraine pour la reconnaissance vocale (supervision texte forte), 384 dimensions de sortie. HuBERT-base : encodeur pre-entraine en self-supervised pur (masquage acoustique, sans supervision textuelle), 768 dimensions de sortie.

Modele Accuracy F1 ROC-AUC
Phase 1 (ECAPA-TDNN, acoustique seule) 87.34% 87.34% 0.9439
Phase 2 (fusion avec Whisper) 92.31% 92.31% 0.9759
Phase 2 (fusion avec HuBERT) 85.57% 85.56% 0.9271

Chiffres Phase 2 (Whisper) recalcules avec le protocole complet (accuracy, F1, AUC) pour assurer une comparaison homogene a 3 metriques avec HuBERT ; ecart mineur (92.31% vs 92.37% dans une premiere execution anterieure) du a la variance normale d'entrainement.

Resultat cle : la fusion avec HuBERT degrade les performances par rapport a Phase 1 seul (85.57% vs 87.34%), alors que la fusion avec Whisper les ameliore significativement (+5 points). Ceci suggere que le gain de la fusion semantique dans Phase 2 ne provient pas simplement de l'ajout d'une representation audio pre-entrainee generique, mais specifiquement de la supervision textuelle de Whisper (entraine pour la reconnaissance vocale) β€” un signal linguistique/semantique que le self-supervised pur de HuBERT ne capture pas de la meme maniere. Pour une tache de detection de fin de tour, qui beneficie probablement d'une comprehension du caractere syntaxiquement/semantiquement complet d'un enonce, la supervision texte de Whisper semble apporter un avantage decisif que HuBERT n'offre pas.


7. Ablation du mecanisme de fusion β€” config mixte, en-CN

Comparaison de trois mecanismes pour combiner les features acoustiques (ECAPA-TDNN) et semantiques (Whisper), Phase 1 identique dans les trois cas.

Cross-Attention (Phase 2 originale) : attention causale entre les deux modalites, suivie d'un TCN. Average Pooling : moyenne temporelle de chaque modalite, projection, concatenation, MLP. Gated Pooling : moyenne temporelle de chaque modalite, porte apprise (sigmoid) ponderant la contribution relative de chaque modalite avant fusion.

Mecanisme Test combine OOD
Cross-Attention (baseline) 90.01% 69.00%
Gated Pool 87.30% 67.57%
Avg Pool 87.02% 68.20%

Resultat cle : la cross-attention domine les deux mecanismes plus simples sur les deux metriques (+2.71 a +2.99 points test, +0.80 a +1.43 points OOD), confirmant que la capacite d'attention dynamique entre modalites (plutot qu'une simple moyenne ou une porte statique) apporte une vraie valeur ajoutee a la tache, justifiant la complexite additionnelle de ce mecanisme dans l'architecture Phase 2.


8. Extension : architectures alternatives en config mixte (14 accents)

Suite a la comparaison d'architectures a budget egal (config AppTek seul, section 3), deux architectures supplementaires ont ete testees en config mixte (Smart Turn + AppTek), sur les 14 accents.

BiGRU (config mixte, 14 accents)

Accent OOD Seul Test Seul OOD Fusion Test Fusion OOD
en-AU 69.29% 71.17% 88.48% 79.49%
en-CA 68.31% 69.33% 88.74% 78.17%
en-CN 69.24% 64.71% 88.65% 69.00%
en-GB 69.95% 62.62% 89.06% 69.90%
en-GB_SCT 69.50% 61.49% 88.79% 71.26%
en-GB_WLS 68.02% 66.18% 88.38% 74.17%
en-IE 68.04% 69.13% 88.85% 81.72%
en-IN 69.57% 63.46% 88.83% 67.11%
en-MX 69.89% 64.21% 88.82% 72.76%
en-SG 68.46% 67.29% 88.93% 73.56%
en-US_Aave 69.12% 63.21% 89.02% 71.88%
en-US_General 68.93% 69.28% 88.95% 76.05%
en-US_Southern 70.41% 67.39% 88.71% 75.66%
en-ZA 70.08% 63.62% 88.68% 72.43%
Moyenne 69.06% 65.59% 88.78% 74.71%

Resultat : BiGRU (461K params) sous-performe ECAPA-TDNN (Phase 1, 462K params) sur le test combine en config mixte (88.78% vs 90.21%), malgre sa superiorite observee en config AppTek seul. Suggere que BiGRU exploite moins bien le volume massif de donnees synthetiques Smart Turn.

CPC + Whisper + Transformer (nouvelle architecture de fusion)

Modification apportee a la fusion (par rapport a la Cross-Attention + TCN originale de Phase 2) :

  1. Cross-attention causale entre features CPC (acoustique, gelees) et Whisper (semantique, gelees) β€” identique a l'original
  2. Connexion residuelle ajoutee : l'acoustique brute projetee est additionnee a la sortie de cross-attention, puis normalisee (LayerNorm)
  3. TCN remplace par 2 couches de TransformerEncoder (d_model=128, nhead=4, dim_feedforward=256), avec masque causal explicite
  4. Classifieur a 2 couches (Linear 128->32 + ReLU + Linear 32->2)

Parametres de la fusion : 499,810 (contre ~360K pour la fusion originale Cross-Attention+TCN, soit +39%)

Accent OOD Seul Test Seul OOD Fusion Test Fusion OOD
en-AU 63.71% 62.45% 80.42% 86.28%
en-CA 63.70% 63.72% 79.75% 81.34%
en-CN 65.98% 54.45% 81.44% 74.09%
en-GB 63.61% 58.81% 80.39% 77.19%
en-GB_SCT 64.93% 60.93% 80.01% 75.92%
en-GB_WLS 63.94% 57.67% 79.68% 77.05%
en-IE 63.96% 65.20% 78.68% 86.70%
en-IN 64.38% 61.71% 80.97% 69.96%
en-MX 63.77% 64.04% 80.42% 78.65%
en-SG 65.11% 61.01% 81.14% 77.37%
en-US_Aave 64.31% 58.56% 80.46% 77.80%
en-US_General 64.07% 59.64% 80.66% 81.10%
en-US_Southern 63.42% 62.57% 80.35% 80.69%
en-ZA 64.74% 55.62% 79.77% 78.38%
Moyenne 64.19% 60.82% 80.02% 78.04%

Resultat cle : cette architecture obtient le meilleur score OOD moyen de toutes les architectures testees en config mixte (78.04%), surpassant Phase 2 originale (76.02%) β€” malgre un score de test in-distribution inferieur (80.02% vs 90.21%). Le remplacement du TCN par un Transformer avec connexion residuelle semble ameliorer specifiquement la capacite de generalisation vers l'audio reel inconnu, au prix d'une performance legerement moindre sur les donnees vues (Smart Turn + AppTek connus).

Comparaison finale β€” toutes architectures en config mixte, moyennes 14 accents

Architecture Params (fusion) Test combine OOD
BiGRU 461K (encodeur) 88.78% 74.71%
Phase 1/2 (ECAPA + Cross-Attn+TCN) 462K + ~360K 90.21% 76.02%
CPC + Whisper + Transformer 1.84M (CPC gele) + 500K (fusion) 80.02% 78.04%

Interpretation : si l'objectif est la performance maximale sur donnees connues (synthetique + reel vu), Phase 2 (ECAPA + Cross-Attention/TCN) reste la meilleure architecture. Si l'objectif est la generalisation a un accent totalement inconnu, la combinaison CPC (pre-entraine) + fusion Transformer semble legerement superieure, suggerant une piste d'amelioration pour des applications ou la robustesse a des locuteurs/accents non vus est prioritaire.


9. Trois configurations d'entrainement (Phase 1 et Phase 2, 14 accents)

Configuration P1 Test P1 OOD P2 Test P2 OOD
Smart Turn seul (0% AppTek) 87.55% 55.85%* 92.31% 65.77%*
Mixte (94% ST / 6% AppTek) 84.39% 60.86% 90.21% 76.02%
AppTek seul (0% ST) 64.42% 56.59% 78.79% 77.58%

*Pour Smart Turn seul, "OOD" = AppTek test (jamais vu a l'entrainement).

Resultat le plus marquant : Phase 2 (AppTek seul) obtient le meilleur score OOD moyen parmi ces 3 configurations, malgre 16x moins de donnees et l'absence de synthetique.

Tableau complet β€” Mixte, 14 accents, avec baselines figees

Accent OOD ST v3.2 AppTek ST v3.2 OOD LiveKit AppTek LiveKit OOD P1 AppTek P1 OOD P2 AppTek P2 OOD
en-AU 64.39% 67.38% 69.12% 74.37% 62.07% 66.44% 80.55% 80.76%
en-CA 63.41% 67.80% 67.88% 70.61% 66.44% 64.70% 79.06% 78.66%
en-CN 63.59% 63.04% 68.77% 64.79% 67.39% 56.12% 81.64% 72.97%
en-GB 64.76% 60.48% 68.46% 67.33% 65.61% 60.29% 78.75% 73.43%
en-GB_SCT 64.23% 58.39% 68.43% 68.27% 66.15% 57.98% 77.75% 70.39%
en-GB_WLS 63.67% 61.76% 67.44% 67.65% 65.83% 57.35% 79.48% 75.58%
en-IE 63.06% 73.44% 68.00% 76.18% 68.62% 63.68% 78.77% 84.52%
en-IN 64.34% 61.49% 68.15% 62.63% 67.47% 61.05% 79.70% 70.57%
en-MX 64.88% 63.65% 68.63% 70.44% 65.86% 56.85% 78.74% 75.99%
en-SG 63.30% 66.45% 68.01% 67.19% 67.14% 63.38% 79.73% 76.58%
en-US_Aave 65.98% 58.14% 69.10% 65.70% 64.17% 58.56% 80.86% 71.83%
en-US_General 63.84% 68.90% 68.41% 67.82% 66.21% 62.39% 79.73% 79.05%
en-US_Southern 64.96% 63.43% 68.30% 70.44% 67.61% 65.61% 78.71% 76.32%
en-ZA 64.84% 66.57% 68.42% 65.71% 65.50% 57.71% 78.29% 76.62%
Moyenne 64.23% 64.35% 68.29% 68.51% 66.01% 60.86% 79.34% 76.02%

Effet de l'exposition multi-accent β€” Smart Turn seul vs Mixte, sur le meme split AppTek test

Accent P1 (ST seul) AppTek P1 (mixte) AppTek P2 (ST seul) AppTek P2 (mixte) AppTek
en-AU 55.00% 62.07% 66.09% 80.55%
en-CA 55.74% 66.44% 66.02% 79.06%
en-CN 55.13% 67.39% 65.63% 81.64%
en-GB 57.21% 65.61% 67.18% 78.75%
en-GB_SCT 56.27% 66.15% 66.96% 77.75%
en-GB_WLS 55.56% 65.83% 65.81% 79.48%
en-IE 56.21% 68.62% 64.62% 78.77%
en-IN 55.59% 67.47% 65.09% 79.70%
en-MX 56.36% 65.86% 65.93% 78.74%
en-SG 55.78% 67.14% 65.90% 79.73%
en-US_Aave 55.63% 64.17% 65.01% 80.86%
en-US_General 55.21% 66.21% 65.19% 79.73%
en-US_Southern 56.78% 67.61% 65.66% 78.71%
en-ZA 56.38% 65.50% 65.67% 78.29%
Moyenne 55.85% 66.01% 65.77% 79.34%

10. Experience de reequilibrage synthetique/reel (OOD=en-CN)

Configuration P1 Test P1 OOD P2 Test P2 OOD
Original (94%/6%) 84.89% 59.54% 90.48% 71.07%
Oversample (65%/35%, reptete) 84.50% 59.78% 90.10% 70.19%
Undersample (50%/50%, vrai) 60.93% 54.69% 87.47% 71.70%

Resultat cle : Phase 1 s'effondre severement sous undersample (-23.96 points), Phase 2 resiste beaucoup mieux (-3.01 points), demontrant l'efficacite d'apprentissage superieure des representations pre-entrainees face a la rarete des donnees reelles.


11. Curriculum de diversite d'accents β€” premiere exploration

Description de l'experience

Cette experience teste l'effet du nombre d'accents distincts presents dans l'entrainement sur la capacite de generalisation a des accents totalement inconnus (OOD), independamment du volume total de donnees.

Protocole :

  • Pour chaque valeur de K (nombre d'accents AppTek inclus), on construit un jeu d'entrainement melangeant K accents AppTek avec un volume egal de Smart Turn sous-echantillonne aleatoirement (ratio 50/50)
  • Le modele (Phase 1 ECAPA-TDNN + Phase 2 fusion Cross-Attention) est entraine sur ce melange, 15 epochs
  • L'evaluation OOD se fait sur chacun des accents restants (14-K) individuellement, puis moyennee
  • Valeurs de K testees : 1, 2, 4, 7, 10, 13

Controle de la variance : chaque (K, ordre) est repete avec 2 graines d'entrainement independantes, sur 6 sequences d'accents (3 permutations aleatoires distinctes, chacune testee en ordre normal et inverse) : 6 sequences x 6 valeurs de K x 2 repetitions = 72 runs.

Resultats β€” moyenne et ecart-type sur les 12 runs par valeur de K

K (accents inclus) Test moyen Test std OOD moyen OOD std
1 77.20% 3.13% 73.99% 1.15%
2 76.78% 2.61% 75.26% 0.52%
4 77.78% 1.60% 75.82% 1.02%
7 78.38% 1.22% 76.89% 1.12%
10 78.98% 1.01% 76.57% 1.41%
13 78.67% 0.51% 75.90% 2.60%

Note : ce premier protocole exploratoire a ete remplace par une version plus rigoureuse (sections 12-13), qui a revele que le "plateau" observe ici etait en partie du a une contrainte methodologique. Conserve ici a titre de trace de la demarche exploratoire initiale.


12. Curriculum de diversite d'accents (V3) β€” Leave-One-Out avec volume total fixe

Motivation et question de recherche

Isoler specifiquement l'effet de la diversite d'accents du volume total de donnees, avec un design statistiquement rigoureux (repetitions multiples, tirage aleatoire, test de significativite formel).

Protocole

Design Leave-One-Out (LOO) : chaque accent (14 au total) est teste individuellement comme OOD, totalement exclu de l'entrainement.

Volume total AppTek fixe a 1258 exemples (628 par classe HOLD/SHIFT), quel que soit K β€” determine par la taille du plus petit accent disponible (en-CN). Ce volume est reparti egalement entre les K accents inclus : a K=1, l'unique accent fournit ses 1258 exemples ; a K=13, chacun des 13 accents restants ne fournit qu'environ 97 exemples. Smart Turn synthetique sous-echantillonne pour egaler ce volume (ratio 50/50).

Tirage aleatoire des K accents inclus a chaque run, independamment a chaque repetition.

Valeurs de K : 1, 3, 6, 9, 13. Repetitions : 6 par (accent OOD, K). Total : 14 x 5 x 6 = 420 runs.

Resultats β€” Test combine (in-distribution), accuracy moyenne sur 6 repetitions

Accent K=1 K=3 K=6 K=9 K=13
en-AU 73.67% 77.04% 75.04% 73.03% 73.62%
en-CA 77.22% 75.98% 76.83% 73.66% 74.51%
en-CN 79.96% 75.44% 73.53% 73.48% 77.36%
en-GB 81.03% 75.89% 75.85% 73.48% 75.31%
en-GB_SCT 76.24% 73.23% 73.71% 72.94% 73.89%
en-GB_WLS 73.85% 76.06% 75.67% 75.00% 74.69%
en-IE 76.33% 74.56% 73.80% 72.85% 74.96%
en-IN 78.10% 74.91% 76.74% 76.97% 75.49%
en-MX 78.10% 74.73% 75.40% 73.92% 76.56%
en-SG 78.19% 76.42% 75.31% 77.24% 70.77%
en-US_Aave 76.68% 76.68% 74.24% 72.67% 75.76%
en-US_General 78.99% 78.10% 75.13% 75.45% 76.83%
en-US_Southern 77.13% 78.63% 74.60% 75.45% 74.42%
en-ZA 75.62% 73.49% 74.96% 74.01% 73.62%

Moyennes toutes metriques (Test combine et OOD), section 12 (V3)

K Test Acc Test F1 Test AUC OOD Acc OOD F1 OOD AUC
1 77.22% 77.07% 0.8511 72.47% 72.11% 0.8084
3 75.80% 75.66% 0.8354 73.52% 73.30% 0.8141
6 75.06% 74.85% 0.8311 74.31% 74.17% 0.8190
9 74.30% 74.09% 0.8246 74.32% 74.14% 0.8200
13 74.84% 74.65% 0.8224 74.29% 74.14% 0.8183

Confirmation multi-metrique : F1-macro et ROC-AUC suivent la meme tendance que l'accuracy (baisse du test, hausse de l'OOD avec K), confirmant que le trade-off observe dans le protocole V3 n'est pas un artefact d'une seule metrique.

Resultats β€” OOD (accent exclu), accuracy moyenne sur 6 repetitions

Accent K=1 K=3 K=6 K=9 K=13
en-AU 77.49% 79.96% 79.56% 79.60% 79.65%
en-CA 71.99% 76.51% 77.07% 76.54% 76.27%
en-CN 69.33% 68.81% 70.18% 68.67% 69.97%
en-GB 70.17% 70.46% 71.32% 71.95% 73.01%
en-GB_SCT 68.11% 69.68% 70.79% 69.04% 69.43%
en-GB_WLS 69.54% 74.38% 73.70% 74.15% 74.13%
en-IE 81.31% 81.04% 81.58% 81.70% 80.45%
en-IN 68.02% 68.26% 69.65% 68.44% 69.58%
en-MX 72.28% 71.79% 73.60% 73.10% 74.10%
en-SG 73.61% 73.46% 75.55% 75.34% 73.63%
en-US_Aave 70.26% 72.05% 71.95% 73.14% 72.62%
en-US_General 76.25% 76.20% 76.71% 77.31% 77.20%
en-US_Southern 74.03% 74.96% 74.83% 76.51% 76.05%
en-ZA 72.24% 71.78% 73.87% 74.98% 74.03%

Tests statistiques formels (K=1 vs K=13, test t apparie par accent)

Metrique Difference moyenne (K=13 - K=1) t p-value Conclusion
OOD accuracy +1.82 points 4.639 0.000463 Significatif : la diversite ameliore la generalisation
Test combine accuracy -2.38 points -4.267 0.000918 Significatif : la diversite degrade la performance in-distribution

Detail par accent β€” significativite individuelle (OOD, K=1 vs K=13)

Accent Diff OOD (K13-K1) p-value Significatif
en-GB_WLS +4.58 0.0059 ***
en-GB +2.83 0.0451 *
en-MX +1.82 0.0243 *
en-ZA +1.79 0.0330 *
en-CA +4.28 0.1414 tendance forte, non significative
en-AU +2.16 0.0947 tendance, non significative
en-CN +0.64 0.5430 non
en-SG +0.02 0.9840 non
en-IE -0.86 0.3237 non (legere baisse)

Resultat a ce stade : un veritable compromis diversite/specialisation semblait statistiquement prouve dans les deux sens. Ce resultat a ete remis en question et affine dans la section suivante (13).


13. Curriculum de diversite d'accents β€” evolution methodologique et resultat final (V3 a V5)

Recit de la demarche scientifique

Cette serie d'experiences illustre l'importance de controler soigneusement les variables confondues avant de conclure sur un effet.

Remise en question du V3 (section 12) : le trade-off observe etait-il un phenomene reel, ou un artefact du volume total tres contraint (1258 exemples) ? A volume aussi faible, chaque accent supplementaire dilue mecaniquement le nombre d'exemples disponibles par accent (de 1258 a K=1, a environ 97 par accent a K=13).

V4 (grille exploratoire Volume x K) : levee de la contrainte de volume fixe, en gardant tout le HOLD et le SHIFT disponibles (au lieu de sous-echantillonner pour equilibrer), compense par un class weighting inverse-frequence dans la loss. Grille testee : K in {1,6,13}, volumes croissants (2117 a 16000), 4 repetitions, 448 runs.

Resultat V4 : a volume suffisant (16000), le trade-off disparait β€” le test combine a K=13 (78.98%) rejoint celui de K=1 a faible volume (78.62%, difference non significative, p=0.57), tandis que l'OOD continue de s'ameliorer nettement (+3.94 points, p<0.0001).

V5 (protocole final, rigueur du V3 + methodologie du V4) : reprise du design Leave-One-Out complet (14 accents, K in {1,3,6,9,13}, 6 repetitions, tirage aleatoire), mais avec class weighting et tout le volume disponible pour les accents tires a chaque K (pas de contrainte de volume total fixe). 420 runs.

Resultats finaux (V5) β€” toutes metriques, K=1 vs K=13

Metrique K=1 (moyenne) K=13 (moyenne) Difference t p-value Significativite
Test Accuracy 78.65% 80.36% +1.71 4.450 0.000655 ***
Test F1-macro 75.66% 78.12% +2.46 5.660 0.000078 ***
Test ROC-AUC 0.8549 0.8784 +0.0236 5.128 0.000194 ***
OOD Accuracy 73.21% 77.42% +4.21 10.215 <0.000001 ***
OOD F1-macro 73.01% 77.32% +4.31 9.712 <0.000001 ***
OOD ROC-AUC 0.8121 0.8581 +0.0460 19.845 <0.000001 ***

Courbe complete (V5) β€” moyenne sur 84 runs par valeur de K (14 accents x 6 repetitions)

K Test Accuracy OOD Accuracy
1 78.65% 73.21%
3 79.48% 74.83%
6 79.81% 76.17%
9 80.19% 76.90%
13 80.36% 77.42%

Resultat cle et conclusion definitive

Sur les 6 metriques testees, toutes montrent un gain hautement significatif (p<0.001, souvent p<10^-6) avec l'augmentation du nombre d'accents distincts dans l'entrainement, de K=1 a K=13, sans aucune exception ni compromis. Test et OOD progressent de facon monotone et simultanee avec K.

Le "trade-off" identifie dans le protocole V3 (section 12) etait entierement un artefact methodologique, du a la contrainte artificielle de volume total fixe combinee au sous-echantillonnage strict pour equilibrer HOLD/SHIFT. Une fois cette contrainte levee β€” en conservant tout le volume disponible et en compensant le desequilibre des classes par un class weighting dans la loss β€” la diversite d'accents s'avere strictement beneique, sur toutes les metriques et de maniere hautement significative.

Lecon methodologique generale : un premier resultat statistiquement significatif (le trade-off du V3) s'est revele etre un artefact de conception une fois la methodologie affinee, inversant completement l'interpretation pratique du phenomene etudie β€” illustration de l'importance de tester la robustesse d'un resultat face aux choix de conception avant de conclure.

Implication pratique finale : pour maximiser a la fois la performance sur les donnees connues et la robustesse a des accents inconnus, il convient d'inclure autant d'accents differents que possible dans l'entrainement, sans chercher a equilibrer artificiellement les classes au prix de la suppression de donnees β€” un class weighting dans la fonction de perte permet de gerer le desequilibre naturel tout en conservant le benefice complet du volume et de la diversite disponibles.


14. Resultats cles globaux (synthese)

  1. La fusion (Phase 2) genere une vraie synergie β€” ni l'acoustique seule ni la semantique seule ne l'egalent.
  2. CPC (pre-entraine, gele) surpasse toutes les architectures from-scratch en mode fusion pour l'OOD, malgre l'absence totale de fine-tuning sur la tache.
  3. Le fine-tuning partiel de CPC (mode "partial") n'apporte aucun benefice par rapport a un gel complet ("frozen").
  4. La supervision textuelle de Whisper (vs le self-supervised pur de HuBERT) est determinante dans le gain apporte par la fusion semantique.
  5. La cross-attention apporte une vraie valeur ajoutee par rapport a des mecanismes de fusion plus simples (average/gated pooling).
  6. Phase 2 (AppTek seul) atteint une excellente generalisation OOD malgre 16x moins de donnees et l'absence de synthetique.
  7. Le choix d'architecture acoustique optimal depend du contexte (seule vs fusionnee) et du budget de parametres.
  8. La diversite d'accents ameliore significativement et simultanement la performance in-distribution ET la generalisation OOD, a condition de ne pas sacrifier de volume de donnees pour l'obtenir (class weighting plutot que sous-echantillonnage) β€” un resultat etabli avec une rigueur statistique complete (tests t apparies, p<0.001 sur 6 metriques).

Chargement

import torch
ckpt = torch.load("phase2-whisper-crossattn-v4-ood-en-AU-light.pt", map_location="cpu")
model.load_state_dict(ckpt['best_state'])

15. Fichiers de resultats bruts (JSON)

  • results-ood-{accent}.json, results-apptekonly-{accent}.json β€” Phase1/Phase2, configs mixte et AppTek seul
  • results-whisperfrozen-mixte-{accent}.json β€” ablation Whisper-frozen-head
  • arch-comparison-{arch}-{accent}.json, arch2x-comparison-{arch}-{accent}.json β€” architectures, budgets 1x/2x
  • archscale-comparison-conformer-{3x,4x}-{accent}.json β€” Conformer, budgets 3x/4x
  • cpc-comparison-{accent}.json β€” CPC pre-entraine gele (config AppTek seul)
  • cpc-frozen-mixte-{accent}.json, cpc-partial-mixte-{accent}.json β€” CPC frozen/partial, config mixte
  • mixte-arch-comparison-bigru-{accent}.json β€” BiGRU, config mixte
  • mixte_arch_comparison_cpc_transformer_{accent}.json β€” CPC+Whisper+Transformer
  • results-smartturn-hubert.json β€” comparaison Whisper vs HuBERT
  • fusion-ablation-{mechanism}-en-CN.json β€” ablation mecanisme de fusion
  • curriculum-{seq}-k{k}.json β€” curriculum V1 (premiere exploration)
  • curriculumv3-{accent}-k{k}-r{repeat}.json β€” curriculum V3 (LOO, volume fixe)
  • curriculumv4-{accent}-k{k}-vol{volume}-r{repeat}.json β€” curriculum V4 (grille volume x K)
  • curriculumv5-{accent}-k{k}-r{repeat}.json β€” curriculum V5 (LOO, volume max, class weighting)
  • architecture-comparison-consolidated.json β€” consolide architectures 1x/2x
  • decomposition-test-all-accents.json, results-smartturn-only-v4.json, smartturn-only-apptek-test-by-accent.json
  • baselines-smartturn-livekit-all-accents.json

17. Composition des jeux de donnees

AppTek β€” distribution HOLD/SHIFT par accent (14 accents, 40 512 exemples)

Accent HOLD SHIFT Total % SHIFT
en-AU 1949 751 2700 27.8%
en-CA 2469 820 3289 24.9%
en-CN 2001 629 2630 23.9%
en-GB 1067 1050 2117 49.6%
en-GB_SCT 1433 1084 2517 43.1%
en-GB_WLS 2928 782 3710 21.1%
en-IE 2218 1056 3274 32.3%
en-IN 1695 1140 2835 40.2%
en-MX 2560 883 3443 25.6%
en-SG 2001 1076 3077 35.0%
en-US_Aave 2502 946 3448 27.4%
en-US_General 1765 783 2548 30.7%
en-US_Southern 1665 756 2421 31.2%
en-ZA 1453 1050 2503 41.9%
TOTAL 27706 12806 40512 31.6%

Observation : le ratio HOLD/SHIFT varie fortement selon l'accent (21.1% a 49.6% de SHIFT), sans lien evident avec la difficulte de generalisation observee dans les experiences precedentes β€” AppTek est nettement desequilibre en faveur de HOLD (68.4% en moyenne), ce qui motive l'usage systematique d'un class weighting ou d'un sous-echantillonnage selon les experiences (voir sections 12-13).

Smart Turn v3.2 (train) β€” composition complete, {n_st} exemples

HOLD/SHIFT : quasi parfaitement equilibre (50.43% HOLD / 49.57% SHIFT), coherent avec un dataset construit specifiquement pour cette tache.

Synthetique vs humain reel :

Type Exemples %
Synthetique (TTS) 223 343 82.43%
Humain reel 47 603 17.57%

Sources / moteurs de synthese :

Source Exemples %
chirp3_1 (Google Chirp3) 146 627 54.12%
chirp3_2 (Google Chirp3) 67 646 24.97%
liva_1 30 922 11.41%
midcentury_1 8 489 3.13%
mundo_1 3 986 1.47%
human_5 (humain reel) 3 527 1.30%
rime_2 3 505 1.29%
orpheus_endfiller_1 1 661 0.61%
orpheus_grammar_1 1 570 0.58%
orpheus_midfiller_1 1 542 0.57%
chirp3_3_short (Google Chirp3) 792 0.29%
human_convcollector_1 (humain reel) 679 0.25%

Langues (top 15 sur 23 langues presentes) :

Langue Exemples %
Anglais (eng) 65 802 24.29%
Espagnol (spa) 16 033 5.92%
Russe (rus) 12 966 4.79%
Portugais (por) 12 792 4.72%
Neerlandais (nld) 12 518 4.62%
Allemand (deu) 12 058 4.45%
Hindi (hin) 12 006 4.43%
Francais (fra) 11 511 4.25%
Polonais (pol) 8 497 3.14%
Turc (tur) 8 213 3.03%
Coreen (kor) 8 164 3.01%
Chinois (zho) 8 159 3.01%
Indonesien (ind) 8 089 2.99%
Bengali (ben) 8 006 2.95%
Vietnamien (vie) 7 991 2.95%
(+ 8 autres langues) ~50 000 ~18%

Point methodologique important : le cache d'extraction utilise dans toutes les experiences de ce projet (extract_once.py) ne filtre pas par langue β€” l'integralite de Smart Turn (23 langues, 75.71% non-anglais) est utilisee telle quelle dans toutes les configurations "mixte" et "Smart Turn seul". Ceci constitue une limite methodologique notable : le modele est entraine sur un signal acoustique majoritairement non-anglais dans sa composante synthetique, alors que l'evaluation se concentre exclusivement sur des accents anglophones (AppTek). Cette caracteristique n'a pas ete isolee experimentalement dans ce travail et pourrait influencer la nature du signal acoustique/prosodique appris par Phase 1.


16. Limites connues

  • LiveKit v1-mini limite a 1.2s de contexte audio (vs 8s pour les autres modeles)
  • Couverture AppTek limitee a l'anglais (14 accents) ; Smart Turn v3.2 est majoritairement non-anglais (75.71% des exemples, 23 langues), sans filtrage par langue applique dans ce projet (voir section 17)
  • Comparaison d'architectures (section 3-4) effectuee sur 3 accents seulement, pour limiter le temps de calcul
  • Instabilite d'entrainement observee pour Conformer a budget 4x sur un accent (en-CN)
  • CPC evalue avec un seul checkpoint pre-entraine (LibriSpeech, anglais), sans fine-tuning de l'encodeur convolutif
  • Le curriculum V1 (section 11) et V3 (section 12) sont conserves a titre de trace de la demarche exploratoire, mais leurs conclusions ont ete affinees/corrigees par le protocole V5 (section 13), qui fait foi
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support