- Turn-Taking Detection Models β Collection complete v4
- Table des matieres
- 1. Comparaison globale β 4 modeles, test officiel Smart Turn v3.2
- 2. Ablation : Phase 1 (acoustique) vs Whisper-frozen-head (semantique) vs Phase 2 (fusion)
- 3. Comparaison d'architectures acoustiques a budget de parametres variable
- 4. CPC : encodeur audio pre-entraine (self-supervised)
- 5. CPC Frozen vs CPC Partial (fine-tuning du GRU contextuel) β config mixte, 14 accents
- 6. Choix de l'encodeur semantique : Whisper vs HuBERT β config Smart Turn seul
- 7. Ablation du mecanisme de fusion β config mixte, en-CN
- 8. Extension : architectures alternatives en config mixte (14 accents)
- 9. Trois configurations d'entrainement (Phase 1 et Phase 2, 14 accents)
- 10. Experience de reequilibrage synthetique/reel (OOD=en-CN)
- 11. Curriculum de diversite d'accents β premiere exploration
- 12. Curriculum de diversite d'accents (V3) β Leave-One-Out avec volume total fixe
- Motivation et question de recherche
- Protocole
- Resultats β Test combine (in-distribution), accuracy moyenne sur 6 repetitions
- Moyennes toutes metriques (Test combine et OOD), section 12 (V3)
- Resultats β OOD (accent exclu), accuracy moyenne sur 6 repetitions
- Tests statistiques formels (K=1 vs K=13, test t apparie par accent)
- Detail par accent β significativite individuelle (OOD, K=1 vs K=13)
- 13. Curriculum de diversite d'accents β evolution methodologique et resultat final (V3 a V5)
- 14. Resultats cles globaux (synthese)
- Chargement
- 15. Fichiers de resultats bruts (JSON)
- 17. Composition des jeux de donnees
- 16. Limites connues
- Table des matieres
Turn-Taking Detection Models β Collection complete v4
Modeles de detection de fin de tour (HOLD/SHIFT), architecture causale, entraines sur Smart Turn v3.2 (synthetique) et/ou AppTek (audio reel de centre d'appel, 14 accents anglophones).
Table des matieres
Architecture et composants
- Comparaison globale avec les modeles de reference
- Ablation : acoustique seule vs semantique seule vs fusion
- Comparaison d'architectures acoustiques a budget variable
- CPC : encodeur audio pre-entraine (self-supervised)
- CPC Frozen vs CPC Partial (fine-tuning du GRU contextuel)
- Choix de l'encodeur semantique : Whisper vs HuBERT
- Ablation du mecanisme de fusion (Cross-Attention vs Avg Pool vs Gated Pool)
- Extension : architectures alternatives en config mixte (BiGRU, CPC+Whisper+Transformer)
Configurations de donnees 9. Trois configurations d'entrainement (mixte / Smart Turn seul / AppTek seul) 10. Experience de reequilibrage synthetique/reel
Curriculum de diversite d'accents 11. Curriculum de diversite d'accents β premiere exploration 12. Curriculum de diversite d'accents (V3) β Leave-One-Out avec volume fixe 13. Curriculum de diversite d'accents (V3 a V5) β evolution methodologique et resultat final
Synthese et annexes 14. Resultats cles globaux (synthese) 15. Fichiers de resultats bruts 16. Limites connues
1. Comparaison globale β 4 modeles, test officiel Smart Turn v3.2
| Modele | Params | Accuracy | ROC-AUC | Notes |
|---|---|---|---|---|
| LiveKit v1-mini | ~0.5B (distille) | 61.02% | 0.7324 | Limite a 1.2s de contexte audio |
| Smart Turn v3.2 (officiel) | ~8M | 73.33% | 0.7962 | Whisper-tiny fine-tune complet |
| Phase 1 (notre, from scratch) | 462K | 87.36-87.93% | 0.9439-0.9483 | Selon config, Whisper gele |
| Phase 2 (notre, fusion) | ~360K (+8M geles) | 92.06-92.60% | 0.9744-0.9776 | Meilleure architecture |
2. Ablation : Phase 1 (acoustique) vs Whisper-frozen-head (semantique) vs Phase 2 (fusion)
14 accents, config mixte (94% Smart Turn / 6% AppTek).
| Accent OOD | P1 Test | WF Test | P2 Test | P1 OOD | WF OOD | P2 OOD |
|---|---|---|---|---|---|---|
| en-AU | 84.21% | 83.63% | 90.01% | 66.44% | 70.04% | 80.76% |
| en-CA | 84.27% | 83.75% | 89.77% | 64.70% | 71.04% | 78.66% |
| en-CN | 84.29% | 83.47% | 90.18% | 56.12% | 67.89% | 72.97% |
| en-GB | 84.14% | 82.78% | 90.48% | 60.29% | 65.29% | 73.43% |
| en-GB_SCT | 84.57% | 83.64% | 90.52% | 57.98% | 60.65% | 70.39% |
| en-GB_WLS | 83.87% | 83.48% | 90.05% | 57.35% | 65.03% | 75.58% |
| en-IE | 84.35% | 83.37% | 90.11% | 63.68% | 76.04% | 84.52% |
| en-IN | 84.31% | 83.56% | 90.55% | 61.05% | 69.43% | 70.57% |
| en-MX | 84.26% | 83.71% | 90.58% | 56.85% | 64.38% | 75.99% |
| en-SG | 84.57% | 83.54% | 90.44% | 63.38% | 71.14% | 76.58% |
| en-US_Aave | 84.20% | 83.70% | 90.07% | 58.56% | 65.64% | 71.83% |
| en-US_General | 84.45% | 83.47% | 90.08% | 62.39% | 71.20% | 79.05% |
| en-US_Southern | 84.60% | 83.68% | 90.60% | 65.61% | 66.60% | 76.32% |
| en-ZA | 84.56% | 83.84% | 90.54% | 57.71% | 67.48% | 76.62% |
| Moyenne | 84.39% | 83.61% | 90.21% | 60.86% | 68.03% | 76.02% |
Resultat cle : ni l'acoustique seule ni la semantique seule n'atteignent la performance de la fusion complete β la cross-attention genere une synergie reelle.
3. Comparaison d'architectures acoustiques a budget de parametres variable
Config AppTek seul, 3 accents (en-CN, en-GB_WLS, en-IE), mode seul et mode fusion (avec Whisper gele).
Moyennes sur 3 accents β architectures from-scratch
| Architecture | Budget (params) | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|---|---|---|---|---|---|
| ECAPA-TDNN | 1x (462K) | 64.68% | 57.42% | 78.97% | 78.21% |
| ECAPA-TDNN | 2x (911K) | 64.51% | 57.46% | 78.05% | 77.40% |
| BiGRU | 1x (461K) | 70.19% | 65.50% | 75.70% | 74.48% |
| BiGRU | 2x (909K) | 70.54% | 65.76% | 76.61% | 74.04% |
| Conformer | 1x (430K) | 67.99% | 61.59% | 77.95% | 75.93% |
| Conformer | 2x (904K) | 72.22% | 68.93% | 78.32% | 77.78% |
| Conformer | 3x (1.36M) | 70.74% | 70.09% | 77.18% | 77.04% |
| Conformer | 4x (1.83M) | 65.14%* | 63.13%* | 78.08% | 78.34% |
*Instabilite d'entrainement isolee sur en-CN a 4x, affectant la moyenne.
Resultats cles :
- A budget egal (~460K), BiGRU domine en mode seul, mais ECAPA-TDNN reprend l'avantage en mode fusion.
- Conformer beneficie d'un budget accru jusqu'a ~900K parametres (2x), avec un gain marque vs 1x.
- Au-dela de 2x, Conformer ne progresse plus de facon monotone (possible surapprentissage sur ~17K exemples train).
- En mode fusion, la performance reste stable a travers tous les budgets (77-78%).
4. CPC : encodeur audio pre-entraine (self-supervised)
Contrairement aux architectures precedentes (entrainees from-scratch), CPC (Contrastive Predictive Coding, Riviere et al. 2020) est un encodeur pre-entraine sur de la parole brute en self-supervised, sans supervision texte. Checkpoint officiel FAIR charge et entierement gele β seule une tete de classification legere (mode seul) ou le module de fusion (mode fusion) sont entraines.
Architecture reelle du checkpoint utilise : 1 843 456 parametres au total (encodeur convolutif + GRU contextuel, sortie 256-dim) β note : ce chiffre differe de certaines estimations plus elevees (~5.8M) parfois citees pour cette famille de modeles ; il correspond aux poids du checkpoint officiel effectivement charge et verifie.
| Accent | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|---|---|---|---|---|
| en-CN | 64.31% | 53.42% | 80.64% | 74.96% |
| en-GB_WLS | 62.69% | 57.61% | 79.91% | 77.56% |
| en-IE | 62.40% | 66.95% | 79.15% | 85.70% |
| Moyenne | 63.13% | 59.33% | 79.90% | 79.41% |
Comparaison finale β toutes architectures, mode fusion, moyennes sur 3 accents
| Architecture | Params (encodeur) | Fusion Test | Fusion OOD |
|---|---|---|---|
| BiGRU (1x, from scratch) | 461K | 75.70% | 74.48% |
| Conformer (1x, from scratch) | 430K | 77.95% | 75.93% |
| ECAPA-TDNN (1x, from scratch) | 462K | 78.97% | 78.21% |
| Conformer (2x, from scratch) | 904K | 78.32% | 77.78% |
| CPC (pre-entraine, gele) | 1.84M | 79.90% | 79.41% |
Resultat cle : CPC (pre-entraine, gele, jamais affine sur la tache) obtient le meilleur score en mode fusion, devant toutes les architectures from-scratch testees β suggerant que son pre-entrainement self-supervised capture deja des informations acoustiques/prosodiques pertinentes, complementaires a la semantique de Whisper. En mode seul cependant, CPC reste modeste (63.13% test, 59.33% OOD), moins bon que BiGRU ou Conformer entraines specifiquement β le gain de CPC provient donc presque entierement de la fusion, pas de sa capacite de classification isolee.
5. CPC Frozen vs CPC Partial (fine-tuning du GRU contextuel) β config mixte, 14 accents
Extension de l'experience CPC (section 4) : comparaison entre l'encodeur CPC entierement gele ("frozen") et une variante ou le GRU contextuel (couche recurrente apres l'encodeur convolutif) est degele et fine-tune sur la tache ("partial"), tandis que l'encodeur convolutif reste toujours gele dans les deux cas.
Parametres entraines : 33,154 (frozen, tete de classification seule) vs 559,490 (partial, tete + GRU contextuel).
CPC Frozen (14 accents)
| Accent | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|---|---|---|---|---|
| en-AU | 65.06% | 61.63% | 80.75% | 84.02% |
| en-CA | 64.63% | 63.11% | 80.21% | 82.30% |
| en-CN | 63.00% | 52.70% | 80.35% | 73.77% |
| en-GB | 63.66% | 59.60% | 79.99% | 78.17% |
| en-GB_SCT | 64.86% | 59.44% | 80.24% | 74.86% |
| en-GB_WLS | 64.53% | 56.19% | 79.83% | 76.85% |
| en-IE | 63.79% | 66.02% | 78.79% | 87.83% |
| en-IN | 64.55% | 60.92% | 80.53% | 71.34% |
| en-MX | 64.10% | 60.79% | 80.06% | 78.02% |
| en-SG | 64.99% | 62.29% | 80.60% | 78.14% |
| en-US_Aave | 64.63% | 57.31% | 80.32% | 76.24% |
| en-US_General | 63.79% | 59.83% | 80.49% | 80.97% |
| en-US_Southern | 63.84% | 63.65% | 80.42% | 78.05% |
| en-ZA | 65.19% | 56.09% | 80.55% | 76.63% |
| Moyenne | 64.33% | 59.97% | 80.23% | 78.37% |
CPC Partial (14 accents)
| Accent | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|---|---|---|---|---|
| en-AU | 63.02% | 61.45% | 79.45% | 85.89% |
| en-CA | 63.18% | 59.70% | 79.22% | 80.98% |
| en-CN | 60.84% | 50.87% | 79.96% | 72.50% |
| en-GB | 63.50% | 52.29% | 80.75% | 76.33% |
| en-GB_SCT | 64.46% | 55.81% | 79.86% | 75.18% |
| en-GB_WLS | 63.69% | 57.23% | 79.46% | 77.05% |
| en-IE | 63.62% | 59.23% | 79.21% | 85.75% |
| en-IN | 62.45% | 55.53% | 79.98% | 71.14% |
| en-MX | 64.69% | 62.91% | 79.18% | 77.41% |
| en-SG | 63.92% | 58.69% | 80.35% | 77.28% |
| en-US_Aave | 62.54% | 53.12% | 79.68% | 75.53% |
| en-US_General | 63.32% | 56.39% | 80.33% | 80.72% |
| en-US_Southern | 63.44% | 57.41% | 80.33% | 77.98% |
| en-ZA | 63.87% | 56.10% | 79.24% | 79.43% |
| Moyenne | 63.33% | 56.91% | 79.79% | 78.08% |
Comparaison synthetique
| Mode | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|---|---|---|---|---|
| Frozen | 64.33% | 59.97% | 80.23% | 78.37% |
| Partial | 63.33% | 56.91% | 79.79% | 78.08% |
| Ecart (frozen - partial) | +1.00 | +3.06 | +0.44 | +0.29 |
Resultat cle : le fine-tuning partiel du GRU contextuel de CPC n'apporte aucun benefice, et se revele legerement contre-productif sur toutes les metriques, particulierement pour la generalisation OOD en mode seul (+3.06 points en faveur du frozen). Ceci suggere que les representations pre-entrainees de CPC captent deja l'essentiel du signal utile pour cette tache, et qu'un fine-tuning limite (peu de donnees specifiques face a un espace de parametres relativement large) ajoute du bruit d'optimisation sans gain reel.
Tableau recapitulatif β toutes architectures en fusion, config mixte, moyennes 14 accents
| Architecture | Params (acoustique) | Fusion Test | Fusion OOD |
|---|---|---|---|
| CPC frozen | 1.84M (gele) | 80.23% | 78.37% |
| CPC + Whisper + Transformer | 1.84M (gele) + 500K (fusion) | 80.02% | 78.04% |
| CPC partial | 1.84M (559K entraines) | 79.79% | 78.08% |
| Phase 2 (ECAPA + Cross-Attn+TCN) | 462K (from scratch) | 90.21% | 76.02% |
| BiGRU | 461K (from scratch) | 88.78% | 74.71% |
Interpretation finale : pour la performance maximale sur donnees connues (synthetique + reel vu), Phase 2 (ECAPA, from scratch) reste la meilleure architecture. Pour la generalisation a un accent totalement inconnu, CPC gele (sans aucun fine-tuning) offre la meilleure robustesse parmi toutes les architectures testees β confirmant qu'un encodeur pre-entraine en self-supervised sur de la parole brute capture une information acoustique/prosodique qui generalise mieux qu'un apprentissage from-scratch specifique a la tache, meme avec beaucoup moins de parametres entraines (33K vs 462K).
6. Choix de l'encodeur semantique : Whisper vs HuBERT β config Smart Turn seul
Ablation testant si le choix de l'encodeur semantique gele (dans la fusion Phase 2) influence les resultats. Meme protocole que l'experience "Smart Turn seul" (train/val/test officiels Smart Turn v3.2, aucune donnee AppTek), avec Phase 1 (ECAPA-TDNN) identique dans les deux cas, seul l'encodeur de fusion change.
Whisper-tiny : encodeur pre-entraine pour la reconnaissance vocale (supervision texte forte), 384 dimensions de sortie. HuBERT-base : encodeur pre-entraine en self-supervised pur (masquage acoustique, sans supervision textuelle), 768 dimensions de sortie.
| Modele | Accuracy | F1 | ROC-AUC |
|---|---|---|---|
| Phase 1 (ECAPA-TDNN, acoustique seule) | 87.34% | 87.34% | 0.9439 |
| Phase 2 (fusion avec Whisper) | 92.31% | 92.31% | 0.9759 |
| Phase 2 (fusion avec HuBERT) | 85.57% | 85.56% | 0.9271 |
Chiffres Phase 2 (Whisper) recalcules avec le protocole complet (accuracy, F1, AUC) pour assurer une comparaison homogene a 3 metriques avec HuBERT ; ecart mineur (92.31% vs 92.37% dans une premiere execution anterieure) du a la variance normale d'entrainement.
Resultat cle : la fusion avec HuBERT degrade les performances par rapport a Phase 1 seul (85.57% vs 87.34%), alors que la fusion avec Whisper les ameliore significativement (+5 points). Ceci suggere que le gain de la fusion semantique dans Phase 2 ne provient pas simplement de l'ajout d'une representation audio pre-entrainee generique, mais specifiquement de la supervision textuelle de Whisper (entraine pour la reconnaissance vocale) β un signal linguistique/semantique que le self-supervised pur de HuBERT ne capture pas de la meme maniere. Pour une tache de detection de fin de tour, qui beneficie probablement d'une comprehension du caractere syntaxiquement/semantiquement complet d'un enonce, la supervision texte de Whisper semble apporter un avantage decisif que HuBERT n'offre pas.
7. Ablation du mecanisme de fusion β config mixte, en-CN
Comparaison de trois mecanismes pour combiner les features acoustiques (ECAPA-TDNN) et semantiques (Whisper), Phase 1 identique dans les trois cas.
Cross-Attention (Phase 2 originale) : attention causale entre les deux modalites, suivie d'un TCN. Average Pooling : moyenne temporelle de chaque modalite, projection, concatenation, MLP. Gated Pooling : moyenne temporelle de chaque modalite, porte apprise (sigmoid) ponderant la contribution relative de chaque modalite avant fusion.
| Mecanisme | Test combine | OOD |
|---|---|---|
| Cross-Attention (baseline) | 90.01% | 69.00% |
| Gated Pool | 87.30% | 67.57% |
| Avg Pool | 87.02% | 68.20% |
Resultat cle : la cross-attention domine les deux mecanismes plus simples sur les deux metriques (+2.71 a +2.99 points test, +0.80 a +1.43 points OOD), confirmant que la capacite d'attention dynamique entre modalites (plutot qu'une simple moyenne ou une porte statique) apporte une vraie valeur ajoutee a la tache, justifiant la complexite additionnelle de ce mecanisme dans l'architecture Phase 2.
8. Extension : architectures alternatives en config mixte (14 accents)
Suite a la comparaison d'architectures a budget egal (config AppTek seul, section 3), deux architectures supplementaires ont ete testees en config mixte (Smart Turn + AppTek), sur les 14 accents.
BiGRU (config mixte, 14 accents)
| Accent OOD | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|---|---|---|---|---|
| en-AU | 69.29% | 71.17% | 88.48% | 79.49% |
| en-CA | 68.31% | 69.33% | 88.74% | 78.17% |
| en-CN | 69.24% | 64.71% | 88.65% | 69.00% |
| en-GB | 69.95% | 62.62% | 89.06% | 69.90% |
| en-GB_SCT | 69.50% | 61.49% | 88.79% | 71.26% |
| en-GB_WLS | 68.02% | 66.18% | 88.38% | 74.17% |
| en-IE | 68.04% | 69.13% | 88.85% | 81.72% |
| en-IN | 69.57% | 63.46% | 88.83% | 67.11% |
| en-MX | 69.89% | 64.21% | 88.82% | 72.76% |
| en-SG | 68.46% | 67.29% | 88.93% | 73.56% |
| en-US_Aave | 69.12% | 63.21% | 89.02% | 71.88% |
| en-US_General | 68.93% | 69.28% | 88.95% | 76.05% |
| en-US_Southern | 70.41% | 67.39% | 88.71% | 75.66% |
| en-ZA | 70.08% | 63.62% | 88.68% | 72.43% |
| Moyenne | 69.06% | 65.59% | 88.78% | 74.71% |
Resultat : BiGRU (461K params) sous-performe ECAPA-TDNN (Phase 1, 462K params) sur le test combine en config mixte (88.78% vs 90.21%), malgre sa superiorite observee en config AppTek seul. Suggere que BiGRU exploite moins bien le volume massif de donnees synthetiques Smart Turn.
CPC + Whisper + Transformer (nouvelle architecture de fusion)
Modification apportee a la fusion (par rapport a la Cross-Attention + TCN originale de Phase 2) :
- Cross-attention causale entre features CPC (acoustique, gelees) et Whisper (semantique, gelees) β identique a l'original
- Connexion residuelle ajoutee : l'acoustique brute projetee est additionnee a la sortie de cross-attention, puis normalisee (LayerNorm)
- TCN remplace par 2 couches de TransformerEncoder (d_model=128, nhead=4, dim_feedforward=256), avec masque causal explicite
- Classifieur a 2 couches (Linear 128->32 + ReLU + Linear 32->2)
Parametres de la fusion : 499,810 (contre ~360K pour la fusion originale Cross-Attention+TCN, soit +39%)
| Accent OOD | Seul Test | Seul OOD | Fusion Test | Fusion OOD |
|---|---|---|---|---|
| en-AU | 63.71% | 62.45% | 80.42% | 86.28% |
| en-CA | 63.70% | 63.72% | 79.75% | 81.34% |
| en-CN | 65.98% | 54.45% | 81.44% | 74.09% |
| en-GB | 63.61% | 58.81% | 80.39% | 77.19% |
| en-GB_SCT | 64.93% | 60.93% | 80.01% | 75.92% |
| en-GB_WLS | 63.94% | 57.67% | 79.68% | 77.05% |
| en-IE | 63.96% | 65.20% | 78.68% | 86.70% |
| en-IN | 64.38% | 61.71% | 80.97% | 69.96% |
| en-MX | 63.77% | 64.04% | 80.42% | 78.65% |
| en-SG | 65.11% | 61.01% | 81.14% | 77.37% |
| en-US_Aave | 64.31% | 58.56% | 80.46% | 77.80% |
| en-US_General | 64.07% | 59.64% | 80.66% | 81.10% |
| en-US_Southern | 63.42% | 62.57% | 80.35% | 80.69% |
| en-ZA | 64.74% | 55.62% | 79.77% | 78.38% |
| Moyenne | 64.19% | 60.82% | 80.02% | 78.04% |
Resultat cle : cette architecture obtient le meilleur score OOD moyen de toutes les architectures testees en config mixte (78.04%), surpassant Phase 2 originale (76.02%) β malgre un score de test in-distribution inferieur (80.02% vs 90.21%). Le remplacement du TCN par un Transformer avec connexion residuelle semble ameliorer specifiquement la capacite de generalisation vers l'audio reel inconnu, au prix d'une performance legerement moindre sur les donnees vues (Smart Turn + AppTek connus).
Comparaison finale β toutes architectures en config mixte, moyennes 14 accents
| Architecture | Params (fusion) | Test combine | OOD |
|---|---|---|---|
| BiGRU | 461K (encodeur) | 88.78% | 74.71% |
| Phase 1/2 (ECAPA + Cross-Attn+TCN) | 462K + ~360K | 90.21% | 76.02% |
| CPC + Whisper + Transformer | 1.84M (CPC gele) + 500K (fusion) | 80.02% | 78.04% |
Interpretation : si l'objectif est la performance maximale sur donnees connues (synthetique + reel vu), Phase 2 (ECAPA + Cross-Attention/TCN) reste la meilleure architecture. Si l'objectif est la generalisation a un accent totalement inconnu, la combinaison CPC (pre-entraine) + fusion Transformer semble legerement superieure, suggerant une piste d'amelioration pour des applications ou la robustesse a des locuteurs/accents non vus est prioritaire.
9. Trois configurations d'entrainement (Phase 1 et Phase 2, 14 accents)
| Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
|---|---|---|---|---|
| Smart Turn seul (0% AppTek) | 87.55% | 55.85%* | 92.31% | 65.77%* |
| Mixte (94% ST / 6% AppTek) | 84.39% | 60.86% | 90.21% | 76.02% |
| AppTek seul (0% ST) | 64.42% | 56.59% | 78.79% | 77.58% |
*Pour Smart Turn seul, "OOD" = AppTek test (jamais vu a l'entrainement).
Resultat le plus marquant : Phase 2 (AppTek seul) obtient le meilleur score OOD moyen parmi ces 3 configurations, malgre 16x moins de donnees et l'absence de synthetique.
Tableau complet β Mixte, 14 accents, avec baselines figees
| Accent OOD | ST v3.2 AppTek | ST v3.2 OOD | LiveKit AppTek | LiveKit OOD | P1 AppTek | P1 OOD | P2 AppTek | P2 OOD |
|---|---|---|---|---|---|---|---|---|
| en-AU | 64.39% | 67.38% | 69.12% | 74.37% | 62.07% | 66.44% | 80.55% | 80.76% |
| en-CA | 63.41% | 67.80% | 67.88% | 70.61% | 66.44% | 64.70% | 79.06% | 78.66% |
| en-CN | 63.59% | 63.04% | 68.77% | 64.79% | 67.39% | 56.12% | 81.64% | 72.97% |
| en-GB | 64.76% | 60.48% | 68.46% | 67.33% | 65.61% | 60.29% | 78.75% | 73.43% |
| en-GB_SCT | 64.23% | 58.39% | 68.43% | 68.27% | 66.15% | 57.98% | 77.75% | 70.39% |
| en-GB_WLS | 63.67% | 61.76% | 67.44% | 67.65% | 65.83% | 57.35% | 79.48% | 75.58% |
| en-IE | 63.06% | 73.44% | 68.00% | 76.18% | 68.62% | 63.68% | 78.77% | 84.52% |
| en-IN | 64.34% | 61.49% | 68.15% | 62.63% | 67.47% | 61.05% | 79.70% | 70.57% |
| en-MX | 64.88% | 63.65% | 68.63% | 70.44% | 65.86% | 56.85% | 78.74% | 75.99% |
| en-SG | 63.30% | 66.45% | 68.01% | 67.19% | 67.14% | 63.38% | 79.73% | 76.58% |
| en-US_Aave | 65.98% | 58.14% | 69.10% | 65.70% | 64.17% | 58.56% | 80.86% | 71.83% |
| en-US_General | 63.84% | 68.90% | 68.41% | 67.82% | 66.21% | 62.39% | 79.73% | 79.05% |
| en-US_Southern | 64.96% | 63.43% | 68.30% | 70.44% | 67.61% | 65.61% | 78.71% | 76.32% |
| en-ZA | 64.84% | 66.57% | 68.42% | 65.71% | 65.50% | 57.71% | 78.29% | 76.62% |
| Moyenne | 64.23% | 64.35% | 68.29% | 68.51% | 66.01% | 60.86% | 79.34% | 76.02% |
Effet de l'exposition multi-accent β Smart Turn seul vs Mixte, sur le meme split AppTek test
| Accent | P1 (ST seul) AppTek | P1 (mixte) AppTek | P2 (ST seul) AppTek | P2 (mixte) AppTek |
|---|---|---|---|---|
| en-AU | 55.00% | 62.07% | 66.09% | 80.55% |
| en-CA | 55.74% | 66.44% | 66.02% | 79.06% |
| en-CN | 55.13% | 67.39% | 65.63% | 81.64% |
| en-GB | 57.21% | 65.61% | 67.18% | 78.75% |
| en-GB_SCT | 56.27% | 66.15% | 66.96% | 77.75% |
| en-GB_WLS | 55.56% | 65.83% | 65.81% | 79.48% |
| en-IE | 56.21% | 68.62% | 64.62% | 78.77% |
| en-IN | 55.59% | 67.47% | 65.09% | 79.70% |
| en-MX | 56.36% | 65.86% | 65.93% | 78.74% |
| en-SG | 55.78% | 67.14% | 65.90% | 79.73% |
| en-US_Aave | 55.63% | 64.17% | 65.01% | 80.86% |
| en-US_General | 55.21% | 66.21% | 65.19% | 79.73% |
| en-US_Southern | 56.78% | 67.61% | 65.66% | 78.71% |
| en-ZA | 56.38% | 65.50% | 65.67% | 78.29% |
| Moyenne | 55.85% | 66.01% | 65.77% | 79.34% |
10. Experience de reequilibrage synthetique/reel (OOD=en-CN)
| Configuration | P1 Test | P1 OOD | P2 Test | P2 OOD |
|---|---|---|---|---|
| Original (94%/6%) | 84.89% | 59.54% | 90.48% | 71.07% |
| Oversample (65%/35%, reptete) | 84.50% | 59.78% | 90.10% | 70.19% |
| Undersample (50%/50%, vrai) | 60.93% | 54.69% | 87.47% | 71.70% |
Resultat cle : Phase 1 s'effondre severement sous undersample (-23.96 points), Phase 2 resiste beaucoup mieux (-3.01 points), demontrant l'efficacite d'apprentissage superieure des representations pre-entrainees face a la rarete des donnees reelles.
11. Curriculum de diversite d'accents β premiere exploration
Description de l'experience
Cette experience teste l'effet du nombre d'accents distincts presents dans l'entrainement sur la capacite de generalisation a des accents totalement inconnus (OOD), independamment du volume total de donnees.
Protocole :
- Pour chaque valeur de K (nombre d'accents AppTek inclus), on construit un jeu d'entrainement melangeant K accents AppTek avec un volume egal de Smart Turn sous-echantillonne aleatoirement (ratio 50/50)
- Le modele (Phase 1 ECAPA-TDNN + Phase 2 fusion Cross-Attention) est entraine sur ce melange, 15 epochs
- L'evaluation OOD se fait sur chacun des accents restants (14-K) individuellement, puis moyennee
- Valeurs de K testees : 1, 2, 4, 7, 10, 13
Controle de la variance : chaque (K, ordre) est repete avec 2 graines d'entrainement independantes, sur 6 sequences d'accents (3 permutations aleatoires distinctes, chacune testee en ordre normal et inverse) : 6 sequences x 6 valeurs de K x 2 repetitions = 72 runs.
Resultats β moyenne et ecart-type sur les 12 runs par valeur de K
| K (accents inclus) | Test moyen | Test std | OOD moyen | OOD std |
|---|---|---|---|---|
| 1 | 77.20% | 3.13% | 73.99% | 1.15% |
| 2 | 76.78% | 2.61% | 75.26% | 0.52% |
| 4 | 77.78% | 1.60% | 75.82% | 1.02% |
| 7 | 78.38% | 1.22% | 76.89% | 1.12% |
| 10 | 78.98% | 1.01% | 76.57% | 1.41% |
| 13 | 78.67% | 0.51% | 75.90% | 2.60% |
Note : ce premier protocole exploratoire a ete remplace par une version plus rigoureuse (sections 12-13), qui a revele que le "plateau" observe ici etait en partie du a une contrainte methodologique. Conserve ici a titre de trace de la demarche exploratoire initiale.
12. Curriculum de diversite d'accents (V3) β Leave-One-Out avec volume total fixe
Motivation et question de recherche
Isoler specifiquement l'effet de la diversite d'accents du volume total de donnees, avec un design statistiquement rigoureux (repetitions multiples, tirage aleatoire, test de significativite formel).
Protocole
Design Leave-One-Out (LOO) : chaque accent (14 au total) est teste individuellement comme OOD, totalement exclu de l'entrainement.
Volume total AppTek fixe a 1258 exemples (628 par classe HOLD/SHIFT), quel que soit K β determine par la taille du plus petit accent disponible (en-CN). Ce volume est reparti egalement entre les K accents inclus : a K=1, l'unique accent fournit ses 1258 exemples ; a K=13, chacun des 13 accents restants ne fournit qu'environ 97 exemples. Smart Turn synthetique sous-echantillonne pour egaler ce volume (ratio 50/50).
Tirage aleatoire des K accents inclus a chaque run, independamment a chaque repetition.
Valeurs de K : 1, 3, 6, 9, 13. Repetitions : 6 par (accent OOD, K). Total : 14 x 5 x 6 = 420 runs.
Resultats β Test combine (in-distribution), accuracy moyenne sur 6 repetitions
| Accent | K=1 | K=3 | K=6 | K=9 | K=13 |
|---|---|---|---|---|---|
| en-AU | 73.67% | 77.04% | 75.04% | 73.03% | 73.62% |
| en-CA | 77.22% | 75.98% | 76.83% | 73.66% | 74.51% |
| en-CN | 79.96% | 75.44% | 73.53% | 73.48% | 77.36% |
| en-GB | 81.03% | 75.89% | 75.85% | 73.48% | 75.31% |
| en-GB_SCT | 76.24% | 73.23% | 73.71% | 72.94% | 73.89% |
| en-GB_WLS | 73.85% | 76.06% | 75.67% | 75.00% | 74.69% |
| en-IE | 76.33% | 74.56% | 73.80% | 72.85% | 74.96% |
| en-IN | 78.10% | 74.91% | 76.74% | 76.97% | 75.49% |
| en-MX | 78.10% | 74.73% | 75.40% | 73.92% | 76.56% |
| en-SG | 78.19% | 76.42% | 75.31% | 77.24% | 70.77% |
| en-US_Aave | 76.68% | 76.68% | 74.24% | 72.67% | 75.76% |
| en-US_General | 78.99% | 78.10% | 75.13% | 75.45% | 76.83% |
| en-US_Southern | 77.13% | 78.63% | 74.60% | 75.45% | 74.42% |
| en-ZA | 75.62% | 73.49% | 74.96% | 74.01% | 73.62% |
Moyennes toutes metriques (Test combine et OOD), section 12 (V3)
| K | Test Acc | Test F1 | Test AUC | OOD Acc | OOD F1 | OOD AUC |
|---|---|---|---|---|---|---|
| 1 | 77.22% | 77.07% | 0.8511 | 72.47% | 72.11% | 0.8084 |
| 3 | 75.80% | 75.66% | 0.8354 | 73.52% | 73.30% | 0.8141 |
| 6 | 75.06% | 74.85% | 0.8311 | 74.31% | 74.17% | 0.8190 |
| 9 | 74.30% | 74.09% | 0.8246 | 74.32% | 74.14% | 0.8200 |
| 13 | 74.84% | 74.65% | 0.8224 | 74.29% | 74.14% | 0.8183 |
Confirmation multi-metrique : F1-macro et ROC-AUC suivent la meme tendance que l'accuracy (baisse du test, hausse de l'OOD avec K), confirmant que le trade-off observe dans le protocole V3 n'est pas un artefact d'une seule metrique.
Resultats β OOD (accent exclu), accuracy moyenne sur 6 repetitions
| Accent | K=1 | K=3 | K=6 | K=9 | K=13 |
|---|---|---|---|---|---|
| en-AU | 77.49% | 79.96% | 79.56% | 79.60% | 79.65% |
| en-CA | 71.99% | 76.51% | 77.07% | 76.54% | 76.27% |
| en-CN | 69.33% | 68.81% | 70.18% | 68.67% | 69.97% |
| en-GB | 70.17% | 70.46% | 71.32% | 71.95% | 73.01% |
| en-GB_SCT | 68.11% | 69.68% | 70.79% | 69.04% | 69.43% |
| en-GB_WLS | 69.54% | 74.38% | 73.70% | 74.15% | 74.13% |
| en-IE | 81.31% | 81.04% | 81.58% | 81.70% | 80.45% |
| en-IN | 68.02% | 68.26% | 69.65% | 68.44% | 69.58% |
| en-MX | 72.28% | 71.79% | 73.60% | 73.10% | 74.10% |
| en-SG | 73.61% | 73.46% | 75.55% | 75.34% | 73.63% |
| en-US_Aave | 70.26% | 72.05% | 71.95% | 73.14% | 72.62% |
| en-US_General | 76.25% | 76.20% | 76.71% | 77.31% | 77.20% |
| en-US_Southern | 74.03% | 74.96% | 74.83% | 76.51% | 76.05% |
| en-ZA | 72.24% | 71.78% | 73.87% | 74.98% | 74.03% |
Tests statistiques formels (K=1 vs K=13, test t apparie par accent)
| Metrique | Difference moyenne (K=13 - K=1) | t | p-value | Conclusion |
|---|---|---|---|---|
| OOD accuracy | +1.82 points | 4.639 | 0.000463 | Significatif : la diversite ameliore la generalisation |
| Test combine accuracy | -2.38 points | -4.267 | 0.000918 | Significatif : la diversite degrade la performance in-distribution |
Detail par accent β significativite individuelle (OOD, K=1 vs K=13)
| Accent | Diff OOD (K13-K1) | p-value | Significatif |
|---|---|---|---|
| en-GB_WLS | +4.58 | 0.0059 | *** |
| en-GB | +2.83 | 0.0451 | * |
| en-MX | +1.82 | 0.0243 | * |
| en-ZA | +1.79 | 0.0330 | * |
| en-CA | +4.28 | 0.1414 | tendance forte, non significative |
| en-AU | +2.16 | 0.0947 | tendance, non significative |
| en-CN | +0.64 | 0.5430 | non |
| en-SG | +0.02 | 0.9840 | non |
| en-IE | -0.86 | 0.3237 | non (legere baisse) |
Resultat a ce stade : un veritable compromis diversite/specialisation semblait statistiquement prouve dans les deux sens. Ce resultat a ete remis en question et affine dans la section suivante (13).
13. Curriculum de diversite d'accents β evolution methodologique et resultat final (V3 a V5)
Recit de la demarche scientifique
Cette serie d'experiences illustre l'importance de controler soigneusement les variables confondues avant de conclure sur un effet.
Remise en question du V3 (section 12) : le trade-off observe etait-il un phenomene reel, ou un artefact du volume total tres contraint (1258 exemples) ? A volume aussi faible, chaque accent supplementaire dilue mecaniquement le nombre d'exemples disponibles par accent (de 1258 a K=1, a environ 97 par accent a K=13).
V4 (grille exploratoire Volume x K) : levee de la contrainte de volume fixe, en gardant tout le HOLD et le SHIFT disponibles (au lieu de sous-echantillonner pour equilibrer), compense par un class weighting inverse-frequence dans la loss. Grille testee : K in {1,6,13}, volumes croissants (2117 a 16000), 4 repetitions, 448 runs.
Resultat V4 : a volume suffisant (16000), le trade-off disparait β le test combine a K=13 (78.98%) rejoint celui de K=1 a faible volume (78.62%, difference non significative, p=0.57), tandis que l'OOD continue de s'ameliorer nettement (+3.94 points, p<0.0001).
V5 (protocole final, rigueur du V3 + methodologie du V4) : reprise du design Leave-One-Out complet (14 accents, K in {1,3,6,9,13}, 6 repetitions, tirage aleatoire), mais avec class weighting et tout le volume disponible pour les accents tires a chaque K (pas de contrainte de volume total fixe). 420 runs.
Resultats finaux (V5) β toutes metriques, K=1 vs K=13
| Metrique | K=1 (moyenne) | K=13 (moyenne) | Difference | t | p-value | Significativite |
|---|---|---|---|---|---|---|
| Test Accuracy | 78.65% | 80.36% | +1.71 | 4.450 | 0.000655 | *** |
| Test F1-macro | 75.66% | 78.12% | +2.46 | 5.660 | 0.000078 | *** |
| Test ROC-AUC | 0.8549 | 0.8784 | +0.0236 | 5.128 | 0.000194 | *** |
| OOD Accuracy | 73.21% | 77.42% | +4.21 | 10.215 | <0.000001 | *** |
| OOD F1-macro | 73.01% | 77.32% | +4.31 | 9.712 | <0.000001 | *** |
| OOD ROC-AUC | 0.8121 | 0.8581 | +0.0460 | 19.845 | <0.000001 | *** |
Courbe complete (V5) β moyenne sur 84 runs par valeur de K (14 accents x 6 repetitions)
| K | Test Accuracy | OOD Accuracy |
|---|---|---|
| 1 | 78.65% | 73.21% |
| 3 | 79.48% | 74.83% |
| 6 | 79.81% | 76.17% |
| 9 | 80.19% | 76.90% |
| 13 | 80.36% | 77.42% |
Resultat cle et conclusion definitive
Sur les 6 metriques testees, toutes montrent un gain hautement significatif (p<0.001, souvent p<10^-6) avec l'augmentation du nombre d'accents distincts dans l'entrainement, de K=1 a K=13, sans aucune exception ni compromis. Test et OOD progressent de facon monotone et simultanee avec K.
Le "trade-off" identifie dans le protocole V3 (section 12) etait entierement un artefact methodologique, du a la contrainte artificielle de volume total fixe combinee au sous-echantillonnage strict pour equilibrer HOLD/SHIFT. Une fois cette contrainte levee β en conservant tout le volume disponible et en compensant le desequilibre des classes par un class weighting dans la loss β la diversite d'accents s'avere strictement beneique, sur toutes les metriques et de maniere hautement significative.
Lecon methodologique generale : un premier resultat statistiquement significatif (le trade-off du V3) s'est revele etre un artefact de conception une fois la methodologie affinee, inversant completement l'interpretation pratique du phenomene etudie β illustration de l'importance de tester la robustesse d'un resultat face aux choix de conception avant de conclure.
Implication pratique finale : pour maximiser a la fois la performance sur les donnees connues et la robustesse a des accents inconnus, il convient d'inclure autant d'accents differents que possible dans l'entrainement, sans chercher a equilibrer artificiellement les classes au prix de la suppression de donnees β un class weighting dans la fonction de perte permet de gerer le desequilibre naturel tout en conservant le benefice complet du volume et de la diversite disponibles.
14. Resultats cles globaux (synthese)
- La fusion (Phase 2) genere une vraie synergie β ni l'acoustique seule ni la semantique seule ne l'egalent.
- CPC (pre-entraine, gele) surpasse toutes les architectures from-scratch en mode fusion pour l'OOD, malgre l'absence totale de fine-tuning sur la tache.
- Le fine-tuning partiel de CPC (mode "partial") n'apporte aucun benefice par rapport a un gel complet ("frozen").
- La supervision textuelle de Whisper (vs le self-supervised pur de HuBERT) est determinante dans le gain apporte par la fusion semantique.
- La cross-attention apporte une vraie valeur ajoutee par rapport a des mecanismes de fusion plus simples (average/gated pooling).
- Phase 2 (AppTek seul) atteint une excellente generalisation OOD malgre 16x moins de donnees et l'absence de synthetique.
- Le choix d'architecture acoustique optimal depend du contexte (seule vs fusionnee) et du budget de parametres.
- La diversite d'accents ameliore significativement et simultanement la performance in-distribution ET la generalisation OOD, a condition de ne pas sacrifier de volume de donnees pour l'obtenir (class weighting plutot que sous-echantillonnage) β un resultat etabli avec une rigueur statistique complete (tests t apparies, p<0.001 sur 6 metriques).
Chargement
import torch
ckpt = torch.load("phase2-whisper-crossattn-v4-ood-en-AU-light.pt", map_location="cpu")
model.load_state_dict(ckpt['best_state'])
15. Fichiers de resultats bruts (JSON)
results-ood-{accent}.json,results-apptekonly-{accent}.jsonβ Phase1/Phase2, configs mixte et AppTek seulresults-whisperfrozen-mixte-{accent}.jsonβ ablation Whisper-frozen-headarch-comparison-{arch}-{accent}.json,arch2x-comparison-{arch}-{accent}.jsonβ architectures, budgets 1x/2xarchscale-comparison-conformer-{3x,4x}-{accent}.jsonβ Conformer, budgets 3x/4xcpc-comparison-{accent}.jsonβ CPC pre-entraine gele (config AppTek seul)cpc-frozen-mixte-{accent}.json,cpc-partial-mixte-{accent}.jsonβ CPC frozen/partial, config mixtemixte-arch-comparison-bigru-{accent}.jsonβ BiGRU, config mixtemixte_arch_comparison_cpc_transformer_{accent}.jsonβ CPC+Whisper+Transformerresults-smartturn-hubert.jsonβ comparaison Whisper vs HuBERTfusion-ablation-{mechanism}-en-CN.jsonβ ablation mecanisme de fusioncurriculum-{seq}-k{k}.jsonβ curriculum V1 (premiere exploration)curriculumv3-{accent}-k{k}-r{repeat}.jsonβ curriculum V3 (LOO, volume fixe)curriculumv4-{accent}-k{k}-vol{volume}-r{repeat}.jsonβ curriculum V4 (grille volume x K)curriculumv5-{accent}-k{k}-r{repeat}.jsonβ curriculum V5 (LOO, volume max, class weighting)architecture-comparison-consolidated.jsonβ consolide architectures 1x/2xdecomposition-test-all-accents.json,results-smartturn-only-v4.json,smartturn-only-apptek-test-by-accent.jsonbaselines-smartturn-livekit-all-accents.json
17. Composition des jeux de donnees
AppTek β distribution HOLD/SHIFT par accent (14 accents, 40 512 exemples)
| Accent | HOLD | SHIFT | Total | % SHIFT |
|---|---|---|---|---|
| en-AU | 1949 | 751 | 2700 | 27.8% |
| en-CA | 2469 | 820 | 3289 | 24.9% |
| en-CN | 2001 | 629 | 2630 | 23.9% |
| en-GB | 1067 | 1050 | 2117 | 49.6% |
| en-GB_SCT | 1433 | 1084 | 2517 | 43.1% |
| en-GB_WLS | 2928 | 782 | 3710 | 21.1% |
| en-IE | 2218 | 1056 | 3274 | 32.3% |
| en-IN | 1695 | 1140 | 2835 | 40.2% |
| en-MX | 2560 | 883 | 3443 | 25.6% |
| en-SG | 2001 | 1076 | 3077 | 35.0% |
| en-US_Aave | 2502 | 946 | 3448 | 27.4% |
| en-US_General | 1765 | 783 | 2548 | 30.7% |
| en-US_Southern | 1665 | 756 | 2421 | 31.2% |
| en-ZA | 1453 | 1050 | 2503 | 41.9% |
| TOTAL | 27706 | 12806 | 40512 | 31.6% |
Observation : le ratio HOLD/SHIFT varie fortement selon l'accent (21.1% a 49.6% de SHIFT), sans lien evident avec la difficulte de generalisation observee dans les experiences precedentes β AppTek est nettement desequilibre en faveur de HOLD (68.4% en moyenne), ce qui motive l'usage systematique d'un class weighting ou d'un sous-echantillonnage selon les experiences (voir sections 12-13).
Smart Turn v3.2 (train) β composition complete, {n_st} exemples
HOLD/SHIFT : quasi parfaitement equilibre (50.43% HOLD / 49.57% SHIFT), coherent avec un dataset construit specifiquement pour cette tache.
Synthetique vs humain reel :
| Type | Exemples | % |
|---|---|---|
| Synthetique (TTS) | 223 343 | 82.43% |
| Humain reel | 47 603 | 17.57% |
Sources / moteurs de synthese :
| Source | Exemples | % |
|---|---|---|
| chirp3_1 (Google Chirp3) | 146 627 | 54.12% |
| chirp3_2 (Google Chirp3) | 67 646 | 24.97% |
| liva_1 | 30 922 | 11.41% |
| midcentury_1 | 8 489 | 3.13% |
| mundo_1 | 3 986 | 1.47% |
| human_5 (humain reel) | 3 527 | 1.30% |
| rime_2 | 3 505 | 1.29% |
| orpheus_endfiller_1 | 1 661 | 0.61% |
| orpheus_grammar_1 | 1 570 | 0.58% |
| orpheus_midfiller_1 | 1 542 | 0.57% |
| chirp3_3_short (Google Chirp3) | 792 | 0.29% |
| human_convcollector_1 (humain reel) | 679 | 0.25% |
Langues (top 15 sur 23 langues presentes) :
| Langue | Exemples | % |
|---|---|---|
| Anglais (eng) | 65 802 | 24.29% |
| Espagnol (spa) | 16 033 | 5.92% |
| Russe (rus) | 12 966 | 4.79% |
| Portugais (por) | 12 792 | 4.72% |
| Neerlandais (nld) | 12 518 | 4.62% |
| Allemand (deu) | 12 058 | 4.45% |
| Hindi (hin) | 12 006 | 4.43% |
| Francais (fra) | 11 511 | 4.25% |
| Polonais (pol) | 8 497 | 3.14% |
| Turc (tur) | 8 213 | 3.03% |
| Coreen (kor) | 8 164 | 3.01% |
| Chinois (zho) | 8 159 | 3.01% |
| Indonesien (ind) | 8 089 | 2.99% |
| Bengali (ben) | 8 006 | 2.95% |
| Vietnamien (vie) | 7 991 | 2.95% |
| (+ 8 autres langues) | ~50 000 | ~18% |
Point methodologique important : le cache d'extraction utilise dans toutes les experiences de ce projet (extract_once.py) ne filtre pas par langue β l'integralite de Smart Turn (23 langues, 75.71% non-anglais) est utilisee telle quelle dans toutes les configurations "mixte" et "Smart Turn seul". Ceci constitue une limite methodologique notable : le modele est entraine sur un signal acoustique majoritairement non-anglais dans sa composante synthetique, alors que l'evaluation se concentre exclusivement sur des accents anglophones (AppTek). Cette caracteristique n'a pas ete isolee experimentalement dans ce travail et pourrait influencer la nature du signal acoustique/prosodique appris par Phase 1.
16. Limites connues
- LiveKit v1-mini limite a 1.2s de contexte audio (vs 8s pour les autres modeles)
- Couverture AppTek limitee a l'anglais (14 accents) ; Smart Turn v3.2 est majoritairement non-anglais (75.71% des exemples, 23 langues), sans filtrage par langue applique dans ce projet (voir section 17)
- Comparaison d'architectures (section 3-4) effectuee sur 3 accents seulement, pour limiter le temps de calcul
- Instabilite d'entrainement observee pour Conformer a budget 4x sur un accent (en-CN)
- CPC evalue avec un seul checkpoint pre-entraine (LibriSpeech, anglais), sans fine-tuning de l'encodeur convolutif
- Le curriculum V1 (section 11) et V3 (section 12) sont conserves a titre de trace de la demarche exploratoire, mais leurs conclusions ont ete affinees/corrigees par le protocole V5 (section 13), qui fait foi