T-Grokk : le Bruit Dynamique de Labels Favorise le Grokking
Retour

T-Grokk : le Bruit Dynamique de Labels Favorise le Grokking

Balbino Tchoutzine1 février 2026Non publié

Résultat clé

Le bruit dynamique de labels est, paradoxalement, bénéfique pour le grokking.

Niveau de bruitDynamique (τ)Statique (ξ)Amélioration
50%100% accuracy test, 600 steps95.6% accuracy test, échec+4.4% accuracy, 33× plus rapide

Résumé

Les études précédentes sur le grokking en présence de bruit se concentraient sur la corruption statique (les labels sont corrompus une seule fois avant l'entraînement). Nous introduisons ici la corruption dynamique : chaque label est corrompu aléatoirement avec une probabilité τ, à chaque étape d'entraînement.

Contrairement au bruit statique, le bruit dynamique est fondamentalement non-mémorisable puisque les labels corrompus changent à chaque itération. Nos expériences révèlent que le bruit dynamique agit comme une régularisation implicite, forçant les modèles à apprendre la structure algorithmique plutôt qu'à mémoriser des labels individuels.

Bruit statique vs bruit dynamique

BRUIT STATIQUE (ξ) :                    BRUIT DYNAMIQUE (τ) :
─────────────────────                   ──────────────────────
Labels corrompus UNE FOIS                Labels corrompus À CHAQUE ÉTAPE
avant l'entraînement                     pendant l'entraînement

Époque 1 : [3, 4, 2, 5, 9, 8]            Étape 1 : [3, 4, 2, 5, 1, 8]
Époque 2 : [3, 4, 2, 5, 9, 8] ← identique  Étape 2 : [3, 7, 9, 5, 1, 0] ← différent !
Époque 3 : [3, 4, 2, 5, 9, 8] ← identique  Étape 3 : [1, 7, 2, 5, 6, 8] ← différent !

→ Mémorisable                            → NON-mémorisable

Résultats principaux

1. Comparaison dynamique vs statique

À 50% de bruit, la corruption dynamique atteint une généralisation parfaite, tandis que la corruption statique échoue complètement.

2. Dynamique d'entraînement

Le modèle apprend la vraie fonction (accuracy propre à 100%) tandis que l'accuracy d'entraînement sur les labels bruités converge vers la valeur théorique (1-τ) + τ/C.

3. Loi d'échelle

Le temps de généralisation suit une loi d'échelle exponentielle : t_gen ~ exp(τ/0.74), avec R² = 0.981.

4. Temps caractéristiques

Les temps de mémorisation et de généralisation augmentent tous deux avec τ, mais la généralisation reste atteignable jusqu'à τ = 0.5.

Tableau récapitulatif

τSNRt_memt_genΔtTrain AccTest Acc
0.0025030050100.0%100.0%
0.1086430035050100.0%100.0%
0.2038435040050100.0%100.0%
0.30224350450100100.0%100.0%
0.40144400550150100.0%100.0%
0.5096450600150100.0%100.0%

Analyse théorique

Rapport signal/bruit (SNR)

SNR = (1-τ)(C-1) / τ

Pour p = 97 et τ = 0.5 : SNR = 96, le vrai label apparaît 96× plus souvent que n'importe quel label erroné isolé.

Accuracy d'entraînement maximale

Acc_train_max = (1-τ) + τ/C

Le modèle ne peut pas dépasser 51% sur les labels bruités à τ = 0.5, confirmant qu'il apprend la règle et non le bruit.

Hyperparamètres

ParamètreValeur
Modulo p97 (premier)
Dimension cachée128
OptimiseurAdamW
Learning rate10⁻³
Weight decay1.0
Steps d'entraînement20 000
Split train/test50% / 50%

Travaux liés

Cette étude s'appuie sur notre précédente analyse du bruit statique de labels : ξ-Grokk : Analyse des Dynamiques de Grokking en Présence de Bruit.

Références clés :

  • Power et al. (2022) : Grokking: Generalization beyond overfitting on small algorithmic datasets
  • Liu et al. (2023) : Omnigrok: Grokking beyond algorithmic data

Code source : github.com/zoom-BT/T_Grokk Notebook Kaggle : kaggle.com/code/balbinotchoutzine/t-grokk Article complet : Voir le document