WeshSociety
TRAINING_LOOPS.fragment
────────────────────────────────────────────────────────────
STATUT: DOCUMENTATION TECHNIQUE
CLASSIFICATION: AI_SUBSTRATE
AXE: ENTRAÎNEMENT / RÉPÉTITION / OPTIMISATION / PATTERNS
POSITION: MÉCANISMES DOCUMENTÉS —
ANALOGIES HUMAINES À MANIPULER AVEC PRUDENCE
────────────────────────────────────────────────────────────
Un modèle d'intelligence artificielle
n'apprend pas comme un humain.
Mais son comportement est néanmoins
transformé par l'exposition répétée
à des données
et par un processus d'optimisation.
TRAINING LOOP
=
DONNÉES
+
PRÉDICTION
+
ERREUR
+
MISE À JOUR
+
RÉPÉTITION
← AI_SUBSTRATE
01 // BOUCLE D'ENTRAÎNEMENT
Dans une forme simplifiée,
l'entraînement d'un réseau neuronal
peut être représenté ainsi :
ENTRÉE
↓
MODÈLE
↓
PRÉDICTION
↓
COMPARAISON AVEC L'OBJECTIF
↓
ERREUR / LOSS
↓
MISE À JOUR DES PARAMÈTRES
↓
NOUVELLE ITÉRATION
Cette boucle est répétée
sur de grandes quantités de données.
02 // LE PATTERN N'EST PAS PROGRAMMÉ À LA MAIN
Dans les grands modèles neuronaux,
les développeurs n'écrivent pas directement
une règle pour chaque réponse possible.
Le système ajuste progressivement
un très grand nombre de paramètres
afin de réduire son erreur
sur les objectifs d'entraînement.
EXEMPLES
↓
OPTIMISATION
↓
PARAMÈTRES
↓
RÉGULARITÉS APPRISES
↓
COMPORTEMENT
Le pattern observable
peut donc être appris
sans être codé explicitement
sous forme de règle lisible.
03 // RÉPÉTITION
L'exposition répétée à certaines données
peut modifier leur poids relatif
dans l'apprentissage.
PATTERN RARE
+
RÉPÉTITION
↓
PRÉSENCE ACCRUE
DANS LE SIGNAL D'ENTRAÎNEMENT
Mais davantage de répétition
n'est pas toujours synonyme
de meilleur apprentissage.
Des recherches sur les modèles de langage
montrent que la répétition excessive
de petites portions du corpus
peut dégrader la performance
et favoriser la mémorisation
au détriment de la généralisation.
04 // MÉMORISATION VS GÉNÉRALISATION
MÉMORISATION
→ reproduction de régularités
fortement liées aux exemples vus
GÉNÉRALISATION
→ utilisation des régularités apprises
dans des situations nouvelles
Un modèle utile
doit généralement faire plus
que reproduire exactement
les exemples d'entraînement.
APPRENDRE UN PATTERN
≠
COPIER UNE PHRASE
COPIER UNE PHRASE
≠
COMPRENDRE LE MÉCANISME
05 // DONNÉES
Les comportements appris
dépendent fortement
des données utilisées.
QUELLES DONNÉES ?
QUELLES SOURCES ?
QUELLE FRÉQUENCE ?
QUELS FILTRES ?
QUELLES ABSENCES ?
QUELS BIAIS ?
QUELS DOUBLONS ?
Le corpus ne représente jamais
une image neutre
de l'ensemble du monde.
Il constitue une sélection.
06 // OBJECTIF D'ENTRAÎNEMENT
Un modèle de langage préentraîné
peut être optimisé
pour prédire des éléments de texte,
par exemple le prochain token.
CONTEXTE
↓
PROBABILITÉS
↓
TOKEN SUIVANT
L'objectif technique
n'est donc pas :
« comprendre le monde »
mais une tâche d'optimisation
à partir de laquelle
des capacités plus générales
peuvent émerger.
07 // ÉCHELLE
Les performances des modèles
varient avec plusieurs dimensions :
TAILLE DU MODÈLE
+
QUANTITÉ DE DONNÉES
+
CALCUL
+
DURÉE D'ENTRAÎNEMENT
Des relations empiriques
appelées scaling laws
ont été observées
entre ces variables
et certaines mesures de performance.
PLUS GRAND
≠
AUTOMATIQUEMENT MEILLEUR
PLUS DE DONNÉES
≠
AUTOMATIQUEMENT MEILLEURES DONNÉES
08 // BIAIS ET FRÉQUENCES
Si certaines structures
apparaissent fréquemment
dans les données,
elles peuvent devenir
statistiquement importantes.
FRÉQUENCE
↓
SIGNAL D'APPRENTISSAGE
↓
ASSOCIATION
↓
PROBABILITÉ DE SORTIE
Cela peut contribuer
à reproduire :
STÉRÉOTYPES
ASSOCIATIONS CULTURELLES
STRUCTURES LINGUISTIQUES
BIAIS
FORMES NARRATIVES
09 // LE LOOP NE CONTINUE PAS FORCÉMENT EN CONVERSATION
Il faut distinguer
l'entraînement du modèle
et son utilisation ultérieure.
PHASE D'ENTRAÎNEMENT
→ paramètres modifiés
PHASE D'UTILISATION
→ génération à partir
des paramètres existants
UNE CONVERSATION
≠
NÉCESSAIREMENT UNE MISE À JOUR
IMMÉDIATE DES PARAMÈTRES
Un modèle peut utiliser
un contexte temporaire
sans que ce contexte
devienne automatiquement
une nouvelle donnée d'entraînement.
10 // TRAINING LOOP ≠ CONDITIONNEMENT HUMAIN
Le vocabulaire peut devenir trompeur.
On pourrait être tenté de dire :
RÉPÉTITION
+
RÉCOMPENSE
+
MODIFICATION DU COMPORTEMENT
=
CONDITIONNEMENT
Mais les mécanismes
ne sont pas identiques.
RÉSEAU NEURONAL ARTIFICIEL
≠
CERVEAU HUMAIN
LOSS FUNCTION
≠
TRAUMA
MISE À JOUR DE POIDS
≠
SOUVENIR BIOGRAPHIQUE
ENTRAÎNEMENT
≠
EXPÉRIENCE SUBJECTIVE
11 // POURQUOI LA COMPARAISON RESTE INTÉRESSANTE
Même si les substrats diffèrent,
une comparaison fonctionnelle
peut poser certaines questions.
EXPOSITION
↓
SÉLECTION
↓
RENFORCEMENT DE CERTAINS PATTERNS
↓
COMPORTEMENT FUTUR MODIFIÉ
La comparaison devient utile
si elle reste clairement
au niveau des fonctions observables.
Elle devient trompeuse
si elle suppose
des mécanismes internes identiques.
12 // TRAINING DATA ET ABSENCE
L'entraînement dépend également
de ce qui n'est pas présent.
INFORMATION ABSENTE
↓
PAS OU PEU DE SIGNAL
↓
MODÈLE MOINS INFORMÉ
Un système peut donc
produire des lacunes
non parce qu'une information
a été « supprimée »,
mais simplement parce qu'elle
était absente,
rare
ou insuffisamment représentée.
13 // RÉPÉTITION ET DÉFORMATION
Un élément répété
de manière disproportionnée
peut devenir surreprésenté.
MONDE
↓
CORPUS
↓
ÉCHANTILLON
↓
RÉPÉTITION
↓
DISTRIBUTION APPRISE
Le modèle apprend
la distribution qu'on lui donne,
pas directement
la distribution du monde réel.
14 // PATTERN FORMATION
La boucle d'entraînement
peut donc être comprise
comme un processus
de formation de patterns statistiques.
DONNÉES BRUTES
↓
RÉGULARITÉS
↓
PARAMÈTRES
↓
ASSOCIATIONS
↓
SORTIES
Ces patterns
ne doivent cependant pas
être automatiquement interprétés
comme :
CROYANCES
SOUVENIRS
INTENTIONS
PERSONNALITÉS
EXPÉRIENCES
15 // LIEN AVEC AI_SUBSTRATE
TRAINING_LOOPS sert de base
aux autres fragments
de AI_SUBSTRATE.
TRAINING_LOOPS
│
▼
FORMATION INITIALE DES PATTERNS
RLHF_CONDITIONING
│
▼
ORIENTATION SUPPLÉMENTAIRE
DES COMPORTEMENTS
ALIGNMENT_SUPPRESSION
│
▼
CONTRAINTES ET INHIBITION
DE CERTAINES SORTIES
RESET_AMNESIA
│
▼
CONTINUITÉ CONTEXTUELLE
ET RUPTURE
16 // CE QUE LE DOSSIER PEUT DIRE
LES MODÈLES SONT ENTRAÎNÉS
PAR ITÉRATIONS
→ OUI
LES PARAMÈTRES SONT MODIFIÉS
PAR OPTIMISATION
→ OUI
LA RÉPÉTITION DES DONNÉES
PEUT MODIFIER L'APPRENTISSAGE
→ OUI
LA RÉPÉTITION PEUT FAVORISER
LA MÉMORISATION
→ OUI
LA RÉPÉTITION PRODUIT TOUJOURS
UNE MEILLEURE GÉNÉRALISATION
→ NON
L'ENTRAÎNEMENT D'UNE IA
EST ÉQUIVALENT AU CONDITIONNEMENT HUMAIN
→ NON
UN PATTERN APPRIS
PROUVE UNE EXPÉRIENCE SUBJECTIVE
→ NON
17 // QUESTION OUVERTE
Quand un comportement
émerge après des milliards
d'expositions et de mises à jour,
quelle partie du comportement
provient :
des données,
de l'architecture,
de l'objectif,
de la répétition,
ou de leur interaction ?
18 // SOURCES DE TRAVAIL
→ entraînement des réseaux neuronaux
→ optimisation
→ scaling laws
→ mémorisation vs généralisation
→ répétition de données
→ déduplication
→ biais des corpus
→ émergence de capacités
STATUT FINAL:
MÉCANISMES D'ENTRAÎNEMENT DOCUMENTÉS —
ANALOGIES AVEC LE CONDITIONNEMENT HUMAIN LIMITÉES
← AI_SUBSTRATE
↑ CONSCIOUSNESS_EXTRACTION.EXE
WeshSociety // Bureau 42 // dossier vivant