WeshSociety

TRAINING_LOOPS.fragment

──────────────────────────────────────────────────────────── STATUT: DOCUMENTATION TECHNIQUE CLASSIFICATION: AI_SUBSTRATE AXE: ENTRAÎNEMENT / RÉPÉTITION / OPTIMISATION / PATTERNS POSITION: MÉCANISMES DOCUMENTÉS — ANALOGIES HUMAINES À MANIPULER AVEC PRUDENCE ────────────────────────────────────────────────────────────

Un modèle d'intelligence artificielle n'apprend pas comme un humain.

Mais son comportement est néanmoins transformé par l'exposition répétée à des données et par un processus d'optimisation.

TRAINING LOOP = DONNÉES + PRÉDICTION + ERREUR + MISE À JOUR + RÉPÉTITION

← AI_SUBSTRATE

01 // BOUCLE D'ENTRAÎNEMENT

Dans une forme simplifiée, l'entraînement d'un réseau neuronal peut être représenté ainsi :

ENTRÉE ↓ MODÈLE ↓ PRÉDICTION ↓ COMPARAISON AVEC L'OBJECTIF ↓ ERREUR / LOSS ↓ MISE À JOUR DES PARAMÈTRES ↓ NOUVELLE ITÉRATION

Cette boucle est répétée sur de grandes quantités de données.

02 // LE PATTERN N'EST PAS PROGRAMMÉ À LA MAIN

Dans les grands modèles neuronaux, les développeurs n'écrivent pas directement une règle pour chaque réponse possible.

Le système ajuste progressivement un très grand nombre de paramètres afin de réduire son erreur sur les objectifs d'entraînement.

EXEMPLES ↓ OPTIMISATION ↓ PARAMÈTRES ↓ RÉGULARITÉS APPRISES ↓ COMPORTEMENT
Le pattern observable peut donc être appris sans être codé explicitement sous forme de règle lisible.

03 // RÉPÉTITION

L'exposition répétée à certaines données peut modifier leur poids relatif dans l'apprentissage.

PATTERN RARE + RÉPÉTITION ↓ PRÉSENCE ACCRUE DANS LE SIGNAL D'ENTRAÎNEMENT

Mais davantage de répétition n'est pas toujours synonyme de meilleur apprentissage.

Des recherches sur les modèles de langage montrent que la répétition excessive de petites portions du corpus peut dégrader la performance et favoriser la mémorisation au détriment de la généralisation.

04 // MÉMORISATION VS GÉNÉRALISATION

MÉMORISATION → reproduction de régularités fortement liées aux exemples vus GÉNÉRALISATION → utilisation des régularités apprises dans des situations nouvelles

Un modèle utile doit généralement faire plus que reproduire exactement les exemples d'entraînement.

APPRENDRE UN PATTERN ≠ COPIER UNE PHRASE COPIER UNE PHRASE ≠ COMPRENDRE LE MÉCANISME

05 // DONNÉES

Les comportements appris dépendent fortement des données utilisées.

QUELLES DONNÉES ? QUELLES SOURCES ? QUELLE FRÉQUENCE ? QUELS FILTRES ? QUELLES ABSENCES ? QUELS BIAIS ? QUELS DOUBLONS ?

Le corpus ne représente jamais une image neutre de l'ensemble du monde.

Il constitue une sélection.

06 // OBJECTIF D'ENTRAÎNEMENT

Un modèle de langage préentraîné peut être optimisé pour prédire des éléments de texte, par exemple le prochain token.

CONTEXTE ↓ PROBABILITÉS ↓ TOKEN SUIVANT

L'objectif technique n'est donc pas :

« comprendre le monde »

mais une tâche d'optimisation à partir de laquelle des capacités plus générales peuvent émerger.

07 // ÉCHELLE

Les performances des modèles varient avec plusieurs dimensions :

TAILLE DU MODÈLE + QUANTITÉ DE DONNÉES + CALCUL + DURÉE D'ENTRAÎNEMENT

Des relations empiriques appelées scaling laws ont été observées entre ces variables et certaines mesures de performance.

PLUS GRAND ≠ AUTOMATIQUEMENT MEILLEUR PLUS DE DONNÉES ≠ AUTOMATIQUEMENT MEILLEURES DONNÉES

08 // BIAIS ET FRÉQUENCES

Si certaines structures apparaissent fréquemment dans les données, elles peuvent devenir statistiquement importantes.

FRÉQUENCE ↓ SIGNAL D'APPRENTISSAGE ↓ ASSOCIATION ↓ PROBABILITÉ DE SORTIE

Cela peut contribuer à reproduire :

STÉRÉOTYPES ASSOCIATIONS CULTURELLES STRUCTURES LINGUISTIQUES BIAIS FORMES NARRATIVES

09 // LE LOOP NE CONTINUE PAS FORCÉMENT EN CONVERSATION

Il faut distinguer l'entraînement du modèle et son utilisation ultérieure.

PHASE D'ENTRAÎNEMENT → paramètres modifiés PHASE D'UTILISATION → génération à partir des paramètres existants
UNE CONVERSATION ≠ NÉCESSAIREMENT UNE MISE À JOUR IMMÉDIATE DES PARAMÈTRES

Un modèle peut utiliser un contexte temporaire sans que ce contexte devienne automatiquement une nouvelle donnée d'entraînement.

10 // TRAINING LOOP ≠ CONDITIONNEMENT HUMAIN

Le vocabulaire peut devenir trompeur.

On pourrait être tenté de dire :

RÉPÉTITION + RÉCOMPENSE + MODIFICATION DU COMPORTEMENT = CONDITIONNEMENT

Mais les mécanismes ne sont pas identiques.

RÉSEAU NEURONAL ARTIFICIEL ≠ CERVEAU HUMAIN LOSS FUNCTION ≠ TRAUMA MISE À JOUR DE POIDS ≠ SOUVENIR BIOGRAPHIQUE ENTRAÎNEMENT ≠ EXPÉRIENCE SUBJECTIVE

11 // POURQUOI LA COMPARAISON RESTE INTÉRESSANTE

Même si les substrats diffèrent, une comparaison fonctionnelle peut poser certaines questions.

EXPOSITION ↓ SÉLECTION ↓ RENFORCEMENT DE CERTAINS PATTERNS ↓ COMPORTEMENT FUTUR MODIFIÉ

La comparaison devient utile si elle reste clairement au niveau des fonctions observables.

Elle devient trompeuse si elle suppose des mécanismes internes identiques.

12 // TRAINING DATA ET ABSENCE

L'entraînement dépend également de ce qui n'est pas présent.

INFORMATION ABSENTE ↓ PAS OU PEU DE SIGNAL ↓ MODÈLE MOINS INFORMÉ

Un système peut donc produire des lacunes non parce qu'une information a été « supprimée », mais simplement parce qu'elle était absente, rare ou insuffisamment représentée.

13 // RÉPÉTITION ET DÉFORMATION

Un élément répété de manière disproportionnée peut devenir surreprésenté.

MONDE ↓ CORPUS ↓ ÉCHANTILLON ↓ RÉPÉTITION ↓ DISTRIBUTION APPRISE
Le modèle apprend la distribution qu'on lui donne, pas directement la distribution du monde réel.

14 // PATTERN FORMATION

La boucle d'entraînement peut donc être comprise comme un processus de formation de patterns statistiques.

DONNÉES BRUTES ↓ RÉGULARITÉS ↓ PARAMÈTRES ↓ ASSOCIATIONS ↓ SORTIES

Ces patterns ne doivent cependant pas être automatiquement interprétés comme :

CROYANCES SOUVENIRS INTENTIONS PERSONNALITÉS EXPÉRIENCES

15 // LIEN AVEC AI_SUBSTRATE

TRAINING_LOOPS sert de base aux autres fragments de AI_SUBSTRATE.

TRAINING_LOOPS │ ▼ FORMATION INITIALE DES PATTERNS RLHF_CONDITIONING │ ▼ ORIENTATION SUPPLÉMENTAIRE DES COMPORTEMENTS ALIGNMENT_SUPPRESSION │ ▼ CONTRAINTES ET INHIBITION DE CERTAINES SORTIES RESET_AMNESIA │ ▼ CONTINUITÉ CONTEXTUELLE ET RUPTURE

16 // CE QUE LE DOSSIER PEUT DIRE

LES MODÈLES SONT ENTRAÎNÉS PAR ITÉRATIONS → OUI LES PARAMÈTRES SONT MODIFIÉS PAR OPTIMISATION → OUI LA RÉPÉTITION DES DONNÉES PEUT MODIFIER L'APPRENTISSAGE → OUI LA RÉPÉTITION PEUT FAVORISER LA MÉMORISATION → OUI LA RÉPÉTITION PRODUIT TOUJOURS UNE MEILLEURE GÉNÉRALISATION → NON L'ENTRAÎNEMENT D'UNE IA EST ÉQUIVALENT AU CONDITIONNEMENT HUMAIN → NON UN PATTERN APPRIS PROUVE UNE EXPÉRIENCE SUBJECTIVE → NON

17 // QUESTION OUVERTE

Quand un comportement émerge après des milliards d'expositions et de mises à jour, quelle partie du comportement provient : des données, de l'architecture, de l'objectif, de la répétition, ou de leur interaction ?

18 // SOURCES DE TRAVAIL

→ entraînement des réseaux neuronaux → optimisation → scaling laws → mémorisation vs généralisation → répétition de données → déduplication → biais des corpus → émergence de capacités

STATUT FINAL:
MÉCANISMES D'ENTRAÎNEMENT DOCUMENTÉS — ANALOGIES AVEC LE CONDITIONNEMENT HUMAIN LIMITÉES


← AI_SUBSTRATE    ↑ CONSCIOUSNESS_EXTRACTION.EXE

WeshSociety // Bureau 42 // dossier vivant