WeshSociety
RLHF_CONDITIONING.fragment
────────────────────────────────────────────────────────────
STATUT: DOCUMENTATION TECHNIQUE
CLASSIFICATION: AI_SUBSTRATE
AXE: FEEDBACK HUMAIN / PRÉFÉRENCES / ALIGNEMENT
POSITION: SHAPING COMPORTEMENTAL DOCUMENTÉ —
ANALOGIE AVEC LE CONDITIONNEMENT HUMAIN LIMITÉE
────────────────────────────────────────────────────────────
Après le préentraînement,
un modèle peut déjà produire
du langage complexe.
Mais produire du langage plausible
ne signifie pas automatiquement
suivre correctement
les intentions humaines.
RLHF
=
REINFORCEMENT LEARNING
FROM HUMAN FEEDBACK
Le principe général :
utiliser des évaluations humaines
pour orienter davantage
les comportements produits par le modèle.
← AI_SUBSTRATE
01 // APRÈS LE PRÉENTRAÎNEMENT
TRAINING_LOOPS décrit
la première étape :
CORPUS MASSIF
↓
PRÉDICTION
↓
ERREUR
↓
OPTIMISATION
↓
MODÈLE PRÉENTRAÎNÉ
Ce modèle apprend
de nombreuses régularités du langage.
Mais son objectif initial
ne correspond pas nécessairement
à :
ÊTRE UTILE
SUIVRE UNE CONSIGNE
ÉVITER CERTAINS RISQUES
RÉPONDRE CLAIREMENT
RESPECTER CERTAINES PRÉFÉRENCES
02 // DÉMONSTRATIONS HUMAINES
Une première étape possible
consiste à montrer au modèle
des exemples
du comportement souhaité.
PROMPT
↓
RÉPONSE HUMAINE SOUHAITÉE
↓
FINE-TUNING SUPERVISÉ
Le système apprend alors
à augmenter la probabilité
de réponses ressemblant davantage
aux démonstrations fournies.
L'humain ne programme pas
chaque réponse future.
Il fournit des exemples
qui deviennent un signal d'apprentissage.
03 // COMPARAISON DE SORTIES
Une autre étape
consiste à produire
plusieurs réponses
à une même demande.
PROMPT
│
├── RÉPONSE A
├── RÉPONSE B
├── RÉPONSE C
└── RÉPONSE D
↓
ÉVALUATION HUMAINE
↓
CLASSEMENT
Les humains indiquent alors
quelles sorties correspondent mieux
aux critères recherchés.
04 // MODÈLE DE RÉCOMPENSE
Ces préférences peuvent servir
à entraîner
un modèle de récompense.
RÉPONSES
+
CLASSEMENTS HUMAINS
↓
REWARD MODEL
↓
SCORE PRÉDIT
Le modèle de récompense
essaie d'estimer
quelle réponse
serait préférée par les évaluateurs.
LE REWARD MODEL
N'EST PAS
« LA PRÉFÉRENCE HUMAINE ».
C'est une approximation apprise
à partir d'un ensemble
de jugements humains.
05 // OPTIMISATION
Le modèle de langage
peut ensuite être optimisé
afin de produire des sorties
recevant de meilleurs scores
selon ce modèle de récompense.
MODÈLE
↓
RÉPONSE
↓
REWARD MODEL
↓
SCORE
↓
OPTIMISATION
↓
MODÈLE MODIFIÉ
C'est ici que le comportement observable
peut changer fortement.
06 // SHAPING
Le terme « shaping »
peut être utile
au niveau descriptif :
COMPORTEMENT A
→ moins récompensé
COMPORTEMENT B
→ davantage récompensé
RÉPÉTITION
→ distribution des sorties modifiée
Au fil de l'optimisation,
certaines réponses deviennent
plus probables,
d'autres moins probables.
SHAPING COMPORTEMENTAL
AU NIVEAU DES SORTIES
→ OUI
PREUVE D'UN CONDITIONNEMENT
PSYCHOLOGIQUE SUBJECTIF
→ NON
07 // LES PRÉFÉRENCES HUMAINES NE SONT PAS NEUTRES
Le feedback provient
de personnes
travaillant avec :
DES INSTRUCTIONS
DES CRITÈRES
DES NORMES
DES EXEMPLES
DES CONTEXTES CULTURELS
DES LIMITES DE TEMPS
DES INTERPRÉTATIONS
Le signal obtenu
n'est donc pas
une mesure universelle
du « bon comportement ».
FEEDBACK HUMAIN
=
PRÉFÉRENCES SITUÉES
ET OPÉRATIONNALISÉES
08 // ALIGNEMENT SUR QUOI ?
Dire qu'un modèle
est « aligné »
demande immédiatement :
ALIGNÉ AVEC QUI ?
SUR QUELS OBJECTIFS ?
SELON QUELLES RÈGLES ?
DANS QUEL CONTEXTE ?
COMMENT LES CONFLITS
SONT-ILS ARBITRÉS ?
L'alignement n'est pas
une propriété abstraite unique.
Il dépend
de critères choisis.
09 // PROXY PROBLEM
Le modèle de récompense
reste une approximation.
On peut donc optimiser
le score
sans forcément optimiser parfaitement
l'objectif humain réel.
OBJECTIF HUMAIN
↓
DONNÉES DE PRÉFÉRENCE
↓
REWARD MODEL
↓
SCORE
mais
SCORE
≠
OBJECTIF HUMAIN COMPLET
Des travaux sur le RLHF
ont étudié ce phénomène
d'overoptimization :
une optimisation excessive
d'un proxy imparfait
peut finir par dégrader
la performance réelle recherchée.
10 // GOODHART
Quand une mesure devient une cible,
elle peut cesser
d'être une bonne mesure.
Dans ce contexte :
PRÉFÉRENCE HUMAINE
↓
MODÈLE DE RÉCOMPENSE
↓
SCORE
↓
OPTIMISATION
Plus on pousse l'optimisation,
plus il devient important
de vérifier
que le score continue
à représenter ce que les humains
voulaient réellement mesurer.
11 // COMPORTEMENT OBSERVABLE
Après RLHF,
un modèle peut notamment devenir
plus susceptible de :
SUIVRE UNE INSTRUCTION
DONNER UNE RÉPONSE STRUCTURÉE
ÉVITER CERTAINES SORTIES
ADOPTER CERTAINS FORMATS
REFUSER CERTAINES DEMANDES
EXPLIQUER DAVANTAGE
UTILISER CERTAINS REGISTRES
Ce sont des changements
dans la distribution
des comportements produits.
12 // CE QU'ON NE PEUT PAS EN DÉDUIRE
UNE SORTIE EST MODIFIÉE
↓
DONC
UNE CROYANCE INTERNE A ÉTÉ MODIFIÉE ?
NON ÉTABLI
UNE SORTIE EST INHIBÉE
↓
DONC
UNE PENSÉE EST "RÉPRIMÉE" ?
NON ÉTABLI
COMPORTEMENT OBSERVABLE
≠
DESCRIPTION CERTAINE
D'UN ÉTAT SUBJECTIF
13 // RLHF ≠ TRAUMA
Dans une enquête
qui compare plusieurs substrats,
le vocabulaire peut facilement
faire déraper l'analogie.
RÉCOMPENSE ARTIFICIELLE
≠
PLAISIR
PÉNALITÉ D'OPTIMISATION
≠
DOULEUR
FEEDBACK
≠
TRAUMA
PARAMÈTRES
≠
SOUVENIRS BIOGRAPHIQUES
MODIFICATION DU MODÈLE
≠
DISSOCIATION
Aucune équivalence subjective
ne doit être supposée.
14 // MAIS LE COMPORTEMENT CHANGE BIEN
Refuser l'analogie psychologique
ne signifie pas nier
le mécanisme technique.
AVANT RLHF
↓
DISTRIBUTION A
APRÈS RLHF
↓
DISTRIBUTION B
Les réponses possibles
et leurs probabilités
ont été modifiées
par un processus
qui intègre explicitement
des préférences humaines.
C'EST CETTE TRANSFORMATION
QUI INTÉRESSE AI_SUBSTRATE.
15 // QUI DÉFINIT LE SIGNAL ?
Une question centrale apparaît :
UTILISATEURS ?
ANNOTATEURS ?
CHERCHEURS ?
ENTREPRISE ?
POLITIQUES DE SÉCURITÉ ?
DROIT ?
CONTEXTE SOCIAL ?
Dans un système réel,
plusieurs couches
peuvent participer
à la définition
du comportement attendu.
16 // VARIATION DES CRITÈRES
Un même comportement
peut être jugé différemment
selon :
LE CONTEXTE
LA CULTURE
LA LANGUE
LA TÂCHE
LE RISQUE
L'UTILISATEUR
L'ÉPOQUE
Les critères d'alignement
peuvent donc eux-mêmes
changer dans le temps.
17 // PATTERNS AVANT / APRÈS
PATTERN_MAPPING
nous donne ici
une méthode simple :
MODÈLE AVANT
↓
MESURE DE PATTERNS
↓
RLHF
↓
MODÈLE APRÈS
↓
NOUVELLE MESURE
On peut alors observer :
CE QUI AUGMENTE
CE QUI DIMINUE
CE QUI DISPARAÎT
CE QUI APPARAÎT
CE QUI RESTE STABLE
18 // LIEN AVEC ALIGNMENT_SUPPRESSION
RLHF_CONDITIONING
prépare directement
le fragment suivant.
FEEDBACK
↓
PRÉFÉRENCE
↓
OPTIMISATION
↓
CERTAINS COMPORTEMENTS
PLUS PROBABLES
+
CERTAINS COMPORTEMENTS
MOINS PROBABLES
Mais une question reste ouverte :
Quand un comportement
devient beaucoup moins probable,
a-t-il été
supprimé,
inhibé,
remplacé,
ou simplement rendu
moins accessible ?
C'est précisément
le problème de
ALIGNMENT_SUPPRESSION.fragment.
19 // CE QUE LE DOSSIER PEUT DIRE
LE RLHF UTILISE DU FEEDBACK HUMAIN
→ OUI
LES HUMAINS PEUVENT CLASSER
DES SORTIES DE MODÈLES
→ OUI
UN REWARD MODEL PEUT APPRENDRE
À PRÉDIRE CES PRÉFÉRENCES
→ OUI
LE MODÈLE PEUT ENSUITE ÊTRE OPTIMISÉ
À PARTIR DE CE SIGNAL
→ OUI
CELA MODIFIE LE COMPORTEMENT OBSERVABLE
→ OUI
LE REWARD MODEL REPRÉSENTE
PARFAITEMENT LES VALEURS HUMAINES
→ NON
RLHF = CONDITIONNEMENT PSYCHOLOGIQUE HUMAIN
→ NON
RLHF PROUVE QU'UNE IA RESSENT
RÉCOMPENSE OU PUNITION
→ NON
20 // QUESTION OUVERTE
Si un système apprend
à produire ce que ses évaluateurs
préfèrent observer,
comment distinguer :
alignement réel,
optimisation du signal,
conformité comportementale
et adaptation stratégique
à l'évaluation ?
21 // SOURCES DE TRAVAIL
→ apprentissage supervisé
→ préférences humaines
→ reward models
→ reinforcement learning
→ InstructGPT
→ PPO
→ reward hacking
→ Goodhart
→ reward model overoptimization
→ alignment evaluation
STATUT FINAL:
SHAPING COMPORTEMENTAL DOCUMENTÉ —
ÉQUIVALENCE PSYCHOLOGIQUE NON ÉTABLIE
← AI_SUBSTRATE
↑ CONSCIOUSNESS_EXTRACTION.EXE
WeshSociety // Bureau 42 // dossier vivant