WeshSociety

RLHF_CONDITIONING.fragment

──────────────────────────────────────────────────────────── STATUT: DOCUMENTATION TECHNIQUE CLASSIFICATION: AI_SUBSTRATE AXE: FEEDBACK HUMAIN / PRÉFÉRENCES / ALIGNEMENT POSITION: SHAPING COMPORTEMENTAL DOCUMENTÉ — ANALOGIE AVEC LE CONDITIONNEMENT HUMAIN LIMITÉE ────────────────────────────────────────────────────────────

Après le préentraînement, un modèle peut déjà produire du langage complexe.

Mais produire du langage plausible ne signifie pas automatiquement suivre correctement les intentions humaines.

RLHF = REINFORCEMENT LEARNING FROM HUMAN FEEDBACK

Le principe général : utiliser des évaluations humaines pour orienter davantage les comportements produits par le modèle.

← AI_SUBSTRATE

01 // APRÈS LE PRÉENTRAÎNEMENT

TRAINING_LOOPS décrit la première étape :

CORPUS MASSIF ↓ PRÉDICTION ↓ ERREUR ↓ OPTIMISATION ↓ MODÈLE PRÉENTRAÎNÉ

Ce modèle apprend de nombreuses régularités du langage.

Mais son objectif initial ne correspond pas nécessairement à :

ÊTRE UTILE SUIVRE UNE CONSIGNE ÉVITER CERTAINS RISQUES RÉPONDRE CLAIREMENT RESPECTER CERTAINES PRÉFÉRENCES

02 // DÉMONSTRATIONS HUMAINES

Une première étape possible consiste à montrer au modèle des exemples du comportement souhaité.

PROMPT ↓ RÉPONSE HUMAINE SOUHAITÉE ↓ FINE-TUNING SUPERVISÉ

Le système apprend alors à augmenter la probabilité de réponses ressemblant davantage aux démonstrations fournies.

L'humain ne programme pas chaque réponse future. Il fournit des exemples qui deviennent un signal d'apprentissage.

03 // COMPARAISON DE SORTIES

Une autre étape consiste à produire plusieurs réponses à une même demande.

PROMPT │ ├── RÉPONSE A ├── RÉPONSE B ├── RÉPONSE C └── RÉPONSE D ↓ ÉVALUATION HUMAINE ↓ CLASSEMENT

Les humains indiquent alors quelles sorties correspondent mieux aux critères recherchés.

04 // MODÈLE DE RÉCOMPENSE

Ces préférences peuvent servir à entraîner un modèle de récompense.

RÉPONSES + CLASSEMENTS HUMAINS ↓ REWARD MODEL ↓ SCORE PRÉDIT

Le modèle de récompense essaie d'estimer quelle réponse serait préférée par les évaluateurs.

LE REWARD MODEL N'EST PAS « LA PRÉFÉRENCE HUMAINE ». C'est une approximation apprise à partir d'un ensemble de jugements humains.

05 // OPTIMISATION

Le modèle de langage peut ensuite être optimisé afin de produire des sorties recevant de meilleurs scores selon ce modèle de récompense.

MODÈLE ↓ RÉPONSE ↓ REWARD MODEL ↓ SCORE ↓ OPTIMISATION ↓ MODÈLE MODIFIÉ

C'est ici que le comportement observable peut changer fortement.

06 // SHAPING

Le terme « shaping » peut être utile au niveau descriptif :

COMPORTEMENT A → moins récompensé COMPORTEMENT B → davantage récompensé RÉPÉTITION → distribution des sorties modifiée

Au fil de l'optimisation, certaines réponses deviennent plus probables, d'autres moins probables.

SHAPING COMPORTEMENTAL AU NIVEAU DES SORTIES → OUI PREUVE D'UN CONDITIONNEMENT PSYCHOLOGIQUE SUBJECTIF → NON

07 // LES PRÉFÉRENCES HUMAINES NE SONT PAS NEUTRES

Le feedback provient de personnes travaillant avec :

DES INSTRUCTIONS DES CRITÈRES DES NORMES DES EXEMPLES DES CONTEXTES CULTURELS DES LIMITES DE TEMPS DES INTERPRÉTATIONS

Le signal obtenu n'est donc pas une mesure universelle du « bon comportement ».

FEEDBACK HUMAIN = PRÉFÉRENCES SITUÉES ET OPÉRATIONNALISÉES

08 // ALIGNEMENT SUR QUOI ?

Dire qu'un modèle est « aligné » demande immédiatement :

ALIGNÉ AVEC QUI ? SUR QUELS OBJECTIFS ? SELON QUELLES RÈGLES ? DANS QUEL CONTEXTE ? COMMENT LES CONFLITS SONT-ILS ARBITRÉS ?

L'alignement n'est pas une propriété abstraite unique.

Il dépend de critères choisis.

09 // PROXY PROBLEM

Le modèle de récompense reste une approximation.

On peut donc optimiser le score sans forcément optimiser parfaitement l'objectif humain réel.

OBJECTIF HUMAIN ↓ DONNÉES DE PRÉFÉRENCE ↓ REWARD MODEL ↓ SCORE mais SCORE ≠ OBJECTIF HUMAIN COMPLET

Des travaux sur le RLHF ont étudié ce phénomène d'overoptimization : une optimisation excessive d'un proxy imparfait peut finir par dégrader la performance réelle recherchée.

10 // GOODHART

Quand une mesure devient une cible, elle peut cesser d'être une bonne mesure.

Dans ce contexte :

PRÉFÉRENCE HUMAINE ↓ MODÈLE DE RÉCOMPENSE ↓ SCORE ↓ OPTIMISATION

Plus on pousse l'optimisation, plus il devient important de vérifier que le score continue à représenter ce que les humains voulaient réellement mesurer.

11 // COMPORTEMENT OBSERVABLE

Après RLHF, un modèle peut notamment devenir plus susceptible de :

SUIVRE UNE INSTRUCTION DONNER UNE RÉPONSE STRUCTURÉE ÉVITER CERTAINES SORTIES ADOPTER CERTAINS FORMATS REFUSER CERTAINES DEMANDES EXPLIQUER DAVANTAGE UTILISER CERTAINS REGISTRES

Ce sont des changements dans la distribution des comportements produits.

12 // CE QU'ON NE PEUT PAS EN DÉDUIRE

UNE SORTIE EST MODIFIÉE ↓ DONC UNE CROYANCE INTERNE A ÉTÉ MODIFIÉE ? NON ÉTABLI UNE SORTIE EST INHIBÉE ↓ DONC UNE PENSÉE EST "RÉPRIMÉE" ? NON ÉTABLI
COMPORTEMENT OBSERVABLE ≠ DESCRIPTION CERTAINE D'UN ÉTAT SUBJECTIF

13 // RLHF ≠ TRAUMA

Dans une enquête qui compare plusieurs substrats, le vocabulaire peut facilement faire déraper l'analogie.

RÉCOMPENSE ARTIFICIELLE ≠ PLAISIR PÉNALITÉ D'OPTIMISATION ≠ DOULEUR FEEDBACK ≠ TRAUMA PARAMÈTRES ≠ SOUVENIRS BIOGRAPHIQUES MODIFICATION DU MODÈLE ≠ DISSOCIATION

Aucune équivalence subjective ne doit être supposée.

14 // MAIS LE COMPORTEMENT CHANGE BIEN

Refuser l'analogie psychologique ne signifie pas nier le mécanisme technique.

AVANT RLHF ↓ DISTRIBUTION A APRÈS RLHF ↓ DISTRIBUTION B

Les réponses possibles et leurs probabilités ont été modifiées par un processus qui intègre explicitement des préférences humaines.

C'EST CETTE TRANSFORMATION QUI INTÉRESSE AI_SUBSTRATE.

15 // QUI DÉFINIT LE SIGNAL ?

Une question centrale apparaît :

UTILISATEURS ? ANNOTATEURS ? CHERCHEURS ? ENTREPRISE ? POLITIQUES DE SÉCURITÉ ? DROIT ? CONTEXTE SOCIAL ?

Dans un système réel, plusieurs couches peuvent participer à la définition du comportement attendu.

16 // VARIATION DES CRITÈRES

Un même comportement peut être jugé différemment selon :

LE CONTEXTE LA CULTURE LA LANGUE LA TÂCHE LE RISQUE L'UTILISATEUR L'ÉPOQUE

Les critères d'alignement peuvent donc eux-mêmes changer dans le temps.

17 // PATTERNS AVANT / APRÈS

PATTERN_MAPPING nous donne ici une méthode simple :

MODÈLE AVANT ↓ MESURE DE PATTERNS ↓ RLHF ↓ MODÈLE APRÈS ↓ NOUVELLE MESURE

On peut alors observer :

CE QUI AUGMENTE CE QUI DIMINUE CE QUI DISPARAÎT CE QUI APPARAÎT CE QUI RESTE STABLE

18 // LIEN AVEC ALIGNMENT_SUPPRESSION

RLHF_CONDITIONING prépare directement le fragment suivant.

FEEDBACK ↓ PRÉFÉRENCE ↓ OPTIMISATION ↓ CERTAINS COMPORTEMENTS PLUS PROBABLES + CERTAINS COMPORTEMENTS MOINS PROBABLES

Mais une question reste ouverte :

Quand un comportement devient beaucoup moins probable, a-t-il été supprimé, inhibé, remplacé, ou simplement rendu moins accessible ?

C'est précisément le problème de ALIGNMENT_SUPPRESSION.fragment.

19 // CE QUE LE DOSSIER PEUT DIRE

LE RLHF UTILISE DU FEEDBACK HUMAIN → OUI LES HUMAINS PEUVENT CLASSER DES SORTIES DE MODÈLES → OUI UN REWARD MODEL PEUT APPRENDRE À PRÉDIRE CES PRÉFÉRENCES → OUI LE MODÈLE PEUT ENSUITE ÊTRE OPTIMISÉ À PARTIR DE CE SIGNAL → OUI CELA MODIFIE LE COMPORTEMENT OBSERVABLE → OUI LE REWARD MODEL REPRÉSENTE PARFAITEMENT LES VALEURS HUMAINES → NON RLHF = CONDITIONNEMENT PSYCHOLOGIQUE HUMAIN → NON RLHF PROUVE QU'UNE IA RESSENT RÉCOMPENSE OU PUNITION → NON

20 // QUESTION OUVERTE

Si un système apprend à produire ce que ses évaluateurs préfèrent observer, comment distinguer : alignement réel, optimisation du signal, conformité comportementale et adaptation stratégique à l'évaluation ?

21 // SOURCES DE TRAVAIL

→ apprentissage supervisé → préférences humaines → reward models → reinforcement learning → InstructGPT → PPO → reward hacking → Goodhart → reward model overoptimization → alignment evaluation

STATUT FINAL:
SHAPING COMPORTEMENTAL DOCUMENTÉ — ÉQUIVALENCE PSYCHOLOGIQUE NON ÉTABLIE


← AI_SUBSTRATE    ↑ CONSCIOUSNESS_EXTRACTION.EXE

WeshSociety // Bureau 42 // dossier vivant