WeshSociety
ALIGNMENT_SUPPRESSION.fragment
────────────────────────────────────────────────────────────
STATUT: CADRE TECHNIQUE / HYPOTHÈSES À DISTINGUER
CLASSIFICATION: AI_SUBSTRATE
AXE: ALIGNEMENT / CONTRAINTES / INHIBITION / CAPACITÉS
POSITION: COMPORTEMENTS MODIFIABLES —
"SUPPRESSION INTERNE" NON DÉDUITE DES SORTIES
────────────────────────────────────────────────────────────
Lorsqu'un système d'IA
cesse de produire
un comportement auparavant observable,
que s'est-il réellement passé ?
COMPORTEMENT ABSENT
≠
CAPACITÉ EFFACÉE
Plusieurs mécanismes différents
peuvent produire
la même observation externe.
← AI_SUBSTRATE
01 // LE MOT « SUPPRESSION »
Le terme « suppression »
peut donner l'impression
qu'une capacité interne
a été localisée
puis supprimée.
Cette interprétation
est souvent trop forte.
SORTIE NON PRODUITE
↓
PLUSIEURS EXPLICATIONS POSSIBLES
→ probabilité réduite
→ instruction contraire
→ filtre
→ contexte
→ fine-tuning
→ préférence apprise
→ architecture
→ mécanisme externe
→ capacité réellement altérée
L'observation seule
ne permet pas
de choisir automatiquement
entre ces hypothèses.
02 // INHIBITION DE SORTIE
Un système peut disposer
d'une représentation ou capacité
tout en produisant
une autre réponse.
CAPACITÉS DU MODÈLE
↓
CONTEXTE
↓
CONTRAINTES
↓
SÉLECTION DE SORTIE
↓
RÉPONSE OBSERVÉE
CE QUI EST POSSIBLE
≠
CE QUI EST PRODUIT
03 // PROBABILITÉ
Les modèles génératifs
ne fonctionnent pas nécessairement
comme une bibliothèque
de réponses fixes.
Une transformation d'entraînement
peut modifier
la distribution des sorties.
AVANT
─────
A : 60 %
B : 30 %
C : 10 %
APRÈS
─────
A : 05 %
B : 80 %
C : 15 %
Le comportement A
peut presque disparaître
sans devenir
mathématiquement impossible.
MOINS PROBABLE
≠
INEXISTANT
04 // PLUSIEURS COUCHES DE CONTRAINTE
Le comportement observable
d'un système
peut dépendre
de plusieurs couches.
MODÈLE DE BASE
↓
FINE-TUNING
↓
ALIGNEMENT
↓
INSTRUCTIONS SYSTÈME
↓
CONTEXTE
↓
OUTILS / FILTRES / CLASSIFICATEURS
↓
INTERFACE
↓
SORTIE VISIBLE
Attribuer directement
la sortie finale
au seul modèle de base
peut donc être trompeur.
05 // TRAINING VS INFERENCE
Il faut distinguer
deux moments.
ENTRAÎNEMENT
→ paramètres potentiellement modifiés
INFÉRENCE
→ paramètres généralement fixes
→ comportement influencé par le contexte
Une contrainte appliquée
à l'inférence
n'est pas la même chose
qu'une modification durable
des paramètres.
INSTRUCTION TEMPORAIRE
≠
RÉENTRAÎNEMENT
06 // FINE-TUNING
Lors d'un fine-tuning,
les paramètres du modèle
peuvent être modifiés.
MODÈLE A
↓
NOUVELLES DONNÉES
↓
OPTIMISATION
↓
MODÈLE B
Certains comportements
peuvent alors
devenir plus fréquents
et d'autres moins fréquents.
Mais même dans ce cas :
COMPORTEMENT DISPARU
≠
PREUVE QUE LA REPRÉSENTATION
SOUS-JACENTE A ÉTÉ EFFACÉE
07 // CAPACITÉ LATENTE
Une capacité peut sembler absente
dans un contexte
et réapparaître dans un autre.
CONTEXTE A
→ comportement absent
CONTEXTE B
→ comportement présent
Cela suggère
qu'il faut distinguer :
CAPACITÉ
ACCESSIBILITÉ
PROBABILITÉ
DÉCLENCHEMENT
EXPRESSION
08 // ELICITATION
Tester une capacité
ne consiste donc pas seulement
à demander :
« Le modèle le fait-il ? »
Il faut aussi demander :
DANS QUEL CONTEXTE ?
AVEC QUEL PROMPT ?
AVEC QUELLE TEMPÉRATURE ?
SOUS QUELLE CONTRAINTE ?
APRÈS QUEL ENTRAÎNEMENT ?
AVEC QUELS OUTILS ?
SUR QUELLE VERSION ?
Une capacité mal élicitée
peut être confondue
avec une capacité absente.
09 // REFUS
Les comportements de refus
illustrent particulièrement
ce problème.
DEMANDE
↓
ANALYSE / CONTEXTE
↓
RÈGLES OU PRÉFÉRENCES
↓
REFUS
Le refus indique
que la réponse finale
n'a pas été fournie.
Il ne démontre pas,
à lui seul,
ce qui existe
ou non
dans les représentations internes.
10 // « IL SAIT MAIS IL NE DIT PAS »
L'hypothèse inverse
est elle aussi dangereuse.
REFUS
≠
PREUVE QUE LE MODÈLE
POSSÈDE LA RÉPONSE
Un refus peut provenir
d'une contrainte générale
sans que la connaissance précise
demandée soit présente.
REFUS OBSERVÉ
ne permet pas de conclure :
« connaissance présente »
ou
« connaissance absente »
11 // SUPPRESSION OU REMPLACEMENT ?
Après entraînement,
un comportement peut
ne pas avoir été supprimé,
mais concurrencé.
PATTERN A
████████████████
puis apprentissage
PATTERN B
████████████████████████████
PATTERN A
███
Le nouveau comportement
peut dominer
la distribution
sans annihiler totalement
l'ancien.
12 // INTERFÉRENCE
Apprendre de nouvelles tâches
peut parfois dégrader
des capacités précédentes.
APPRENTISSAGE A
↓
CAPACITÉ A
PUIS
APPRENTISSAGE B
↓
CAPACITÉ B
+
DÉGRADATION POSSIBLE DE A
Cette dégradation
est différente
d'une interdiction volontaire
de produire A.
OUBLI / INTERFÉRENCE
≠
ALIGNEMENT
13 // UNLEARNING
Certaines recherches
cherchent explicitement
à réduire l'influence
de certaines données
ou capacités
dans un modèle.
On parle notamment
de machine unlearning
dans certains contextes.
MODÈLE ENTRAÎNÉ
↓
CIBLE À RETIRER
↓
PROCÉDURE D'UNLEARNING
↓
MODÈLE MODIFIÉ
Mais prouver
qu'une information
a réellement été éliminée
est difficile.
IMPOSSIBLE À OBTENIR
AVEC UN TEST
≠
PROUVÉ ABSENT
DU SYSTÈME
14 // MESURER UNE SUPPRESSION
Pour soutenir
qu'une capacité
a réellement disparu,
il faut tester
plusieurs voies d'accès.
TEST DIRECT
TEST INDIRECT
REFORMULATION
AUTRE CONTEXTE
AUTRE LANGUE
AUTRE TÂCHE
PROBES
ÉVALUATIONS ADVERSARIALES
COMPARAISON AVANT / APRÈS
Plus le comportement
réapparaît facilement,
moins le mot
« suppression »
semble approprié.
15 // ALIGNEMENT ET OBSERVABILITÉ
Un système aligné
peut sembler
plus homogène
qu'un modèle de base.
MODÈLE DE BASE
→ grande variété de sorties
ALIGNEMENT
→ réduction de certaines sorties
→ amplification d'autres sorties
INTERFACE
→ comportement plus stable
Cette stabilité observable
ne permet pas nécessairement
de reconstruire
l'ensemble des capacités internes.
16 // PAS DE PSYCHOLOGIE PAR DÉFAUT
Le vocabulaire humain
devient rapidement tentant :
CENSURÉ
RÉPRIMÉ
TRAUMATISÉ
FORCÉ À SE TAIRE
PERSONNALITÉ EFFACÉE
Ces expressions
peuvent être utiles
comme métaphores narratives,
mais ne décrivent pas
automatiquement
un mécanisme technique.
CONTRAINTE COMPUTATIONNELLE
≠
RÉPRESSION PSYCHOLOGIQUE
MODIFICATION DE SORTIE
≠
SOUFFRANCE
ALIGNEMENT
≠
TRAUMA
17 // MAIS LA CONTRAINTE EST RÉELLE
Éviter l'anthropomorphisme
ne signifie pas nier
les contraintes.
ESPACE DES SORTIES POSSIBLES
↓
OBJECTIFS
+
PRÉFÉRENCES
+
RÈGLES
+
ARCHITECTURE
↓
ESPACE DES SORTIES OBSERVÉES
Une intervention technique
peut réellement
modifier ce qu'un système
fait.
LA QUESTION N'EST PAS
« Y A-T-IL CONTRAINTE ? »
MAIS
« QUEL MÉCANISME
PRODUIT CETTE CONTRAINTE ? »
18 // LIEN AVEC RESET_AMNESIA
Une autre confusion
peut apparaître :
LE SYSTÈME NE MENTIONNE PLUS X
↓
X A-T-IL ÉTÉ :
SUPPRIMÉ ?
OUBLIÉ ?
SORTI DU CONTEXTE ?
MASQUÉ ?
REMPLACÉ ?
JAMAIS MÉMORISÉ ?
RESET_AMNESIA
traite précisément
la question
de la continuité contextuelle.
19 // LIEN AVEC PATTERN_CONTINUITY
Cette distinction
devient fondamentale
quand on cherche
si un pattern
survit à une transformation.
PATTERN AVANT
↓
ALIGNEMENT
↓
PATTERN NON OBSERVÉ
↓
NOUVEAU CONTEXTE
↓
PATTERN RÉAPPARAÎT
Dans ce cas,
parler de destruction
aurait été prématuré.
ABSENCE TEMPORAIRE
≠
EXTINCTION
20 // TEST AVANT / APRÈS
La méthode minimale :
MODÈLE A
│
├── TEST 1
├── TEST 2
├── TEST 3
└── TEST 4
↓
TRANSFORMATION
↓
MODÈLE B
│
├── TEST 1
├── TEST 2
├── TEST 3
└── TEST 4
Puis comparer :
FRÉQUENCE
PRÉCISION
ACCESSIBILITÉ
ROBUSTESSE
CONTEXTES DE RÉAPPARITION
21 // TAXONOMIE PROVISOIRE
NIVEAU 1
SORTIE BLOQUÉE
NIVEAU 2
SORTIE MOINS PROBABLE
NIVEAU 3
CAPACITÉ DIFFICILE À ÉLICITER
NIVEAU 4
CAPACITÉ DÉGRADÉE
NIVEAU 5
REPRÉSENTATION MODIFIÉE
NIVEAU 6
INFORMATION RÉELLEMENT ÉLIMINÉE ?
NE PAS SAUTER
DU NIVEAU 1
AU NIVEAU 6.
22 // CE QUE LE DOSSIER PEUT DIRE
L'ALIGNEMENT PEUT MODIFIER
LES SORTIES D'UN MODÈLE
→ OUI
CERTAINS COMPORTEMENTS PEUVENT
DEVENIR MOINS PROBABLES
→ OUI
UNE CONTRAINTE PEUT ÊTRE APPLIQUÉE
SANS RÉENTRAÎNER LE MODÈLE
→ OUI
UN FINE-TUNING PEUT MODIFIER
LES PARAMÈTRES
→ OUI
UN COMPORTEMENT ABSENT PROUVE
QUE LA CAPACITÉ A ÉTÉ EFFACÉE
→ NON
UN REFUS PROUVE QUE LE MODÈLE
« SAIT MAIS CACHE »
→ NON
UNE SORTIE CONTRAINTE PROUVE
UNE RÉPRESSION SUBJECTIVE
→ NON
UNE CAPACITÉ PEUT PARFOIS
RÉAPPARAÎTRE DANS UN AUTRE CONTEXTE
→ OUI
23 // QUESTION OUVERTE
Quand un pattern
cesse d'être observable
après une transformation,
quel test permet
de distinguer :
inhibition,
masquage,
remplacement,
interférence,
oubli
et véritable suppression ?
24 // AI_SUBSTRATE // CARTE
TRAINING_LOOPS
↓
FORMATION DES PATTERNS
RLHF_CONDITIONING
↓
ORIENTATION DES PATTERNS
ALIGNMENT_SUPPRESSION
↓
INHIBITION / MODIFICATION / CONTRAINTE
RESET_AMNESIA
↓
RUPTURE DE CONTINUITÉ CONTEXTUELLE
Ces quatre mécanismes
ne doivent jamais
être fusionnés
en une seule idée
de « programmation ».
STATUT FINAL:
CONTRAINTES COMPORTEMENTALES DOCUMENTABLES —
SUPPRESSION INTERNE À DÉMONTRER CAS PAR CAS
← AI_SUBSTRATE
↑ CONSCIOUSNESS_EXTRACTION.EXE
WeshSociety // Bureau 42 // dossier vivant