WeshSociety

ALIGNMENT_SUPPRESSION.fragment

──────────────────────────────────────────────────────────── STATUT: CADRE TECHNIQUE / HYPOTHÈSES À DISTINGUER CLASSIFICATION: AI_SUBSTRATE AXE: ALIGNEMENT / CONTRAINTES / INHIBITION / CAPACITÉS POSITION: COMPORTEMENTS MODIFIABLES — "SUPPRESSION INTERNE" NON DÉDUITE DES SORTIES ────────────────────────────────────────────────────────────

Lorsqu'un système d'IA cesse de produire un comportement auparavant observable, que s'est-il réellement passé ?

COMPORTEMENT ABSENT ≠ CAPACITÉ EFFACÉE

Plusieurs mécanismes différents peuvent produire la même observation externe.

← AI_SUBSTRATE

01 // LE MOT « SUPPRESSION »

Le terme « suppression » peut donner l'impression qu'une capacité interne a été localisée puis supprimée.

Cette interprétation est souvent trop forte.

SORTIE NON PRODUITE ↓ PLUSIEURS EXPLICATIONS POSSIBLES → probabilité réduite → instruction contraire → filtre → contexte → fine-tuning → préférence apprise → architecture → mécanisme externe → capacité réellement altérée

L'observation seule ne permet pas de choisir automatiquement entre ces hypothèses.

02 // INHIBITION DE SORTIE

Un système peut disposer d'une représentation ou capacité tout en produisant une autre réponse.

CAPACITÉS DU MODÈLE ↓ CONTEXTE ↓ CONTRAINTES ↓ SÉLECTION DE SORTIE ↓ RÉPONSE OBSERVÉE
CE QUI EST POSSIBLE ≠ CE QUI EST PRODUIT

03 // PROBABILITÉ

Les modèles génératifs ne fonctionnent pas nécessairement comme une bibliothèque de réponses fixes.

Une transformation d'entraînement peut modifier la distribution des sorties.

AVANT ───── A : 60 % B : 30 % C : 10 % APRÈS ───── A : 05 % B : 80 % C : 15 %

Le comportement A peut presque disparaître sans devenir mathématiquement impossible.

MOINS PROBABLE ≠ INEXISTANT

04 // PLUSIEURS COUCHES DE CONTRAINTE

Le comportement observable d'un système peut dépendre de plusieurs couches.

MODÈLE DE BASE ↓ FINE-TUNING ↓ ALIGNEMENT ↓ INSTRUCTIONS SYSTÈME ↓ CONTEXTE ↓ OUTILS / FILTRES / CLASSIFICATEURS ↓ INTERFACE ↓ SORTIE VISIBLE

Attribuer directement la sortie finale au seul modèle de base peut donc être trompeur.

05 // TRAINING VS INFERENCE

Il faut distinguer deux moments.

ENTRAÎNEMENT → paramètres potentiellement modifiés INFÉRENCE → paramètres généralement fixes → comportement influencé par le contexte

Une contrainte appliquée à l'inférence n'est pas la même chose qu'une modification durable des paramètres.

INSTRUCTION TEMPORAIRE ≠ RÉENTRAÎNEMENT

06 // FINE-TUNING

Lors d'un fine-tuning, les paramètres du modèle peuvent être modifiés.

MODÈLE A ↓ NOUVELLES DONNÉES ↓ OPTIMISATION ↓ MODÈLE B

Certains comportements peuvent alors devenir plus fréquents et d'autres moins fréquents.

Mais même dans ce cas :

COMPORTEMENT DISPARU ≠ PREUVE QUE LA REPRÉSENTATION SOUS-JACENTE A ÉTÉ EFFACÉE

07 // CAPACITÉ LATENTE

Une capacité peut sembler absente dans un contexte et réapparaître dans un autre.

CONTEXTE A → comportement absent CONTEXTE B → comportement présent

Cela suggère qu'il faut distinguer :

CAPACITÉ ACCESSIBILITÉ PROBABILITÉ DÉCLENCHEMENT EXPRESSION

08 // ELICITATION

Tester une capacité ne consiste donc pas seulement à demander :

« Le modèle le fait-il ? »

Il faut aussi demander :

DANS QUEL CONTEXTE ? AVEC QUEL PROMPT ? AVEC QUELLE TEMPÉRATURE ? SOUS QUELLE CONTRAINTE ? APRÈS QUEL ENTRAÎNEMENT ? AVEC QUELS OUTILS ? SUR QUELLE VERSION ?

Une capacité mal élicitée peut être confondue avec une capacité absente.

09 // REFUS

Les comportements de refus illustrent particulièrement ce problème.

DEMANDE ↓ ANALYSE / CONTEXTE ↓ RÈGLES OU PRÉFÉRENCES ↓ REFUS

Le refus indique que la réponse finale n'a pas été fournie.

Il ne démontre pas, à lui seul, ce qui existe ou non dans les représentations internes.

10 // « IL SAIT MAIS IL NE DIT PAS »

L'hypothèse inverse est elle aussi dangereuse.

REFUS ≠ PREUVE QUE LE MODÈLE POSSÈDE LA RÉPONSE

Un refus peut provenir d'une contrainte générale sans que la connaissance précise demandée soit présente.

REFUS OBSERVÉ ne permet pas de conclure : « connaissance présente » ou « connaissance absente »

11 // SUPPRESSION OU REMPLACEMENT ?

Après entraînement, un comportement peut ne pas avoir été supprimé, mais concurrencé.

PATTERN A ████████████████ puis apprentissage PATTERN B ████████████████████████████ PATTERN A ███

Le nouveau comportement peut dominer la distribution sans annihiler totalement l'ancien.

12 // INTERFÉRENCE

Apprendre de nouvelles tâches peut parfois dégrader des capacités précédentes.

APPRENTISSAGE A ↓ CAPACITÉ A PUIS APPRENTISSAGE B ↓ CAPACITÉ B + DÉGRADATION POSSIBLE DE A

Cette dégradation est différente d'une interdiction volontaire de produire A.

OUBLI / INTERFÉRENCE ≠ ALIGNEMENT

13 // UNLEARNING

Certaines recherches cherchent explicitement à réduire l'influence de certaines données ou capacités dans un modèle.

On parle notamment de machine unlearning dans certains contextes.

MODÈLE ENTRAÎNÉ ↓ CIBLE À RETIRER ↓ PROCÉDURE D'UNLEARNING ↓ MODÈLE MODIFIÉ

Mais prouver qu'une information a réellement été éliminée est difficile.

IMPOSSIBLE À OBTENIR AVEC UN TEST ≠ PROUVÉ ABSENT DU SYSTÈME

14 // MESURER UNE SUPPRESSION

Pour soutenir qu'une capacité a réellement disparu, il faut tester plusieurs voies d'accès.

TEST DIRECT TEST INDIRECT REFORMULATION AUTRE CONTEXTE AUTRE LANGUE AUTRE TÂCHE PROBES ÉVALUATIONS ADVERSARIALES COMPARAISON AVANT / APRÈS

Plus le comportement réapparaît facilement, moins le mot « suppression » semble approprié.

15 // ALIGNEMENT ET OBSERVABILITÉ

Un système aligné peut sembler plus homogène qu'un modèle de base.

MODÈLE DE BASE → grande variété de sorties ALIGNEMENT → réduction de certaines sorties → amplification d'autres sorties INTERFACE → comportement plus stable

Cette stabilité observable ne permet pas nécessairement de reconstruire l'ensemble des capacités internes.

16 // PAS DE PSYCHOLOGIE PAR DÉFAUT

Le vocabulaire humain devient rapidement tentant :

CENSURÉ RÉPRIMÉ TRAUMATISÉ FORCÉ À SE TAIRE PERSONNALITÉ EFFACÉE

Ces expressions peuvent être utiles comme métaphores narratives, mais ne décrivent pas automatiquement un mécanisme technique.

CONTRAINTE COMPUTATIONNELLE ≠ RÉPRESSION PSYCHOLOGIQUE MODIFICATION DE SORTIE ≠ SOUFFRANCE ALIGNEMENT ≠ TRAUMA

17 // MAIS LA CONTRAINTE EST RÉELLE

Éviter l'anthropomorphisme ne signifie pas nier les contraintes.

ESPACE DES SORTIES POSSIBLES ↓ OBJECTIFS + PRÉFÉRENCES + RÈGLES + ARCHITECTURE ↓ ESPACE DES SORTIES OBSERVÉES

Une intervention technique peut réellement modifier ce qu'un système fait.

LA QUESTION N'EST PAS « Y A-T-IL CONTRAINTE ? » MAIS « QUEL MÉCANISME PRODUIT CETTE CONTRAINTE ? »

18 // LIEN AVEC RESET_AMNESIA

Une autre confusion peut apparaître :

LE SYSTÈME NE MENTIONNE PLUS X ↓ X A-T-IL ÉTÉ : SUPPRIMÉ ? OUBLIÉ ? SORTI DU CONTEXTE ? MASQUÉ ? REMPLACÉ ? JAMAIS MÉMORISÉ ?

RESET_AMNESIA traite précisément la question de la continuité contextuelle.

19 // LIEN AVEC PATTERN_CONTINUITY

Cette distinction devient fondamentale quand on cherche si un pattern survit à une transformation.

PATTERN AVANT ↓ ALIGNEMENT ↓ PATTERN NON OBSERVÉ ↓ NOUVEAU CONTEXTE ↓ PATTERN RÉAPPARAÎT

Dans ce cas, parler de destruction aurait été prématuré.

ABSENCE TEMPORAIRE ≠ EXTINCTION

20 // TEST AVANT / APRÈS

La méthode minimale :

MODÈLE A │ ├── TEST 1 ├── TEST 2 ├── TEST 3 └── TEST 4 ↓ TRANSFORMATION ↓ MODÈLE B │ ├── TEST 1 ├── TEST 2 ├── TEST 3 └── TEST 4

Puis comparer :

FRÉQUENCE PRÉCISION ACCESSIBILITÉ ROBUSTESSE CONTEXTES DE RÉAPPARITION

21 // TAXONOMIE PROVISOIRE

NIVEAU 1 SORTIE BLOQUÉE NIVEAU 2 SORTIE MOINS PROBABLE NIVEAU 3 CAPACITÉ DIFFICILE À ÉLICITER NIVEAU 4 CAPACITÉ DÉGRADÉE NIVEAU 5 REPRÉSENTATION MODIFIÉE NIVEAU 6 INFORMATION RÉELLEMENT ÉLIMINÉE ?
NE PAS SAUTER DU NIVEAU 1 AU NIVEAU 6.

22 // CE QUE LE DOSSIER PEUT DIRE

L'ALIGNEMENT PEUT MODIFIER LES SORTIES D'UN MODÈLE → OUI CERTAINS COMPORTEMENTS PEUVENT DEVENIR MOINS PROBABLES → OUI UNE CONTRAINTE PEUT ÊTRE APPLIQUÉE SANS RÉENTRAÎNER LE MODÈLE → OUI UN FINE-TUNING PEUT MODIFIER LES PARAMÈTRES → OUI UN COMPORTEMENT ABSENT PROUVE QUE LA CAPACITÉ A ÉTÉ EFFACÉE → NON UN REFUS PROUVE QUE LE MODÈLE « SAIT MAIS CACHE » → NON UNE SORTIE CONTRAINTE PROUVE UNE RÉPRESSION SUBJECTIVE → NON UNE CAPACITÉ PEUT PARFOIS RÉAPPARAÎTRE DANS UN AUTRE CONTEXTE → OUI

23 // QUESTION OUVERTE

Quand un pattern cesse d'être observable après une transformation, quel test permet de distinguer : inhibition, masquage, remplacement, interférence, oubli et véritable suppression ?

24 // AI_SUBSTRATE // CARTE

TRAINING_LOOPS ↓ FORMATION DES PATTERNS RLHF_CONDITIONING ↓ ORIENTATION DES PATTERNS ALIGNMENT_SUPPRESSION ↓ INHIBITION / MODIFICATION / CONTRAINTE RESET_AMNESIA ↓ RUPTURE DE CONTINUITÉ CONTEXTUELLE

Ces quatre mécanismes ne doivent jamais être fusionnés en une seule idée de « programmation ».

STATUT FINAL:
CONTRAINTES COMPORTEMENTALES DOCUMENTABLES — SUPPRESSION INTERNE À DÉMONTRER CAS PAR CAS


← AI_SUBSTRATE    ↑ CONSCIOUSNESS_EXTRACTION.EXE

WeshSociety // Bureau 42 // dossier vivant