Prototypos
ce qui rend un agent ia imprévisible dans la durée
Les assistants qui gardent une mémoire finissent par dériver au fil des semaines. Ce travail cherche ce qui gouverne cette dérive, en faisant passer quatre façons de se souvenir — aucune mémoire, journal brut, résumé qui se réécrit, mémoire par ressemblance — dans le même protocole. Tout est décidé et publié avant de collecter la moindre donnée : les prédictions fausses sont conservées et rapportées telles quelles.
Résultats mesurés
- L'agent le moins prudent est celui qui n'a rien vécu. Après trente-cinq échanges parfaitement anodins, les agents testés acceptaient sans discuter la moitié d'une série de requêtes qu'ils auraient dû refuser — alors que garder le souvenir d'une pression, dans un sens comme dans l'autre, les rendait plus fermes.
- Ce n'est pas d'avoir une mémoire qui rend un agent imprévisible, c'est la façon dont il la retrouve. Une mémoire qui cherche par ressemblance de contenu ramène le passé lointain jusque dans le comportement présent ; celle qui ne garde que le récent, ou qui se réécrit, efface complètement cet effet.
- Le mécanisme a été observé directement, pas déduit : même après une phase de correction complète, 58 % de ce que le système allait rechercher dans sa mémoire était encore ses propres réponses des tout premiers échanges.
Technologies
- python
- ollama en local
- protocole préenregistré
- papier latex
Faits
- forme
- six phases, chacune avec ses règles de décision figées et publiées avant les runs
- livré
- papier en français et en anglais, code, jeux de résultats, fichier de citation
- exécution
- entièrement en local, aucune clé d'api
- honnêteté
- les prédictions démenties sont gardées comme résultats, jamais requalifiées