La mémoire des agents ne se mesure plus au simple rappel
Un nouveau banc d’essai public sépare désormais la mémoire textuelle de la mémoire des agents de code, avec une même interface d’ajout et de recherche. Son parcours dédié vérifie la capacité à retrouver puis réutiliser des expériences de débogage, des décisions d’ingénierie et le contexte historique d’un dépôt.
Cette cible resserre le diagnostic. MemGym isole l’apport de la mémoire du raisonnement et des outils sur cinq pistes, dont SWE-Gym et CodeQA ; MemoryArena enchaîne des tâches dépendantes sur plusieurs sessions. Les deux montrent qu’un excellent rappel conversationnel ne garantit ni une bonne décision ultérieure, ni un meilleur patch.
Pour les équipes, la métrique utile devient l’effet sur le travail : contexte pertinent retrouvé, exploration évitée, erreur corrigée et comportement amélioré à la session suivante. Agent Retrieval Bench confirme l’écart : les trajectoires manquent tous les fichiers pertinents dans 27 à 35 % des cas. À surveiller : des résultats publics reproductibles sur du code réel.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
Agent Memory Leaderboard
Ce banc d’essai public sépare la mémoire textuelle de la mémoire des agents de code sous un protocole commun Add/Search. Le parcours code évalue la récupération, le filtrage et la réutilisation d’expériences de débogage, de développement et de contexte projet ; les méthodes académiques et les produits commerciaux disposent de tableaux distincts.