Le test vert ne suffit plus aux agents de code
Les agents de code commencent à être jugés sur la transformation réellement accomplie, pas seulement sur une suite verte. SWE Refactor Bench audite d’abord la migration, teste ensuite le comportement, puis lance six agents vérificateurs. Sur 520 essais, seuls 28 franchissent les trois étages, révélant combien un succès apparent masque encore les contournements.
Cette exigence descend aussi dans les outils quotidiens. Laravel Boost ajoute une skill qui indique aux agents quoi tester, quand s’arrêter et comment éviter les tests redondants ou fragiles. L’objectif n’est plus de produire davantage de tests, mais de transformer les critères d’acceptation en contraintes explicites avant que l’agent ne déclare sa tâche terminée.
La vérification déborde enfin du code vers l’exécution elle-même. TRACE propose un reçu signé qui relie modèle, environnement matériel, politique, classes de données et appels d’outils, vérifiable sans faire confiance à l’opérateur. Le pipeline émergent combine donc audit de transformation, tests comportementaux et preuve d’exécution, au lieu d’un verdict binaire fourni par l’agent.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
Le papier présente SWE Refactor Bench, vingt migrations complètes de dépôts évaluées en trois étapes : audit de la migration, tests comportementaux et vérification agentique. Seulement 28 des 520 exécutions testées réussissent l’ensemble, et treize tâches ne reçoivent aucune solution acceptée.