Les agents de code s’entraînent enfin dans leur vrai harnais
Une mise à jour publiée ce matin porte Agent Lightning à 1.0.1 après sa refonte complète. Son pari est décisif : entraîner un agent à travers un proxy sans réécrire son harnais, afin de conserver outils, contexte, contrôle et environnement réels pendant les trajectoires d’apprentissage.
Le résultat annoncé sur SWE-bench Verified est net : avec 6 000 exemples, Qwen3.5-9B passe de 41,8 % à 56,4 %. Mais l’enjeu dépasse le score. NeMo Gym avertit qu’un changement de harnais peut peser autant qu’un changement de modèle et impose de ne varier qu’un facteur à la fois.
La convergence avec Better Harness dessine une boucle plus rigoureuse : harnais versionné, expériences contrôlées, traces inspectables, tests de dépôt et récompenses revérifiables. Pour les équipes, le modèle n’est donc plus l’unique unité d’amélioration. La prochaine frontière consiste à prouver que les gains survivent aux tâches, outils et infrastructures de production.
Sources
Chaque onglet présente la publication d’origine et son lien direct.
Bump version to 1.0.1
Fusionné le 24 août à 08:58 UTC, ce commit officiel porte Agent Lightning de la version 1.0.0 à la version 1.0.1 dans le paquet Python et son fichier de verrouillage. Il ancre la mise à jour de ce matin sans s’appuyer sur une page de release GitHub.