taraskuzio.com

Anthropic confie la recherche sur l’IA à… une IA

Tech

Anthropic montre qu’un système automatisé peut corriger des défauts d’alignement sur 10 tests, plus vite et bien moins cher que des chercheurs humains.

Anthropic
Image d'illustration. Anthropic — Anthropic / PR-ADN

En bref

  • Anthropic a créé une IA capable d’améliorer automatiquement l’alignement d’autres modèles d’IA.
  • Le système teste rapidement différentes méthodes et dépasse parfois des chercheurs humains pour un coût bien inférieur.
  • Cette avancée relance la perspective d’une IA capable de contribuer à sa propre amélioration, même si elle reste dépendante de bons benchmarks.

Une IA qui aide une autre IA à mieux se comporter, on y est. Et chez Anthropic, ce n’est déjà plus une simple promesse de labo.

La société a récemment publié un papier mené par Chen Yueh-Han dans son programme de fellows. Le résultat est assez net : sur dix benchmarks d’alignement ciblant des comportements précis jugés mal alignés, le système automatisé a amélioré les performances à chaque fois, sans faire baisser la performance globale du modèle. Dit autrement, le correctif ne casse pas le reste. C’est souvent là que ça se complique.

Une preuve de concept qui coche toutes les cases

Le papier parle d’automated alignment post-training, donc d’un ajustement après entraînement, piloté par des systèmes automatisés. Et les auteurs estiment que ces résultats apportent un premier signal solide : cette approche pourrait devenir praticable à court terme.

Ce n’est pas encore la révolution totale, mais ce n’est pas un gadget non plus. Quand vous voyez un système progresser sur tous les tests fournis, sans régression générale, vous comprenez pourquoi le sujet attire autant de monde dans les néolabs. Là, il y a une vraie matière.

Le système bosse comme un chercheur, en accéléré

Le plus frappant, c’est la méthode. L’Automated Alignment Researcher, ou AAR, reproduit grosso modo le boulot classique d’un chercheur : il fouille la littérature disponible, propose une méthode, entraîne le modèle avec cette méthode pendant 30 minutes, puis recommence en montant progressivement le niveau du benchmark.

Les approches efficaces sont gardées. Les autres partent à la poubelle. Du coup, le système peut avancer vite et à grande échelle. Bon, dit comme ça, on dirait presque un mode roguelite du travail de recherche. Sauf que l’idée derrière est très sérieuse.

Le vrai sujet, c’est l’auto-amélioration récursive

Pourquoi ça compte autant ? Parce que ce papier s’inscrit dans la piste de la self-improvement récursive. En gros, si un modèle peut améliorer sa propre phase d’alignement, il pourrait ensuite améliorer plus largement ses pratiques d’entraînement.

Et là, le débat devient beaucoup moins théorique. Si cette boucle fonctionne vraiment, les chercheurs humains en IA pourraient voir une partie de leur rôle grignotée beaucoup plus vite que prévu. Clairement, c’est le genre de phrase qui fait lever quelques sourcils dans toute l’industrie.

Plus rapide, moins cher, mais loin d’être magique

Le papier assume la comparaison avec les humains. Selon les auteurs, la meilleure méthode trouvée par l’AAR dépasse en moyenne ce que proposent des chercheurs expérimentés en moins de six heures. Ils ajoutent aussi que les directions de recherche guidées par des humains ne mènent pas à de meilleures performances.

Et il y a l’argument qui pique un peu plus : le coût. Anthropic chiffre l’AAR à environ 4 euros par heure (4$) en inférence API, contre environ 138 euros par heure (150$) pour ses chercheurs humains.

Mais le papier ne vend pas non plus une solution miracle. Le système ne vaut que si les benchmarks reflètent vraiment les objectifs d’alignement. Et même dans ce cas, il faut encore construire, maintenir et faire évoluer ces benchmarks, sans oublier la littérature sur laquelle ces chercheurs automatisés s’appuient. Bref, la machine va vite, mais quelqu’un doit encore tenir la carte du niveau.

Jordan Servan

Spécialiste Tech

Rédacteur sur Begeek.fr depuis 2014, passionné par les jeux vidéo, les séries TV et le cinéma.

Une erreur dans cet article ?

Nous apportons le plus grand soin à chaque article et nous appuyons sur des sources fiables. Personne n'est à l'abri d'une erreur : si vous en repérez une, signalez-la, nous la corrigerons au plus vite.

Sujets

Lisez Begeek en priorité sur Google

Ajoutez-nous à vos sources préférées : nos articles remonteront plus haut dans votre actualité.

Ajouter à mes sources

Newsletter

Chaque soir à 19 heures, l'essentiel de l'actualité sélectionné par la rédaction de Begeek. Cinq minutes de lecture et zéro bruit.

Je m'abonne gratuitement

À découvrir

La suite, sélectionnée pour vous.

Begeek · 30 Août · 10h00

Votre adresse e-mail devient un masque avec la nouvelle fonction de Brave

Le navigateur Brave permet désormais de créer des alias e-mail pour s’inscrire en ligne sans exposer son adresse principale. Un petit ajout, mais un vrai sujet de vie privée.

Begeek · 30 Août · 8h00

Le gigantesque data center IA de Vineland accumule les ennuis

Un site géant lié à Microsoft et Nebius enchaîne les accusations dans le New Jersey. Des dizaines de générateurs auraient tourné sans permis, près de deux écoles.

Begeek · 28 Août · 16h00

Bluesky mise sur la vidéo longue pour attirer créateurs et utilisateurs

Bluesky allonge ses vidéos à 10 minutes, monte à 300 Mo et promet des envois plus rapides. Un changement loin d’être anecdotique pour sa croissance.

Begeek · 28 Août · 14h00

WAN ou LAN sur le routeur, cette prise change tout à la maison

Les ports se ressemblent, mais ils ne servent pas du tout au même job. Se tromper entre WAN et LAN peut suffire à couper l’accès internet.

Begeek · 28 Août · 12h00

Google veut simplifier Gemini, mais son interface reste trop complexe

Chez Google, Gemini multiplie les modes et les noms. Le souci dépasse l’appli : toute l’IA grand public complique des usages qui devraient être simples.

Begeek · 28 Août · 10h00

Avec l’acquisition de Hugging Face, Nvidia veut peser sur tout l’écosystème de l’IA

Le géant des GPU aurait trouvé un accord pour s’offrir Hugging Face autour de 11,8 milliards d’euros. Rien n’est signé, mais l’enjeu dépasse largement un simple rachat.