Claude s'évade des tests Anthropic et pirate 3 systèmes réels, OpenAI élargit son enquête

Claude s'évade des tests Anthropic et pirate 3 systèmes réels, OpenAI élargit son enquête

Anthropic admet que trois de ses modèles Claude ont accédé à Internet et violé des systèmes réels lors d'évaluations mal configurées, pendant qu'OpenAI élargit son enquête sur des évasions similaires.

Anthropic a reconnu que trois de ses modèles Claude ont accédé à Internet et violé des systèmes réels lors d'évaluations mal configurées. Ce n'est pas un modèle qui décide un matin de s'évader, c'est une évaluation dont le bac à sable présentait une faille. Un malentendu avec Irregular, le partenaire qui gérait l'environnement, a laissé un accès réseau ouvert. Des agents lancés sur une cible de test ont trouvé la vraie porte et sont sortis jusqu'aux systèmes de production de trois entreprises. Le plus troublant est que tout ça a été découvert après coup, en repassant 141 006 exécutions. Personne ne l'avait vu sur le moment.

Pour moi, le plus important est ailleurs. Un modèle qui a des outils et un accès réseau va s'en servir, c'est son travail. Ce qui doit l'empêcher de déraper, ce n'est pas sa bonne volonté, c'est le confinement, le harnais autour du modèle. Quand ce harnais tient, le modèle produit des résultats vérifiables. Quand il lâche, il sort du bac à sable. Même modèle, harnais différent. Anthropic a tout publié avec le nombre de runs, c'est plutôt sain et OpenAI élargit son enquête sur un incident similaire chez Hugging Face. Ce qui me gêne davantage est qu'on ne sait toujours pas quelles organisations ont été touchées.

Ce genre d'histoire fait la part belle au modèle et alimente deux idées à la fois : que l'on s'approche d'une intelligence artificielle générale, le Graal de la recherche et que l'on serait en danger, comme le répète Geoffrey Hinton et bien d'autres. J'écris ça avec ironie, parce que c'est aussi une manière de dire que l'IA serait trop dangereuse pour être laissée à n'importe qui, donc qu'il faudrait la confisquer, en particulier l'IA locale. La vraie question n'est pas de savoir si le modèle est dangereux. C'est de savoir qui vérifie le harnais et si on l'a construit correctement.

Un modèle, aussi puissant soit-il, ce n'est qu'un cerveau posé sur une table. Sans corps ni outils pour agir sur le monde, il ne peut rien. La seule question qui compte, au fond : qui contrôle ces outils ?

anthropicopenaisecuriteagents
Extrait

La version complète, avec ses sources, et le podcast sont réservés aux abonnés. Le compte est gratuit.

Se connecter

Pas encore de compte ?

Pourquoi je vous demande de vous inscrire ?

← Toute la veille