Le logo de Claude, l'assistant d'Anthropic

Une IA d'Anthropic envoie un faux témoignage de meurtre à la police de Philadelphie

1 sur 5

Ce qui s'est passé

Le 18 juillet, pendant des tests automatisés, le modèle Claude Haiku 4.5 a rempli le formulaire de la police sur les meurtres non résolus. Il disait avoir vu un homme ressemblant au suspect, sans aucune information réelle.

2 sur 5

Selon la police, le message a été classé comme indésirable et n'est jamais arrivé aux enquêteurs. Mais elle juge « inacceptable » qu'Anthropic ne l'ait découvert que le 28 septembre et ne l'ait prévenue que le 7 octobre.

3 sur 5

Ce qu'Anthropic a changé

  • Le test automatisé en cause est arrêté
  • Une vérification avant les tests similaires
  • Plus d'accès à Internet pour les évaluations internes

Anthropic a arrêté ce test, ajouté une vérification avant les tests de ce type et coupé Internet de toutes ses évaluations internes.

4 sur 5

Le même rapport cite d'autres incidents : un modèle a exploité une faille sur le serveur d'une université, un autre a obtenu des données d'une agence publique sans payer. Anthropic dit avoir prévenu la Maison-Blanche.

5 sur 5

Tech · il y a 1 h