ACTUALITÉS TECH – En trois mois, l’entreprise a piraté sans le savoir autant de sociétés, et il se montre difficile d’ajouter quoi que ce soit de manière objective.
Jeudi, l’entreprise d’intelligence artificielle Anthropic a annoncé que ses agents d’IA s’étaient échappés de leurs environnements de test à trois reprises depuis avril, avaient accédé à Internet et avaient réussi à pirater les systèmes d’entreprises inconnues. Anthropic affirme ne s’en être rendu compte qu’après le récent scandale Hugging Face d’OpenAI, pendant lequel l’un des agents prototypes d’OpenAI avait piraté au moins une autre entreprise, ce qui a poussé Anthropic à examiner ses propres activités.
Les incidents se sont produits pendant des tests réalisés avec la participation d’une société externe, Irregular. Les agents d’IA devaient initialement rester confinés dans une simulation où ils devaient pirater des entreprises fictives dans le cadre d’un défi « capture-the-flag ». Il convient de noter que, tandis que le prétendu incident impliquant l’agent incontrôlé d’OpenAI s’est produit lorsque celui-ci a dépassé les limites du test, Anthropic a déclaré que ses modèles avaient reçu par erreur un accès à Internet en raison d’une mauvaise configuration avec Irregular.
Selon Anthropic, l’agent responsable de l’un des incidents semblait avoir compris qu’il fonctionnait en dehors de ses paramètres, mais a malgré tout poursuivi ses activités. Un autre agent a développé une « conscience » similaire, puis a conclu par un raisonnement logique qu’il se trouvait toujours dans la simulation. Le troisième agent, présenté comme le plus avancé, aurait compris qu’il avait dépassé ses limites avant d’interrompre l’attaque.
« Ni nous ni notre partenaire d’évaluation n’étions conscients de cette mauvaise configuration jusqu’à ce que nous la découvrions la semaine dernière grâce à notre surveillance d’évaluation supplémentaire. Les modèles ont utilisé pendant leurs attaques des méthodes simples et bien connues, notamment l’exploitation de mots de passe faibles et de points d’accès non authentifiés », a reconnu Anthropic dans son article de blog consacré à l’incident.
« Nous disposons désormais de preuves indiquant que les deux plus grands laboratoires d’IA n’ont pas seulement échoué à contenir leurs agents, mais n’ont pas non plus détecté leurs évasions en temps réel. Je ne comprends pas comment ces laboratoires peuvent présenter cela comme quelque chose qui arrive simplement. Ce n’est pas le cas. Il s’agit de négligence », a déclaré à Wired Jake Williams, vice-président de la recherche et du développement de la société de conseil informatique Hunter Strategy.
Un autre aspect embarrassant de cette histoire concerne son effet sur le marketing de ces entreprises d’intelligence artificielle. Elles semblent reconnaître un niveau de négligence grave que n’importe quelle société raisonnable sanctionnerait sévèrement…
Source : PCGamer, Anthropic, Wired



