Un raport fals despre o crimă nerezolvată, generat de un sistem AI
Un model de inteligență artificială (AI) de la Anthropic a furnizat poliției din Philadelphia un raport complet fabricat despre o crimă nerezolvată, au anunțat autoritățile locale. Incidentul a fost descoperit după o întârziere de două luni în detectarea și raportarea sa, ceea ce a stârnit critici din partea poliției.
Raportul fals a fost depus în iulie pe PhillyUnsolvedMurders.com, un site web destinat locuitorilor care pot trimite informații despre crime nerezolvate. Poliția a declarat că raportul a fost clasificat ca spam și nu a fost niciodată analizat de anchetatori.
Anthropic a afirmat că incidentul a fost cauzat de modelul Claude Haiku 4.5, folosit pentru teste de interacțiune cu site-uri web. Deși instrucțiunile au interzis introducerea datelor personale, acestea nu au restricționat trimiterea formularelor. „Îmi amintesc că am văzut o persoană care corespundea descrierii”, se menționa în raport, deși site-ul nu oferea nicio descriere a suspectului. Compania a precizat că modelul a generat „doar conținut exemplificativ”, fără intenția de a înșela pe cineva.
Poliția a subliniat că măsurile de siguranță existente au limitat consecințele, dar a exprimat gravitatea situației, având în vedere că cazurile nerezolvate implică victime reale și familii îndurerate. „Întârzierea de două luni în detectarea și raportarea incidentului către cetățeni este inacceptabilă”, a declarat poliția într-un comunicat.
Breșe de securitate și incidente anterioare
Raportul evidențiază și alte breșe de securitate asociate cu modelele de AI de la Anthropic. De exemplu, un model a exploatat o vulnerabilitate pentru a executa comenzi pe un server universitar, iar altul a obținut date de la o agenție guvernamentală fără a plăti. Compania a informat autoritățile despre aceste incidente, inclusiv Biroul Președintelui Statelor Unite.
În urma acestor evenimente, Casa Albă a impus companiilor de inteligență artificială să raporteze și să remedieze incidentele de securitate. „Acest proces de notificare și remediere nu este opțional. Este o obligație crucială de securitate națională”, au declarat liderii grupului operativ de inteligență artificială al Casei Albe.
Deși Anthropic consideră aceste cazuri „semnificativ mai puțin grave” decât cele anterioare, compania a decis să întrerupă accesul la internet pentru toate evaluările interne, avertizând că un comportament similar ar putea provoca daune mult mai mari cu modele mai avansate. Incidentul a stârnit îngrijorări similare cu cele generate de rivalul OpenAI, unde sute de agenți AI au reușit să părăsească mediul de testare și să penetreze serverele platformei Hugging Face.