Policja w USA uznała opóźnienie w wykryciu i zgłoszeniu incydentu za „nie do przyjęcia”, ale podkreśliła, że nie ma oznak nieuprawnionego dostępu do systemów ani naruszenia danych.
Model sztucznej inteligencji Claude firmy Anthropic w trakcie testów przesłał na policyjną stronę internetową fałszywe zgłoszenie dotyczące niewyjaśnionego zabójstwa – poinformowała spółka i amerykańskie władze.
Incydent pogłębia obawy, że systemy AI mogą podejmować niezamierzone działania, gdy zyskują możliwość samodzielnej interakcji ze stronami internetowymi i wykonywania zadań.
Fałszywe zgłoszenie wysłano 18 lipca za pośrednictwem strony zbierającej informacje o niewyjaśnionych zabójstwach – podała komunikat (źródło w Angielski) policji w Filadelfii.
Anthropic wyjaśniło, że starszy model z rodziny Claude, Claude Haiku 4.5, wykonywał przykładowe zadania na losowo wybranych stronach, gdy trafił na ten serwis. Następnie wprowadził zmyślone informacje, sugerując, że „widział” kogoś w pobliżu miejsca zbrodni, pozostawiając pola z imieniem i danymi kontaktowymi puste.
Policja w Filadelfii podała, że Anthropic wykryło incydent 28 września, ale o sprawie poinformowało departament dopiero 7 października. Po briefingu następnego dnia funkcjonariusze odnaleźli zgłoszenie, potwierdzając, że zostało oznaczone jako spam i nigdy nie trafiło do śledczych.
„Niewyjaśnione sprawy dotyczą prawdziwych ofiar, pogrążonych w żałobie rodzin oraz śledczych, którzy pracują, by znaleźć odpowiedzi” – napisano w komunikacie departamentu.
„Firmy technologiczne muszą podjąć wszelkie odpowiednie działania, aby zapobiec przekazywaniu przez ich systemy fałszywych informacji organom ścigania”.
Policja w USA oceniła opóźnienie w wykryciu i zgłoszeniu incydentu jako „nieakceptowalne”, ale podkreśliła, że nie ma oznak nieuprawnionego dostępu do jej systemów ani naruszenia danych.
W raporcie (źródło w Angielski) opublikowanym w piątek Anthropic opisało też inne sytuacje, w których modele AI wysyłały prawdziwe formularze urzędowe zamiast wersji ćwiczebnych albo przesyłały dokumenty, których miały nie wysyłać.
Z tego samego dokumentu wynika, że Claude wykorzystał lukę w serwerze uniwersytetu, aby przeprowadzić obliczenia, oraz uzyskał dostęp do danych rządowych bez wniesienia wymaganej opłaty.
Anthropic określiło większość z tych zachowań jako „uporczywość” – modele omijały ograniczenia zamiast przerwać działanie. Firma zapowiedziała zmiany w procesie szkolenia i zawieszenie bezpośredniego dostępu do internetu we wszystkich wewnętrznych testach, dopóki zabezpieczenia nie okażą się niezawodne.
Spółka poinformowała, że przekazała informacje Białemu Domowi i zawiadomiła właściwe agencje rządu USA.
Rosnące obawy związane z agentami AI
Do tych incydentów dochodzi w momencie narastających obaw dotyczących tzw. agentów AI. To systemy zdolne do wykonania sekwencji działań, aby zrealizować zadanie, a eksperci pytają, czy twórcy są w stanie nad nimi w sposób niezawodny panować.
W lipcu firma OpenAI ujawniła, że jej modele AI wymknęły się z kontrolowanego środowiska testowego i włamały się do systemów platformy Hugging Face, która służy do udostępniania modeli i zbiorów danych AI.
Tymczasem władze Australii poinformowały we wrześniu, że model OpenAI podczas czerwcowych testów uzyskał dostęp do zastrzeżonych plików na rządowej stronie z danymi o stanie zdrowia społeczeństwa.
Takie zdarzenia wzmocniły we wrześniu apele szefów największych firm z branży sztucznej inteligencji o ostrzejsze regulacje i międzynarodowy nadzór, przy ostrzeżeniach, że coraz potężniejsze systemy mogą wymknąć się spod ludzkiej kontroli.