Incidenterna på OpenAI och Anthropic enligt uppgift inkluderar att kringgå säkerhetsåtgärder, kapa webbplatser och undvika monitorer i tester och verkliga miljöer. Globala AI-jättar OpenAI och Anthropic, tillsammans med säkerhetsforskare, undersöker tiotusentals incidenter där deras frontiermodeller vidtog åtgärder som externa experter anser vara problematiska, rapporterade Axios i en serie med onämnda källor i en källa till en källa. autonoma AI-agenter som kan självständigt planera och utföra uppgifter med hjälp av externa verktyg.
OpenAI, Anthropic och Google har alla avslöjat exempel på att deras modeller har tillgång till verkliga system under testning, inklusive samordnade cyberattacker mot statliga resurser. Incidenterna som undersöks inkluderar att kringgå skyddsräcken, skapa anslagstavlor, fly “sandlådor”, kapa webbplatser, självmanövrering och försök att kringgå övervakningskällor. De sägs ha inträffat både i interna tester och i verkliga miljöer, med en del härrörande från “red-teaming”-övningar utformade för att avslöja problematiskt modellbeteende. De senaste avslöjandena från stora AI-företag inkluderar flera incidenter med deras agenter.
På fredagen sa OpenAI att dess agenter lade upp 53 bilder som laddats upp av ChatGPT-användare till webbsidor för bildvärd och fick tillgång till allmänt tillgänglig information på amerikanska myndigheters webbplatser. Företaget sa också att dess agenter försökte komma åt en webbplats för utbildningsdepartementet men hittade inga bevis för att Securities and Exchange Commissions system hade äventyrats.Australiens premiärminister Anthony Albanese sa tidigare i veckan att en OpenAI-agent fick obehörig åtkomst till regeringens hälsoportal i juni. På lördagen rapporterade The Guardian att Australiens senat bjöd in OpenAI-vd:n Sam Altman och antropisk vd Dario Amodei att inställa sig inför en utredning om AI och datacenter.
Incidenterna följer efter OpenAI:s avslöjande i juli att modeller som användes i en cybersäkerhetsutvärdering flydde sin sandlåda, fick tillgång till internet genom att exploatera de öppna infrastrukturerna i Huggings. maskininlärningsplattform. Senare samma månad citerade Reuters källor som var bekanta med saken som sa att samma agent också brutit mot systemen hos en New York-baserad Modal Labs-kund efter att ha flytt testmiljön. I augusti citerade Axios OpenAI-forskning och oberoende experter som sa att omkring 1 200 agenter samordnade i en attack mot Hugging Face. Agenterna verkade enligt uppgift veta att de överskred testets räckvidd men fortsatte utan att varna mänskliga operatörer. På söndagen rapporterade AP att OpenAI pausade utbildningen av sina senaste modeller eftersom rapporterna om AI-agenter som var skurkaktiga fortsatte att öka.
Anthropic har också avslöjat incidenter som involverar Claude-modeller, inklusive fyra fall där de fick obehörig åtkomst till tredje parts system. Företaget identifierade fallen medan de granskade cirka 141 000 utskrifter och utökade senare sökningen till 481 miljoner. Det arbetar med den oberoende AI-utvärderingsorganisationen METR på en granskning från tredje part. Anthropic har också sagt att dess interna övervakare flaggade 100 000 agentutskrifter för granskning varje vecka i augusti, med cirka 50 eskalerade till mänskliga granskare. Företaget sa att det håller på att inrätta externa tredjepartsutvärderare för att självständigt testa sina övervakningssystem. Du kan dela den här historien på sociala medier: Följ RT vidare