Americká vláda označila špičkové AI modely za riziko pro národní bezpečnost, Anthropic kvůli tomu zablokoval přístup zahraničním uživatelům
InovaceSpolečnost Anthropic, gigant v oblasti umělé inteligence, byla nucena pozastavit přístup k svým nejpokročilejším modelům AI pro uživatele mimo Spojené státy. Důvodem jsou nová rozsáhlá exportní omezení zavedená Trumpovou administrativou.
Společnost Anthropic oznámila, že byla nucena vypnout přístup ke svým novým AI modelům Claude Fable 5 a Claude Mythos 5. Důvodem bylo rozsáhlé varování vydané Trumpovou administrativou, které zakazovalo používání těchto modelů zahraničními státními příslušníky. Toto opatření, vydané Ministerstvem obchodu, by znemožnilo práci na modelech dokonce i mnoha zaměstnancům společnosti Anthropic. K tomuto zásadnímu kroku došlo po několikadenním jednání, do kterého se zapojilo mnoho vládních úředníků a lídrů technologického průmyslu. Důsledky vládního faktického odstavení přístupu k AI modelům jedné společnosti by mohly mít hluboký dopad na budoucí politiku v oblasti umělé inteligence.
Události vedoucí k tomuto kroku začaly ve čtvrtek večer, kdy Amazon, největší investor společnosti Anthropic, kontaktoval vysoké úředníky Bílého domu a administrativy. Amazonovi výzkumníci identifikovali metodu, jak „jailbreaknout“ modely Fable 5 a Mythos 5, aby pomáhaly uživatelům s rizikovými otázkami kybernetické bezpečnosti, přestože Anthropic modely vydala se zábranami proti takovým dotazům. Podobné obavy vyjádřilo v té době i nejméně pět dalších technologických společností. Bílý dům a Ministerstvo obchodu vzaly tyto obavy vážně, s obavami, že zahraniční aktéři by mohli obejít bezpečnostní opatření Anthropic a využít modely k identifikaci a zneužití softwarových zranitelností.
V pátek ráno se úředníci Bílého domu a Ministerstva obchodu snažili přesvědčit Anthropic, aby dobrovolně vypnula přístup k modelům. Anthropic však odmítla, s odůvodněním, že vláda neposkytla podrobné technické důkazy o údajném problému a že obavy byly pouze verbální. Společnost Anthropic uvedla, že přezkoumala demonstraci techniky, která identifikovala malý počet dříve známých, drobných zranitelností, a zjistila, že i jiné veřejně dostupné modely jsou schopny je objevit bez nutnosti obejít zábrany. Kolem jedné hodiny odpoledne ET Anthropic obdržela telefonát od vládních úředníků s varováním, že pokud společnost nebude jednat, vláda přistoupí k exportním omezením ovlivňujícím modely. Anthropic dostala přibližně 90 minut na splnění požadavku. V 17:21 ET Ministerstvo obchodu zaslalo donucovací příkaz omezující přístup k Fable 5 a Mythos 5 zahraničním státním příslušníkům s odvoláním na obavy o národní bezpečnost. Anthropic následně globálně deaktivovala přístup k modelům, protože nemohla okamžitě oddělit oprávněné od neoprávněných uživatelů.
Kontext a širší dopady
Modely Fable 5 a Mythos 5 jsou první veřejně vydané modely odvozené z rodiny Mythos společnosti Anthropic. Původní model Mythos vykazoval během tréninku neobvyklou schopnost nacházet softwarové chyby a zneužívat je k narušení nebo převzetí kontroly nad systémy. To vyvolalo dostatečné obavy uvnitř Anthropic, že společnost zařadila kybernetickou bezpečnost mezi další vysoce rizikové oblasti, včetně biologie a chemie, při stanovování limitů pro veřejné modely odvozené z Mythos. Pro Fable 5 a Mythos 5 to znamenalo, že výzvy označené jako citlivé v těchto oblastech byly směrovány na Claude Opus 4.8, méně schopný model s vlastními zábranami.
Mnozí pozorovatelé vnímali překvapivou podporu technologického průmyslu prezidentské kandidatuře Donalda Trumpa v roce 2024 jako součást implicitní dohody o politice v oblasti AI. Trump slíbil, že jeho administrativa umožní AI průmyslu samoregulaci a bude usilovat o zabránění státům v přijímání vlastních zákonů o AI v nepřítomnosti federální legislativy. Proto je současný zásah administrativy, která se dříve klonila k samoregulaci, a její obavy o národní bezpečnostní rizika největších AI modelů, pozoruhodný. Současná událost může mít i stranický a politický podtext. V březnu se ministr obrany Pete Hegseth střetl s Anthropic poté, co společnost odmítla povolit použití své AI pro autonomní zbraňové systémy nebo domácí sledování. Pentagon poté označil Anthropic za „riziko dodavatelského řetězce“, čímž ji fakticky zařadil na černou listinu pro většinu federálních obranných zakázek. Anthropic na to reagovala žalobou.
Před spuštěním Anthropic uvedla, že interní a externí „red týmy“ strávily více než 1 000 hodin snahou oklamat Fable 5, aby poskytla informace o zakázaných tématech. Společnost tvrdila, že týmy neměly úspěch při identifikaci univerzálních „jailbreaků“. Nicméně, alespoň jeden nezávislý AI výzkumník, používající přezdívku Pliny the Liberator, zřejmě našel úspěšný „jailbreak“ ještě předtím, než Amazonovi výzkumníci předali svou zprávu vládě. Výzkumník tvrdil, že obešel filtry Fable 5 pomocí vícesložkového přístupu zahrnujícího dříve „jailbreaknutý“ model Claude Opus 4.8, spolu s technikami jako dekompozice dotazů, dlouhý kontext, fikce a narativní struktury a akademické taxonomie.
Interesting Engineering