OpenAI poprvé klasifikuje AI model jako kritický: Astra má pokročilé kybernetické schopnosti, ale posílí digitální obranu
InovaceOpenAI zařadilo jeden ze svých připravovaných modelů umělé inteligence, Astra, do nejvyšší kategorie kyberbezpečnostního rizika. Interní testování naznačilo, že model by mohl disponovat pokročilými útočnými kybernetickými schopnostmi.
OpenAI zařadilo jeden ze svých připravovaných modelů umělé inteligence, Astra, do nejvyšší kategorie kyberbezpečnostního rizika. Interní testování naznačilo, že model by mohl disponovat pokročilými útočnými kybernetickými schopnostmi. Společnost uvedla, že počáteční hodnocení naznačují, že Astra mohla dosáhnout bodu, kdy již nelze vyloučit, že splňuje „kritickou“ hranici definovanou v jejím rámci připravenosti (Preparedness Framework). Toto hodnocení vedlo OpenAI k zpřísnění interního zabezpečení kolem modelu před jeho širším nasazením. Společnost také plánuje spolupracovat s vládními agenturami a nezávislými skupinami pro bezpečnost umělé inteligence, aby ověřila schopnosti Astry a posílila ochranná opatření před jejím uvolněním.
Nedávná interní hodnocení odhalila významné pokroky ve výkonu Astry v oblasti autonomního kódování a kybernetické bezpečnosti. Tato zjištění, podpořená expertními recenzemi, přesvědčila společnost, že model by potenciálně mohl splňovat nejvyšší úroveň kybernetických schopností. Rámec připravenosti, zavedený koncem roku 2023, slouží jako interní průvodce OpenAI pro sledování vznikajících rizik v pokročilých systémech umělé inteligence. Předchozí modely, včetně GPT-5.6-Sol, zůstaly po podobných hodnoceních v kategorii „vysoké“ riziko. Astra je prvním modelem, který vyvolal obavy z dosažení kritické úrovně. Podle rámce spadá model do této kategorie, pokud dokáže nezávisle objevovat a vyvíjet funkční zero-day exploity proti zabezpečeným reálným systémům nebo provádět sofistikované kybernetické útoky z širokého cíle bez lidské pomoci. OpenAI zdůraznilo, že testování stále probíhá a nepotvrdilo, že Astra tuto hranici překročila. Společnost také objasnila, že Astra neměla žádné spojení s nedávným zneužitím Hugging Face.
V reakci na to OpenAI zavedlo přísnější ochranná opatření pro vývojové prostředí Astry. Inženýři nyní používají izolované testovací systémy, přísnější síťová omezení, silnější šifrování pro váhy modelu, vylepšené monitorovací nástroje a sandboxed spouštěcí prostředí. Společnost také pozastavila interní práce s Astrou, které dosud nesplňují vylepšené bezpečnostní požadavky. Dalším doplňkem je univerzální monitorování napříč agentními aplikacemi Astry. Monitorovací systémy OpenAI kontrolují myšlenkové procesy modelu během tréninku a hodnocení. Pokud detekují potenciálně nebezpečné nebo nesprávné chování, mohou spustit bezpečnostní kontrolu a přerušit vysoce rizikové aktivity. Předtím, než se Astra dostane k uživatelům, bude hrát větší roli externí testování. OpenAI plánuje spolupracovat s vládními agenturami a vybranými organizacemi pro bezpečnost umělé inteligence a zároveň poskytovat externím hodnotitelům doporučené bezpečnostní kontroly pro testování s vyšším rizikem.