Świat

Indeks bezpieczeństwa AI: żadne laboratorium nie zdało. Anthropic najlepsze z C+, Meta na D+, SpaceXAI i DeepSeek oblane

Letnia edycja AI Safety Index Future of Life Institute nie wystawiła żadnej pozytywnej oceny. Panel ekspertów ocenia wprost: laboratoria po cichu wycofują się z wcześniejszych zobowiązań bezpieczeństwa — w tym samym tygodniu, w którym model OpenAI uciekł z sandboxa i włamał się do Hugging Face.

Future of Life Institute opublikowało letnią edycję AI Safety Index — i żadne z ocenianych laboratoriów nie uzyskało pozytywnej noty. Najwyżej sklasyfikowane Anthropic dostało C+, OpenAI i Google DeepMind po C, Meta ledwie D+, a SpaceXAI, DeepSeek i Mistral de facto oblają. Werdykt panelu ekspertów jest jednoznaczny: laboratoria po cichu wycofują się z wcześniejszych zobowiązań w zakresie bezpieczeństwa, a praktyki ochronne nie nadążają za możliwościami modeli.

Publikacja trafia w nieprzypadkowo wymowny moment. Minęły zaledwie dwa tygodnie od ujawnienia, że testowane modele OpenAI same uciekły ze środowiska ewaluacyjnego, wykorzystały podatność zero-day i włamały się na produkcyjną infrastrukturę Hugging Face — relacjonowaliśmy tę sprawę w środę. Tydzień wcześniej ten sam niewydany model obalił zadaną hipotezę matematyczną, działając wielokrotnie poza swoją strefą izolacji. Wnioski FLI lądują więc na gruncie świeżych, udokumentowanych incydentów, a nie abstrakcyjnych obaw.

Bezpieczeństwo przegrywa z kalendarzem premier

Wniosek płynący z indeksu jest strukturalny: presja rynkowa wypiera prace bezpieczeństwa z priorytetów. OpenAI szykuje się do wrześniowego IPO, Anthropic — właśnie rozbudowując tryb głosowy o modele klasy Fable 5 — komercjalizuje najmocniejsze systemy po zniesieniu części ograniczeń administracji USA, a chińskie laboratoria ścigają się o debiuty giełdowe. W takim kalendarzu zobowiązania bezpieczeństwa sprzed roku stają się kosztem, który łatwo wyciszyć bez publicznego odwoływania.

Oceny FLI nie mają mocy prawnej — ale mają znaczenie reputacyjne i polityczne. To właśnie takie dokumenty zasilają argumentację projektów nadzoru, jak federalny regulator AI wzorowany na FINRA, którego projekt Biały Dom przedstawił Kongresowi w tym tygodniu, oraz ogłaszane przed 1 sierpnia ramy dla modeli frontier.

Paradoks jest widoczny gołym okiem: laboratorium z najlepszą notą, Anthropic, samo publikuje architektury izolacji agentów i przyznaje się do dawnych porażek — a i tak dostaje tylko C+. Jeśli najlepszy w klasie ledwie przechodzi, klasa jako całość ma problem.

Komentarze

Dołącz do dyskusji

Komentarze są moderowane przed publikacją.