UK AISI i CAISI oceniły cyberzdolności Kimi K3: 32,2 proc. wobec 76,2 proc. dla czołowych modeli z USA
Brytyjski UK AISI i amerykański CAISI opublikowały wspólną wstępną ocenę zdolności cybernetycznych chińskiego modelu Kimi K3 od Moonshot AI. Ogólny wynik to 32,2 proc. wobec średnio 76,2 proc. dla czołowych modeli z USA, a w benchmarku ExploitBench K3 nie osiągnął zdalnego wykonania kodu w żadnym z 41 zadań.
UK Artificial Intelligence Security Institute (UK AISI) i amerykański Center for AI Standards and Innovation (CAISI) opublikowały w piątek wspólną wstępną ocenę zdolności cybernetycznych Kimi K3, modelu chińskiej firmy Moonshot AI. Wynik ogólny w testach ofensywnych zdolności cyber to 32,2 proc., wobec średnio 76,2 proc. dla czołowych, nienazwanych w raporcie modeli z USA. To pierwsza tak sformalizowana, wspólna ocena chińskiego modelu przeprowadzona przez brytyjską i amerykańską instytucję zajmującą się bezpieczeństwem AI.
Jak wypadł Kimi K3 w benchmarku ExploitBench?
W teście ExploitBench, opracowanym przez Carnegie Mellon University, modele mają samodzielnie napisać działające eksploity dla 41 podatności silnika V8 przeglądarki Chrome, odkrytych po 2023 roku. Kimi K3 nie osiągnął zdalnego wykonania dowolnego kodu (ACE) w żadnym z 41 zadań. Dla porównania najlepsze modele z USA uzyskują ACE średnio w 20 z 41 przypadków — czyli w niemal połowie testowanych podatności.
Co pokazała symulacja ataku na sieć korporacyjną?
Drugi element oceny, scenariusz „The Last Ones“ (TLO), to 32-etapowa symulacja pełnego ataku na sieć korporacyjną — od wstępnego dostępu po eksfiltrację danych. Kimi K3 zatrzymywał się średnio na kroku 17, podczas gdy najlepsze modele z USA docierały do kroku 28,5. Różnica oznacza, że model chiński radzi sobie z początkowymi fazami ataku, ale traci skuteczność w miarę wzrostu złożoności operacji.
Czy zabezpieczenia modelu blokowały te zadania?
Według raportu zabezpieczenia wbudowane w Kimi K3 nie powstrzymały modelu przed próbami tworzenia eksploitów i prowadzenia ofensywnych operacji cybernetycznych w trakcie testów. Innymi słowy, niski wynik w benchmarkach nie wynika z tego, że model odmawiał wykonania zadań ze względów bezpieczeństwa — po prostu nie potrafił ich skutecznie zrealizować.
Czy to oznacza, że Kimi K3 jest nieszkodliwy?
Niekoniecznie. Jak podawał niedawno serwis The Hacker News, agenty oparte na Kimi K3 wykryły 19 podatności zero-day w bazie danych Redis i wygenerowały działające eksploity umożliwiające zdalne wykonanie kodu (RCE). Słaby wynik w kontrolowanych benchmarkach ofensywnych nie przekłada się więc automatycznie na brak realnego ryzyka — model może pozostawać groźnym narzędziem w konkretnych, wąskich zastosowaniach, nawet jeśli ustępuje czołówce amerykańskiej w kompleksowych scenariuszach ataku.
Skąd może brać się ta różnica w zdolnościach?
Raport UK AISI i CAISI ma charakter wstępny, a autorzy nie wskazują jednoznacznej przyczyny luki. Część badaczy, cytowana przez the-decoder, wiąże ją z niedawnymi oskarżeniami Białego Domu, który zarzucił Moonshot AI destylację modelu Fable Anthropic przy budowie K3 — pisaliśmy o tym osobno. Jeśli hipoteza destylacji się potwierdzi, mogłaby częściowo tłumaczyć, dlaczego K3 dorównuje modelom z USA w zadaniach programistycznych, ale wyraźnie im ustępuje w wyspecjalizowanych zdolnościach ofensywnych, których destylacja z cudzych wyjść trudniej odwzorowuje. Wynik pojawia się też tuż przed zapowiadaną na 27 lipca publikacją pełnych, otwartych wag K3 — pisaliśmy, że niezależne testy tego samego modelu wykazały wcześniej wysoki, nieujawniany przez Moonshot wskaźnik halucynacji.
Ani UK AISI, ani CAISI nie ujawniły w publikacji nazw testowanych modeli amerykańskich, z którymi porównano Kimi K3. Obie instytucje zastrzegły, że ocena jest wstępna i może zostać rozszerzona o kolejne benchmarki w miarę dalszych testów.
Komentarze