Anthropic opublikowało 26 sierpnia 2026 r. wpis o wyzwaniach w red teamingu systemów AI, opisując zestaw metod, których używa do testowania modeli. Firma podkreśla, że red teaming to „critical tool” do wykrywania podatności, ale dziś zespoły stosują różne techniki nawet wobec tego samego threat modelu, co utrudnia obiektywne porównywanie bezpieczeństwa modeli. W materiale wymienia m.in. Policy Vulnerability Testing z ekspertami zewnętrznymi, red teaming zagrożeń dla bezpieczeństwa narodowego, testy wielojęzyczne i wielokulturowe, automatyczny red teaming z użyciem modeli, testy multimodalne oraz crowdsourced i community red teaming. Anthropic wskazuje też na współpracę z organizacjami takimi jak Thorn, Institute for Strategic Dialogue, Global Project Against Hate and Extremism oraz z IMDA i AI Verify Foundation w Singapurze, gdzie testowano cztery języki: angielski, tamilski, mandaryński i malajski. Dla branży ważne jest to, że firma chce przejść od jakościowego red teamingu do automatycznych, ilościowych ewaluacji, w pętli obejmującej test, mitigacje i ponowną weryfikację. W praktyce to sygnał, że bezpieczeństwo modeli będzie coraz częściej oceniane nie tylko przez pojedyncze testy, ale przez powtarzalne procedury i benchmarki. Anthropic zaznacza też, że takie standardy są potrzebne już teraz, zanim modele zyskają jeszcze większe możliwości.
Źródło: Anthropic — oryginalny artykuł ↗
Chcesz wiedzieć, jak ta zmiana wpłynie na Twoją stronę?
Nasz zespół analizuje każdą aktualizację Google w 48h i przekłada ją na konkretne działania dla klientów.
Bezpłatna analiza wpływu