Anthropic 26 sierpnia 2026 r. opisało swoje nowe podejście do rozumienia i ograniczania szkód wynikających z AI, obejmujące zarówno scenariusze katastroficzne, jak zagrożenia biologiczne, jak i bieżące ryzyka typu child safety, dezinformacja czy fraud. Firma podkreśla, że jej Responsible Scaling Policy (RSP) koncentruje się na ryzykach katastroficznych, a teraz rozwija szersze ramy oceny szkód, które mają pomóc proporcjonalnie zarządzać różnymi typami zagrożeń. W modelu analizowane są cztery główne wymiary wpływu: fizyczny, psychologiczny, ekonomiczny, społeczny oraz wpływ na autonomię jednostki, z uwzględnieniem m.in. prawdopodobieństwa, skali, czasu trwania i możliwości mitigacji. Anthropic wskazuje też konkretne zastosowania tych ram przy funkcjach computer use, gdzie analizuje ryzyka związane z oprogramowaniem finansowym, bankowością, narzędziami komunikacji, phishingiem i operacjami wpływu. Firma podaje, że przy Claude 3.7 Sonnet udało się zmniejszyć liczbę niepotrzebnych odmów o 45%, zachowując zabezpieczenia przed naprawdę szkodliwymi treściami. Jednocześnie zapowiada dalszy rozwój metod oceny, red teaming, testy przed i po wdrożeniu oraz egzekwowanie od modyfikacji promptów po blokady kont.
Źródło: Anthropic — oryginalny artykuł ↗
Chcesz wiedzieć, jak ta zmiana wpłynie na Twoją stronę?
Nasz zespół analizuje każdą aktualizację Google w 48h i przekłada ją na konkretne działania dla klientów.
Bezpłatna analiza wpływu