Anthropic opublikował 8 lipca 2026 r. badanie o interpretowalności dużych modeli językowych i na krótko udostępnił demo „Golden Gate Claude” w claude.ai. Firma twierdzi, że w „umyśle” Claude 3 Sonnet znalazła miliony aktywujących się „features”, a jedną z nich jest koncept Golden Gate Bridge, uruchamiany przez wzmiankę lub obraz mostu. Zespół potrafi nie tylko wykrywać takie cechy, ale też zwiększać lub zmniejszać ich aktywację, co bezpośrednio zmienia zachowanie modelu. Po podkręceniu tej cechy odpowiedzi Claude zaczynają obsesyjnie wracać do Golden Gate Bridge, nawet gdy temat pytania jest zupełnie inny. Anthropic podkreśla, że to nie jest ani „play-acting” przez prompt, ani klasyczny fine-tuning, lecz precyzyjna, chirurgiczna zmiana wewnętrznych aktywacji modelu. Firma zaznacza też, że podobne techniki można zastosować do cech związanych z bezpieczeństwem, m.in. niebezpiecznym kodem, działalnością przestępczą i oszustwem, co ma pomóc w budowie bezpieczniejszych modeli AI. Demo było dostępne tylko przez 24 godziny i obecnie nie jest już aktywne.
Źródło: Anthropic — oryginalny artykuł ↗
Chcesz wiedzieć, jak ta zmiana wpłynie na Twoją stronę?
Nasz zespół analizuje każdą aktualizację Google w 48h i przekłada ją na konkretne działania dla klientów.
Bezpłatna analiza wpływu