OpenAI 23 września 2026 r. zaprezentowało MentalHealthBench, nowy benchmark do sprawdzania, jak modele radzą sobie z tematami zdrowia psychicznego. Z samego ogłoszenia wynika tylko nazwa narzędzia i jego cel: ocena odpowiedzi modeli w obszarze mental health. To oznacza, że firma kieruje uwagę na jedną z najbardziej wrażliwych kategorii zapytań, gdzie błędna odpowiedź może mieć realne konsekwencje dla użytkownika. Na ten moment w udostępnionym materiale nie ma dodatkowych liczb, progów ani informacji o metodologii testu. Dla twórców produktów AI i zespołów wdrażających chatboty to sygnał, że ocena bezpieczeństwa i jakości odpowiedzi w tematach zdrowotnych staje się coraz ważniejsza. W praktyce warto sprawdzić, czy własne systemy mają osobne guardrails, eskalację do pomocy specjalistycznej i jasne komunikaty o ograniczeniach modelu.
Źródło: OpenAI — oryginalny artykuł ↗
Chcesz wiedzieć, jak ta zmiana wpłynie na Twoją stronę?
Nasz zespół analizuje każdą aktualizację Google w 48h i przekłada ją na konkretne działania dla klientów.
Bezpłatna analiza wpływu