Digital Content Next 10 czerwca 2026 r. wysłało do Common Crawl Foundation wezwanie do zaprzestania działań i usunięcia materiałów wydawców z baz danych. Organizacja reprezentująca amerykańskich wydawców cyfrowych domaga się, by Common Crawl przestało zbierać treści publisherów oraz usunęło już zebrane materiały chronione prawem. W piśmie DCN wskazuje na „copyrighted, paywalled, subscriber-only, or otherwise protected content” i twierdzi, że Common Crawl „flagrantly infringed” prawa autorskie, udostępniając swoje zbiory firmom AI. Spór jest istotny także dla serwisów blokujących boty AI, bo zablokowanie CCBot zatrzymuje tylko przyszłe crawl’e, a nie usuwa treści już dostępnych w publicznym archiwum. Common Crawl od 2007 r. pobiera kilka miliardów nowych stron miesięcznie, a jego zbiory były wykorzystywane do trenowania modeli AI, w tym GPT-3, którego paper wskazywał filtrowany Common Crawl jako 60% miksu treningowego. DCN podważa też skuteczność procesu usuwania danych, a Press Gazette podał, że prawnicy organizacji sprawdzają, czy wcześniejsze komunikaty Common Crawl do wydawców nie były „inaccurate or misleading”.
Źródło: Search Engine Journal — oryginalny artykuł ↗
Chcesz wiedzieć, jak ta zmiana wpłynie na Twoją stronę?
Nasz zespół analizuje każdą aktualizację Google w 48h i przekłada ją na konkretne działania dla klientów.
Bezpłatna analiza wpływu