← Marketing Wire / AI & Search

Common Crawl: 68% plików llms.txt powstaje z szablonów, a nie z ręcznej edycji

·Źródło: Search Engine Journal

Common Crawl przeanalizował 584 107 plików llms.txt i ustalił, że 68% z nich pochodzi z pluginów lub szablonów, a 22% nie zawiera żadnych linków. Senior research engineer Malte Ostendorff wskazał też, że 6% plików zawiera wytyczne dotyczące użycia AI, takie jak limity zapytań czy noty copyright, choć sam standard llms.txt tego nie obejmuje. Część witryn wpisuje w ten plik reguły dla konkretnych crawlerów, ale — jak podkreśla raport — llms.txt „grants nothing and blocks nothing, and no crawler is obliged to read it”. W badaniu znaleziono także 136 578 odpowiedzi robots.txt pod ścieżką llms.txt, co sugeruje, że część serwisów myli oba formaty. W praktyce oznacza to, że blokada wpisana wyłącznie do llms.txt nie działa; dla CCBot, którego obsługuje Common Crawl, liczy się robots.txt. Autorzy dodają, że tylko 4 z 10 wykrytych przypadków wyglądały na realne instrukcje prompt injection, a 3 793 pliki zawierały łagodniejsze wskazówki typu „focus on these pages”.

Źródło: Search Engine Journal — oryginalny artykuł ↗

Chcesz wiedzieć, jak ta zmiana wpłynie na Twoją stronę?

Nasz zespół analizuje każdą aktualizację Google w 48h i przekłada ją na konkretne działania dla klientów.

Bezpłatna analiza wpływu