Immer mehr Websites blockieren inzwischen aggressiv KI-Scraper. Wir führen Agenten-Simulationstests durch, um zu sehen, was verschiedene Bots erwartet, wenn sie sich an die Regeln in robots.txt halten. Die Blockadetechniken reichen von feindselig (sofortige Verbote, Honeypots) bis hin zu unkompliziert (klare 403s mit Erklärungen). Das Web fragmentiert in Zonen, die nur für Menschen zugänglich sind, und Zonen, die für Bots zugänglich sind. Wenn du Scraper baust oder Modelle trainierst, musst du überwachen, wie deine User-Agent-Strings in verschiedenen Domains behandelt werden. Der Wettlauf zwischen Datensammlern und Datenprotektoren eskaliert rasend schnell.
