home.social

#crawling — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #crawling, aggregated by home.social.

fetched live
  1. FYI: PatronView blocks Amazon's AI crawler after 117,000 daily page reads: Anthropic's crawler hit a 35,000 to 1 crawl ratio, and CAPTCHA solve rates measured just 0.24%. The findings show why small operators are locking down servers. ppc.land/patronview-blocks-ama #AI #WebSecurity #DataPrivacy #Crawling #CAPTCHA

  2. FYI: PatronView blocks Amazon's AI crawler after 117,000 daily page reads: Anthropic's crawler hit a 35,000 to 1 crawl ratio, and CAPTCHA solve rates measured just 0.24%. The findings show why small operators are locking down servers. ppc.land/patronview-blocks-ama #AI #WebSecurity #DataPrivacy #Crawling #CAPTCHA

  3. Go-juggler и протокол Juggler

    ИИ-агентам нужно ходить по настоящему вебу. Но настоящий веб враждебен к автоматизации: Playwright блокируют, headless-версия Chrome палится по отпечаткам, а стелс-плагины просто становятся частью отпечатка. Если вы когда-нибудь писали скраперы или инструменты для агентов, вы знаете, как это бывает - всё работает локально, а потом продакшен разваливается за Cloudflare-челленджем. Несколько проектов пытались решить эту проблему со стороны браузера. Проект camoufox.com патчит Firefox на уровне C++, так что navigator.hardwareConcurrency, WebGL-рендереры, AudioContext, геометрия экрана и WebRTC подменяются ещё до того, как JavaScript их увидит. Браузер github.com/jo-inc/camofox-brow оборачивает этот движок в REST API, заточенный под агентов: снимки доступности вместо раздутого HTML, стабильные ссылки на элементы для кликов и изоляция сессий. Остаётся только одна дыра: инструментарий вокруг этой экосистемы завязан на JavaScript/Python. Если вы живёте в Go - а весь стек Go-агентов, взорвавшийся за последние пару лет, весомый аргумент в его пользу - вам оставалось писать сырые вызовы curl. Пакет github.com/yvv4git/go-juggler исправляет это. Это Go-клиент для протокола автоматизации Juggler (того самого, который патчит и расширяет Camoufox) под лицензией MIT. Он управляет Firefox/Camoufox из Go с единственной зависимостью и чистым, слоистым API.

    habr.com/ru/articles/1068462/

    #scraping #crawling #crawler #browser #go

  4. CW: Lewd fantasy - He Debases Me

    #erotica #humiliation #crawling #debasement #Domination #submissive

    “If you check in my bag, you’ll find something special,” he said.

    Curiosity piqued, I began to rise. His hands shot out, pressing down on my shoulders, and he made a negating noise.

    “Crawl,” he said.

    Uhh.

    1/6

  5. CW: Lewd fantasy - He Debases Me

    #erotica #humiliation #crawling #debasement #Domination #submissive

    “If you check in my bag, you’ll find something special,” he said.

    Curiosity piqued, I began to rise. His hands shot out, pressing down on my shoulders, and he made a negating noise.

    “Crawl,” he said.

    Uhh.

    1/6

  6. 🕸️ us/crw

    A fast web scraper, crawler and search API with MCP server for AI agents, Firecrawl-compatible and self-hostable

    ⭐ Stars: 511
    📅 Last Update: Aug 02, 2026

    github.com/us/crw

    #selfhosted #homelab #selfhost #selfhosting #opensource #webscraping #crawling

  7. FYI: Cloudflare ties AI payouts to citations as 50% of crawls waste: Ceramic.ai and You.com will now pay publishers per query result, not per page fetch, since over half of good-bot crawls only re-fetch pages that never changed. ppc.land/cloudflare-ties-ai-pa #Cloudflare #AI #Crawling #CeramicAI #YouDotCom

  8. FYI: Cloudflare ties AI payouts to citations as 50% of crawls waste: Ceramic.ai and You.com will now pay publishers per query result, not per page fetch, since over half of good-bot crawls only re-fetch pages that never changed. ppc.land/cloudflare-ties-ai-pa #Cloudflare #AI #Crawling #CeramicAI #YouDotCom

  9. Seiten über 2 MB HTML werden von Googlebot bei 2 MB abgeschnitten. 🪚

    Eine Marken-Übersichtsseite, die ich auditiert hab: 3,8 MB reines HTML. Alles ab der Hälfte – Markenlinks, interne Links, strukturierte Daten – erreicht den Crawler nicht.

    Prüfen: HTML-Quellcode-Größe der größten Seiten. Nicht Seitengewicht gesamt, nur das HTML.

    #TechSEO #Crawling #Indexierung #ECommerce

  10. Seiten über 2 MB HTML werden von Googlebot bei 2 MB abgeschnitten. 🪚

    Eine Marken-Übersichtsseite, die ich auditiert hab: 3,8 MB reines HTML. Alles ab der Hälfte – Markenlinks, interne Links, strukturierte Daten – erreicht den Crawler nicht.

    Prüfen: HTML-Quellcode-Größe der größten Seiten. Nicht Seitengewicht gesamt, nur das HTML.

    #TechSEO #Crawling #Indexierung #ECommerce

  11. Смотрите, я сделал поиск по новостям

    Привет! У многих разработчиков есть периоды, когда хочется сделать гениальный пет проект на 300кк в наносекунду. Весеннее обострение не обошло меня стороной, и мне захотелось сделать свой Palantir. На момент старта я еще не до конца понимал, что хочу сделать, но было видение и вдохновление - большего, обычно, не нужно - даже свободное отобранное время находится само по себе. Вернемся к проблеме: а что мы делаем, и, естественно, второстепенный вопрос, - зачем? Вдохновившись видео про завайбкоженный палантир , у меня появилась первый тезис - "Хочу получить полную картину об интересующем событии". Это уже дает некие очертания - какой-то сервис, который соберет за меня релевантную информацию и предоставит удобный отчет. /cut Что этот безумец натворил читать в ...

    habr.com/ru/articles/1019058/

    #новости #claude #mcp #crawling #scraping #api #агрегатор

  12. Standing Up Now Illegal After Snake Fossil Discovery

    Nation forced to crawl. Developers rush to build flat apartments.

    #AltAndPaperEN #crawling #law #absurd #ShortComic

  13. Standing Up Now Illegal After Snake Fossil Discovery

    Nation forced to crawl. Developers rush to build flat apartments.

    #AltAndPaperEN #crawling #law #absurd #ShortComic