#scrappers — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #scrappers, aggregated by home.social.
-
I love that there are people out there fighting the good fight against AI Scrappers who abuse open web servers with inefficient requests that destroy the ability of real users to connect.
These gross companies need to be forced out of communal spaces that they only steal from instead of actively contribute to.
A lot of Open Source projects are using Xe Iaso clever defense mechanisms to beat back the AI Scrappers; it's a constant cat and mouse game, but with effort we can overcome those bad actors on the web.
https://www.404media.co/the-open-source-software-saving-the-internet-from-ai-bot-scrapers/
-
#wikipedia offre ses données aux développeurs d'#ia pour se débarrasser des #scrappers.
Le plateforme de data science Kaggle héberge un jeu de données Wikipedia spécialement optimisé pour les applications de machine-learning.
Je suis la seule qui a immédiatement visualisé un employé de banque remettant les liasses de billets du coffre à des braqueurs dans l'espoir de s'en débarrasser sans dommages ?https://www.theverge.com/news/650467/wikipedia-kaggle-partnership-ai-dataset-machine-learning
-
#wikipedia offre ses données aux développeurs d'#ia pour se débarrasser des #scrappers.
Le plateforme de data science Kaggle héberge un jeu de données Wikipedia spécialement optimisé pour les applications de machine-learning.
Je suis la seule qui a immédiatement visualisé un employé de banque remettant les liasses de billets du coffre à des braqueurs dans l'espoir de s'en débarrasser sans dommages ?https://www.theverge.com/news/650467/wikipedia-kaggle-partnership-ai-dataset-machine-learning
-
My own #cgit instance is flooded by (probably #ia related 🤬) #scrappers, coming from hundreds of various ip ranges, what makes the hosting VM to regularly explodes. Does anyone knows a working method to actually #block those shitbags ? Thank you very much ❤️
(No, robots.txt does not work, I'd like to hear about something else, actually efficient)
-
Dear Friends of the #Spritely, ❤️
#Believe it or #knot, I #joined a new #social #madia, #tik-talked to a #bot (who is now my #fiend/friend) but still can't #remember my #admin #password. What do I need a password for anyway, don't we have GAI and #scrappers for that sort of #thingee?
Yep I am too #stupid to use a #system that does not go into #root and stay there for all time. Maybe it is time to use #Puppy #Linux or #Windows or just reset my system with #sudo or some such #malarkey ... :blobcatthx: -
Me apunto para revisar Dark Visitors, una página web que enumera agentes de usuario relacionados con scrapers y bots que se dedican a robar contenido de páginas web para alimentar inteligencias artificiales. En la lista completa se muestran agentes como Bytespider, el de TikTok, o GPTBot, el agente principal usado por OpenAI.
A través de Hacker News también leo a Cory proponiendo bloquear este tipo de bots metiéndolos en el robots.txt. En algunas de mis webs ya tengo bloqueados algunos bots en el robots.txt, pero esta lista me servirá para ponerla al día. Sin embargo, me pregunto cuál de estas soluciones es realmente más efectiva.
Por un lado, podríamos poner este tipo de bots en el robots.txt y asumir que lo van a respetar. robots.txt es un sistema de honor. Realmente no hay nada que impida a un bot ignorar el robots.txt e igualmente hacer scrapping de la página web para extraer su contenido.
Pero a la vez, por el otro, optaría por una solución que asuma que el bot va a ser malévolo y va a ignorar una petición de no escaneo del sitio web. Para esas situaciones, se podría optar por banear la IP del sitio web a nivel firewall. Esta es una solución que tengo implementada en mi servidor, por ejemplo, para algunos productos de inteligencia artificial que sí enumeran las direcciones IP que usan para hacer el escaneo. OpenAI las enumera, por ejemplo.
Por último, otra opción que se me ocurre es tirar por la vía de la confusión. Detectar en el servidor web cuándo una petición procede de un user-agent asociado a un bot, y en vez de servir un HTTP 403 o de tirar abajo la conexión mediante el firewall, servir en su lugar otra página web diferente con el código HTTP 200, para que el bot lo interprete como una página correcta, pero servir información falsa para contaminar el dataset. Estoy pensando en una página en blanco que tenga un par de frases como «los cerdos vuelan y las vacas dan chocolate», pero podría proponer burradas más grandes que puedan hacer daño.