#gptbot — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #gptbot, aggregated by home.social.
-
FYI: Explaining GPTBot: GPTBot is OpenAI's training crawler for foundation models. The robots.txt token, user agent versions, published IP ranges, blocking rates and the open disputes. https://ppc.land/gptbot/ #GPTBot #OpenAI #AI #MachineLearning #DataScience
-
Разобрал логи сервера: какие ИИ-боты реально ходят по сайту и что они запрашивают
Про ИИ-ботов пишут в основном пересказами документации вендоров: этот собирает данные для обучения, тот ходит за содержанием по запросу пользователя. Я решил посмотреть, что происходит на самом деле — прежде всего по журналам доступа сервера. Ниже представляю вам разбор: кого видно в логах, что они запрашивают, чем отличаются два типа ботов у одного вендора и почему файл llms.txt в этой картине почти не встречается.
https://habr.com/ru/articles/1072256/
#ИИботы #GPTBot #ClaudeBot #PerplexityBot #логи_сервера #robotstxt #llmstxt #UserAgent #парсеры #анализ_трафика
-
Написал валидатор llms.txt на 64 тестах — и проверил, читают ли этот файл боты
Файл llms.txt предлагают класть в корень сайта с 2024 года: считается, что языковые модели прочитают его вместо того, чтобы разбирать вёрстку. Я написал для него генератор и валидатор, проделал 64 теста для отладки — и параллельно посмотрел, сколько раз ИИ-боты вообще запрашивают этот файл. Значения получились неутешительные, но валидатор всё равно оказался полезным. Ниже — устройство разбора, схема оценки и код.
https://habr.com/ru/articles/1070334/
#llmstxt #валидатор_llmstxt #генератор_llmstxt #GPTBot #ИИботы #спецификация_llmstxt #парсер_markdown #node_test #robotstxt #нейропоиск
-
Neuer Artikel im Blog:
Nur sechs GPTBot-Zugriffe in fünf Tagen: Server-Log-Realitätscheck
https://wwagner.net/blog/a/nur-sechs-gptbot-zugriffe-in-fuenf-tagen-server-log-realitaetscheck
-
AI-краулеры в 2026: кого пускать в robots.txt, чтобы попадать в ответы ИИ
Полгода назад ко мне постучался один из будущих клиентов с вопросом, почему ChatGPT не знает про его компанию, хотя сайт в топ-3 Google по нужному запросу. Индексация была нормальной, ссылки — тоже. Проблема нашлась за пять минут в логах: в robots.txt висел Disallow: / для всех user-agent, кроме Googlebot и YandexBot. GPTBot, ClaudeBot, PerplexityBot получали 403 ещё на первом запросе. Полгода сайт был невидим для трёх из четырёх крупных AI-поисковиков, и никто об этом не знал — в Search Console и Вебмастере всё выглядело зелёным. Случай типовой. Проверка индексации показывает, видит ли сайт поисковик. Попадёт ли страница в ответ модели, которая формирует его вместо поисковой выдачи, — вопрос отдельный. Это две разные аудитории ботов, и вторая почти никогда не попадает в стандартный SEO-чеклист.
https://habr.com/ru/articles/1063216/
#AIкраулеры #robotstxt #GPTBot #AEO #GEO #AIвидимость #нейросети #AIO #YandexBot #яндексвебмастер
-
Google добавил AI-отчёты в Search Console. Я разобрался, что они реально показывают
Google начал разворачивать в Search Console отчётность по своим AI-поверхностям: трафик и показы стало видно с учётом AI Overviews и AI Mode. До этого AI-клики были размазаны внутри общего веб-отчёта, и понять, сколько дал именно ИИ-ответ, было нельзя. Я полез смотреть и довольно быстро уткнулся в потолок. Оказалось, что Search Console показывает только AI-поверхности самого Google . Ни ChatGPT, ни Perplexity, ни Claude, ни Алиса в него не попадают в принципе — они не Google. Если вы, как и я, хотите видеть весь AI-трафик, а не только гугловский, придётся идти в логи сервера. Ниже — что именно даёт новый отчёт, где у него слепые зоны и как я закрываю их парсером логов.
https://habr.com/ru/articles/1060928/
#AEO #GEO #AIтрафик #Search_Console #серверные_логи #GPTBot #ChatGPT #Perplexity #нейропоиск
-
Wenn ich nachsehen möchte, ob im #Formatstring für das Datum das kleine s für Sekunden und das große S für Millisekunden steht, dann frage ich das einen beliebigen #GPTbot (den, der nicht sagt #Quota exceded, weil ich mich nicht per #Api-Key identifiziert habe). Warum?In #Wikipedia steht die Antwort möglicherweise. Es dauert aber, herauszufinden, in welchem Artikel, Listenartikel oder Unterartikel. Die #Suche von Wikipedia verwendet zwar #ElasticSearch, aber um die Vorteile von dieser starken Engine auch zu erhalten, hätten 100000e Menschen, die Wikipedia-Artikel auch verschlagworten müssen (#wikidata). Ausserdem kann es sein, dass etwas so praktisches wie formatstrings als #unenzyklpädisch eingestuft wurde und daher entfernt.
In #Stackexchange muss ich mehrfach bestätigen, dass ich ein Mensch bin, finde dann einen Artikel, der unbeantwortet geschlossen wurde, weil #Duplikat. Dann zwei veraltete, die inzwischen falsch sind, dann welche mit einem nicht mehr funktionierenden link auf die Lösung.
Bei #archive_org, archive.is und #AnnasArchive muss ich die #URL des gesuchten Artikels wissen, um suchen zu können.
Eine #Suchmaschine sucht nicht. Eine Suchmaschine liest die "Sutemap.XML" Dateien aus, die websitebetreiber online stellen für die #crawler der Suchmaschinen. Ich finde also fünf Jahre alte Artikel auf Websites die seit fünf Jahren nicht mehr gepflegt werden. Und maximal ein jahr alte Artikel, die meine Frage nicht beantworten aber in der #sitemap stehen. Die 100 Websites, die die richtige Antwort in einem zwei bis vier Jahre alte Artikel enthalten, finde ich nicht, weil diese Artikel nicht mehr in der sitemap stehen.
Die GPTbots haben Wikipedia, stackexchange, Archiv.org, Annas archive und alle Websites gescrapt und dabei #robots.txt und sitemap ignoriert. Ich bekomme die richtige Antwort und zwar schneller als mit allen zuvor genannten Varianten.
Oder ich suche in #Grokipedia. Grokipedia besteht aus 1Million statischen seiten im #CDN von #Cloudflare die von wikipedia gescrapt wurden. Die suche ist ein GPTbot und 57mal besser als die suche in wikipedia.
@malteengeler @awinkler @evawolfangel @bkastl @Raymond @wikipedia
-
With the surprise of absolutely anyone I believe, #OpenAI does not follow robots.txt rules with its #GPTbot.
With at least one full crawl of websites per day, setting a rule to reject their user agent I hoped to see at least a slow down, but instead there was an increase in frequency.
Oh well, we're starting to ban IP from #Azure Cloud where their crawling comes from. I know that this will reduce our "visibility" in "searches" but... who gives.
-
Comment bloquer les crawlers IA qui pillent votre site sans vous demander la permission ?
https://fed.brid.gy/r/https://korben.info/bloquer-crawlers-ia-robots-txt-htaccess-nginx.html
-
#GPTBot macht nach wie vor ca. 20% der Zugriffe dieser Mastodon-Instanz aus, aber der Crawler bekommt nur noch von #Iocaine generierten Unsinn. Das reduziert die Datenmenge, die wir an ihn ausliefern, drastisch und zerstört die Qualität unseres Datensatzes für ihn vollkommen.
Es hilft uns also Kosten zu sparen, verschlechtert die LLM und macht auch noch diebische Freude! Win-Win-Win! :KritischerTreffer:
-
This is -ing unbelievable:
In the 17 hours running my "Discworld Ólyfjan" Iocaine, GPTBot has download the same 84 pages over 10000 times. They don't even change!And Google has it on the search index: "Ólyfjan" [name of any discworld character]
has results.HEX, the Bursar, even the troll Brick would be more intelligent than that...
-
One of the things that annoys me the most is that the scraper that went furthest into the tarpit (83 links deep) is also the one who comes back reading the same pages again and again:
{host="olyfjan.blomi.is",user_agent="Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.2; +https://openai.com/gptbot)",user_agent_group="GPTBot"} has sent 6991 GET requests, for the same 84 pages, downloading 22779416 bytes.
-
#GPTBot est utilisé pour rendre nos modèles de base d' #IA générative plus utiles et plus sûrs. Il est utilisé pour explorer le contenu qui peut être utilisé pour former nos modèles de base d'IA générative. Interdire GPTBot indique que le contenu d'un site ne doit pas être utilisé.
Et bien moi, c'est bloqué 😉
Robots de m*r*e 😎52.230.152.0/24
52.233.106.0/24
20.171.206.0/24
20.171.207.0/24
4.227.36.0/25
172.182.193.160/28 -
Now #OpenAI's rabid scraper bot #GPTBot is getting stuck in an endless URL concatenation loop again, this time it's on the principia-web forums. It's been going ever since last night.
I have no idea how you can mess up a crawler bot this badly, but I guess nobody cares if it goes havoc. Into the shitlist it goes.
-
Apart from everything else GPTBot is brutal on servers. Block that bad baby and block it good.
Info here (IP addresses and full user-gent string):
https://platform.openai.com/docs/bots -
Lol. #Amazon nutzt (soweit ich weiß) sehr gerne #KI-basierte Text-Generatoren so wie #ChatGPT - aber laut Amazon's robots.txt ( https://amazon.com/robots.txt ) soll der #ChatGPT-Bot namens #GPTBot nicht auf der Website von Amazon crawlen (Disallow: /), also nicht mit Daten von Amazon trainiert werden!
-
Wenn #Kreative ihr geistiges Eigentum von den #Trainingsdaten diverser KI-Modelle ausschliessen wollen, wird das Vorhaben schnell zu einer nervigen Lebensaufgabe. In meinem ersten Blog-Beitrag zu diesem Thema erfährst du, wie du den #GPTBot von #OpenAI (DALL-E) von deiner #Website oder Teilen der Site aussperren und wie du mit Hilfe des Opt-out-Formulares von OpenAI Werke aus den Trainingsdaten "entfernen" kannst.
#KI #AI #kuenstler #designer #fotografen #kreative #kunst
https://teufelswerk.net/kuenstler-designer-autoren-und-urheber-aufgepasst-teil-1-so-kannst-du-deine-werke-aus-den-ki-trainingsdaten-von-open-ai-dall-e-entfernen/ -
Est-ce légitime de récolter des pages Web pour entrainer des IA ?
-
تمنع مواقع #ويب وصول #GPTBot، الذي طورته، #OpenAi لجمع البيانات، بحجة تحسين "دقة نماذج #الذكاء_الاصطناعي" التي تطورها. لماذا قلق هذه المواقع من حصد بياناتها؟ وكيف يمكن حظر #الروبوت من حصد بيانات مواقع الويب؟مع تحيات #نايلةالصليبي
#AI
#web_crawler