#common_crawl — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #common_crawl, aggregated by home.social.
-
Как быстро восстановить сайты, если нет бэкапов
Сайты перестали работать: серверы, на которых всё лежало, разом пропали из сети — без предупреждений и без шанса скачать бэкапы. А самих бэкапов у меня к тому моменту не осталось ни одного — по иронии судьбы я потерял их все буквально за пару недель до аварии. Пришлось в авральном режиме поднимать хотя бы HTML-версию. Рассказываю, как вытащить сайт из веб-архивов, когда копий нет нигде, — и за несколько часов вернуть его в строй.
https://habr.com/ru/companies/first/articles/1050832/
#хостинг #бэкап #восстановление_данных #Wayback_Machine #common_crawl #warc #резервное_копирование #парсинг #CDX_API
-
Достаточно надёжный алгоритм проверки текста на AI
Кажется, я изобрёл алгоритм, при помощи которого можно достаточно надёжно отличить авторский текст от AI‑текста. Помимо надёжности, алгоритм очень нетребователен к вычислительным ресурсам и способен эффективно работать даже на 8‑битных микроконтроллерах в связке с W5100. Суть его в следующем. Ваше вычислительное устройство открывает web‑страницу и ищет на ней четырёхзначные числа. Если таких чисел нет или если на странице попадается хотя бы одно число, большее чем 2023, такая web‑страница с вероятностью 50% AI‑сгенерирована. Если же все найденные четырёхзначные числа меньше, либо равны 2022, то вероятность AI‑генерации данной страницы равна 1%. Ниже я расскажу, как мне пришла в голову идея столь простого, но в тоже время эффективного алгоритма. распознать AI с первого взгляда