home.social

#xgboost — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #xgboost, aggregated by home.social.

fetched live
  1. TabFM против XGBoost: 5 фактов, которых нет в релизе

    TabFM умеет получать предсказания по таблицам без обучения на конкретном датасете — и на бенчмарках уже обходит настроенный бустинг. Разбираемся, насколько убедительны эти результаты, где у модели заканчивается преимущество и что изменится для тех, кто держит табличный ML в проде.

    habr.com/ru/companies/otus/art

    #TabFM #XGBoost #CatBoost #табличныеданные #градиентныйбустинг #foundationmodels #zeroshot #машинноеобучение #бенчмарк

  2. От Django-дневника к интеллектуальной системе поддержки диабета: математика, SPA и машинное обучение

    В предыдущих статьях я рассказывал, как появился веб-дневник диабета на Django и как постепенно оптимизировалась его производительность. Проект начинался довольно типично: пользователь вводил показатели сахара, записывал приемы пищи и дозы инсулина, а система сохраняла их в базе данных и отображала на графиках. Со временем дневник перестал быть просто электронным блокнотом. Данных становилось все больше, а вместе с ними появлялись и новые вопросы. Главный из них звучал очень просто:

    habr.com/ru/articles/1054862/

    #Django #Python #машинное_обучение #XGBoost #CatBoost #прогнозирование_глюкозы #сахарный_диабет #непрерывный_мониторинг_глюкозы #Feature_Engineering #SPA

  3. Треть новых релизов на Яндекс Музыке – ИИ. Теперь точно

    Прошло полтора месяца с публикации моей статьи « Я выяснил, что Яндекс Музыка на треть состоит из нейрослопа ». Всё это время я продолжал исследовать тему определения ИИ в музыке. Итогом изысканий стал алгоритм, позволяющий определять сгенерированные треки с точностью, близкой к 100%. Кроме того, я проанализировал релизы в Яндекс Музыке за первое полугодие 2026 года и выяснил, что 37% всех новых релизов имеют признаки ИИ-музыки. А если учитывать только релизы с лайками, то количество нейромузыки достигает 50%. В этой статье я подробно расскажу, как работает алгоритм детекта ИИ-музыки, почему для него не требуется GPU, а также покажу аналитику по Яндекс Музыке.

    habr.com/ru/articles/1054636/

    #ии #нейросети #музыка #машинное_обучение #xgboost

  4. Как глушить нефтяную скважину… машинным обучением. Часть 2, техническая

    Продолжаю рассказывать широкой общественности об интересном ML проекте, результаты которого внедряются в реальный технологический процесс. В первой части разобрались, что такое глушение и почему важно уметь рассчитывать объемы жидкостей глушения. В этой части будет непосредственно все то, как мы решали эту задачу с помощью МЛ: Построили двухконтурную систему: офлайн-обучение на XGBoost и CatBoost — и лeгкий онлайн-инференс через Flask. Вместо одного .fit() с дефолтным лоссом внедрили K‑method — асимметричную функцию потерь. Теперь модель «боится» недолить жидкость сильнее, чем перелить, потому что в реальности эти ошибки стоят по-разному. CatBoost лучше по удобству работы с «сырыми» категориями, XGBoost потребовал кастомного кодирования, но дал сравнимые метрики. На малых данных (~350 строк) случайное разбиение творит хаос: метрики скачут от сида к сиду. Поэтому отбираем топ‑20 лучших random_state, а гиперпараметры усредняем частотным методом. Весь пайплайн — от подбора параметров до прогона K‑сетки — завернули в Airflow ради повторяемости, а все эксперименты и логи складываем в MLflow.

    habr.com/ru/articles/1045256/

    #Глушение_скважин #нефтяные_скважины #нефтяная_промышленность #машинное_обучение #промышленность #промышленное_программирование #catboost #xgboost #месторождение #tradeoff

  5. Поиск черной кошки в 2000-мерной темной комнате. Турнир алгоритмов машинного обучения

    Добро пожаловать на мой маленький тестовый полигон. В этой статье я расскажу, как столкнул лбами двадцать один алгоритм машинного обучения - от старой доброй линейной регрессии, KNN, случайного леса до троицы табличных королей (XGBoost, LightGBM, CatBoost), нескольких многослойных нейросетей и нейросетей с механизмом внимания. И я заставил их всех решать задачу, которая на первый взгляд кажется абсурдной (только на первый взгляд?). Большинство бенчмарков в машинном обучении вроде MNIST или Titanic давно натренированы до дыр. На картинках побеждают свертки, а на табличных данных – градиентный бустинг. Предсказуемо. Скучно. Поэтому я решил устроить особый стресс-тест, соревнование немного иного формата, проверка на предельную прочность на табличных данных. Да... еще среди участников забега будет один новичок, о котором большинство читателей, вероятно, слышит впервые. Он не раскручен и не имеет армии поклонников на Kaggle. Но уже имеет красивое название – Полигармонический каскад. Это глубокая архитектура, выведенная из принципов теории случайных функций и индифферентности. В этом тестировании он выступал в роли новичка-аутсайдера. Но то, что он сделал с фаворитами, выглядит как читерство. Но об этом позже. Итак, что же это за задача?

    habr.com/ru/articles/1044858/

    #машинное+обучение #нейросети #benchmark #сравнение_моделей #lightgbm #xgboost #catboost #random_forest #исследование

  6. Я выяснил, что Яндекс Музыка на треть состоит из нейрослопа

    Возможно вы уже знаете, что в чарт «Яндекс Музыки» залетают треки, сгенерированные ИИ. Например, перепевка стихотворения Есенина «Сыпь, гармоника», которая сейчас на 16 месте чарта. Или трек «Ярмарка судеб» исполнителя Alena, который был даже спет в эфире телеканала Россия 1 . Мне нравились алгоритмы «Яндекс Музыки». Благодаря им в своё время я открыл много малоизвестных артистов, которых слушаю до сих пор. Но с появлением Suno, Lyria, Udio, алгоритмами рекомендаций Яндекса пользоваться стало невозможно. Мне то и дело подсовывались низкокачественные ИИ-треки. В какой-то момент меня это достало. Я провёл своё расследование и получил неутешительные результаты. В базе «Яндекс Музыки» сейчас как минимум 77 тысяч ИИ-исполнителей . Ежемесячно они загружают от 100 тысяч ИИ-треков , что составляет примерно треть от всех загружаемых треков. А каждый 10-й трек в чарте – сгенерирован ИИ . И «Яндекс» ничего с этим не делает. Читать результаты расследования

    habr.com/ru/articles/1036166/

    #ии #нейросети #музыка #машинное_обучение #xgboost #расширения_браузеров #python #typescript

  7. Книга: «Машинное обучение на табличных данных: XGBoost, глубокое обучение и ИИ»

    Привет, Хаброжители! Машинное обучение может ускорить выполнение повседневных бизнес-задач, таких как сверка счетов, прогнозирование спроса или автоматизация обслуживания клиентов, не говоря уже о более сложных задачах, например выявление мошенничества, прогнозное техническое обслуживание и персонализированный маркетинг. Извлекайте важную информацию из электронных таблиц, реестров, баз данных и других источников, используя градиентный бустинг, глубокое обучение и генеративный ИИ.

    habr.com/ru/companies/piter/ar

    #анализ #данные #data #ИИ #машинное #обучение #xgboost

  8. Симулятор JWST на Python: как критика Хабра заставила выучить астрофизику и почему мы сделаем открытие раньше NASA

    Некоторое время назад я пришел на Хабр с простеньким ML-скриптом, который искал обитаемые экзопланеты. Я ждал похвалы, но вместо этого получил в комментариях ведро ледяной воды: "Где валидация? Что будет при сдвиге распределения? Машинное обучение без физических лимитов — это декорация!" . Вызов был принят. Я выбросил наивный подход, запер XGBoost в клетку суровых законов термодинамики и переписал всё с нуля. Спустя недели разработки и чтения научных статей я представляю ExoLogica AI 2.0 . Теперь это не табличный калькулятор, а 14-ступенчатый астрофизический конвейер. Он считает долю железного ядра, оценивает гидродинамическое сдувание атмосферы и — самое главное — генерирует синтетические спектры для телескопа Джеймса Уэбба (JWST) на лету . Под катом: почему знаменитый индекс подобия Земле (ESI) безнадежно устарел, за что наш скрипт выбросил в мусорку кандидатов от Корнеллского университета, и почему гаражный опенсорс с Хабра имеет все шансы сделать великое открытие раньше, чем бюрократы из NASA.

    habr.com/ru/articles/1017754/

    #экзопланеты #JWST #машинное_обучение #астрофизика #python #XGBoost #NASA #биосигнатуры #открытая_наука #спектроскопия

  9. Как мы сломали индекс обитаемости экзопланет: Парадокс ESI, Physics-Informed ML и 9600 фейковых «Земель»

    В прошлой нашей статье мы рассказывали, как написали программу ExoLogica AI для анализа экзопланет. В комментариях Senior Data Scientist'ы справедливо разнесли нас за то, что наша нейросеть ничего не знала об уравнении состояния вещества (не хватало inductive bias ). Мы признали критику, ушли переписывать архитектуру и внедрили полноценный Physics-Informed ML. Но когда мы запустили гибридную модель v2.0, мы обнаружили нечто пугающее. Оказалось, что главный астрономический Индекс Подобия Земле (ESI) систематически лжет . Рассказываем, как мы открыли «Парадокс ESI», ввели собственный индекс физической реализуемости (PRI) и математически доказали, что 71% так называемых «вторых Земель» — это просто куски раскаленного чугуна. И о том, как пара строк кода на Python сократила каталог из 9600 планет до 37 реальных миров, утерев нос популярным спискам обсерваторий.

    habr.com/ru/articles/1016666/

    #экзопланеты #машинное_обучение #астрофизика #jwst #анализ_данных #xgboost #nasa #физика

  10. Космос из школьного кабинета: Как мы научили ИИ законам Кеплера после «разноса» от ученых

    Существует стереотип, что современная наука об экзопланетах — это прерогатива NASA и ученых с миллионными грантами. Мы — команда обычных школьников и наш наставник — решили доказать, что для открытия новых миров достаточно ноутбука, Python и понимания того, что Машинное Обучение (ML) без физики — это просто генератор случайных чисел. Это история проекта ExoLogica AI : путь от сокрушительного провала на конференции до создания гибридного интеллекта, который видит то, что иногда пропускают профессиональные телескопы.

    habr.com/ru/articles/1016416/

    #экзопланеты #Астрофизика #машинное_обучение #Python #XGBoost #ExoLogica_AI #Kepler #NASA #KOI4878_b_масса #KOI4878_b

  11. How I Built a Machine Learning Tool to Predict Drug Manufacturing Failures

    A bioprocess engineer's journey into machine learning and why the pharmaceutical industry desperately needs this bridge When I tell people I work in bioprocess engineering, I usually get blank stares. When I explain that I help manufacture proteins in giant tanks for therapeutic use, the response is often: "Oh, like brewing beer?" Not quite. But close enough. What I don't usually mention is that I've been teaching myself machine learning on nights and weekends. Not because it's trendy, but […]

    kemal.yaylali.uk/from-bioreact

  12. Improving Forest Loss Mapping In Nepal Using Landtrendr Time-Series And Machine Learning
    --
    doi.org/10.1016/j.rsase.2025.1 <-- share paper
    --
    “HIGHLIGHTS:
    • ViT-based forest mask, multispectral ensemble LandTrendr and terrain shadow mask.
    • District-level RF/XGBoost model training with expert-weighted validation.
    • Outperformed GFC and REDD + AI benchmarks in accuracy and F1 performance.
    • RF excelled in High Mountains/Himalayas; XGBoost in the lower Mountain regions.
    • NBR contributed the most; snow-impacted forest loss uncertainty was observed..."
    #Forestdisturbance #forest #disturbance #remotesensing #LandTrendr #workflow #timeseries #ViT #RF #XGBoost #GEE #Nepal #ForestNepal #spatial #GIS #mapping #earthobservation #landsat #Himalayas #mountains #alpine #vegetation #AI #multispectral #monitoring #spatialanalysis #spatiotemporal #loss #change #machinelearning #NDR #conservation #planning #policy #mitagion #ecology #Karnali #Bagmati, #Darchula #Siwalik #GlobalForestChange #Degradation

  13. Борьба с дисбалансом классов. Ансамблевые и комбинированные методы

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это четвертая часть цикла о борьбе с дисбалансом классов. Предыдущие статьи: - В первой статье мы рассказали про суть проблемы дисбаланса классов и стандартные методы борьбы с ним; - Во второй статье обсуждались методы undersampling - удаление данных из распространенного класса; - В третьей статье рассматривались методы oversampling - генерация примеров редкого класса. В данной части мы рассмотрим комбинированные и ансамблевые методы библиотеки Imbalanced Learn .

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #oversampling #баланс_классов

  14. Борьба с дисбалансом классов. Oversampling

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это третья статья в цикле публикаций по теме борьбы с проблемой дисбаланса классов в машинном обучении. В первой статье мы обсудили актуальность данной проблемы в машинном обучении, а также сравнили методы борьбы с ним, без внесения изменений в сами данные: изменение весов классов и порога принятия решения моделью. Во второй статье мы сравнивали undersampling-методы, которые удаляли представителей частого класса. В данной части мы протестируем методы балансировки данных методом oversampling из библиотеки imblearn . Суть данного метода заключается в том, что мы пытаемся бороться с дисбалансом классов генерируя данные для редкого класса. Мы рассмотрим разные способы генерации таких данных и протестируем их на синтетических данных.

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #oversampling #баланс_классов

  15. XGBoost альтернатива CatBoost для работы с категориальными данными???

    Новый категориальный ре-кодер в XGBoost обещает избавить нас от рутины ручного кодирования и опередит CatBoost по качеству работы с категориальными данными?

    habr.com/ru/articles/965382/

    #xgboost #catboost #boosting #категориальные_данные #категориальные_признаки #сырые_данные

  16. Борьба с дисбалансом классов. Undersampling

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это вторая статья в цикле публикаций по теме борьбы с дисбалансом классов в машинном обучении. В предыдущей статье мы рассмотрели актуальность данной проблемы и сравнили методы борьбы без внесения изменений в данные: балансировка весов классов и изменение порога принятия решения моделью. В данной части будем тестировать балансировку данных методом undersampling из библиотеки imblearn.

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #баланс_классов #undersampling

  17. Лучшие фреймворки для машинного обучения в 2025 году

    Сегодня ни один крупный проект в области машинного обучения (ML) не обходится без фреймворков — готовых наборов библиотек, в которых базовые алгоритмы уже оптимизированы для различных архитектур. Выбор правильного фреймворка не только упрощает разработку, но и определяет успех проектов по внедрению искусственного интеллекта. В этой статье эксперты лаборатории искусственного интеллекта российской ИТ-компании «Криптонит» рассматривают самые актуальные фреймворки для машинного обучения, анализируют причины их популярности, ключевые области применения и тенденции развития. Аналитика строится как на собственном опыте, так и на данных специализированных источников, таких как GeeksforGeeks, Upgrad, Octal Software и других, чтобы предоставить аргументированный и непредвзятый обзор. Мы разделили обзор на две части. В первой рассматриваются фреймворки для глубокого обучения. Они ориентированы на построение и обучение нейронных сетей, в том числе сложных архитектур, таких как свёрточные модели и трансформеры. Вторая часть посвящена фреймворкам для классического машинного обучения. Они используются для работы с моделями, основанными на регрессии, решающих деревьях, методах ансамблирования (например, бустинг) и других алгоритмах без использования глубоких нейросетей.

    habr.com/ru/companies/kryptoni

    #машинное+обучение #фреймворки #ML #pytorch #tensorflow #scikitlearn #xgboost #catboost #lightgbm #jax

  18. Как мы создали систему раннего предупреждения импульсивных торговых решений: опыт отдела Rapid и Лаборатории инноваций

    Система раннего предупреждения импульсивных торговых решений 🚨 Как машинное обучение помогает предотвратить эмоциональные ошибки в трейдинге Импульсивные решения — главный враг трейдера. Эмоциональные сделки, увеличение позиций после потерь, торговля в ночное время — все это приводит к убыткам даже у опытных участников рынка. В этой статье я расскажу, как с помощью анализа данных и машинного обучения создать систему, которая заранее предупреждает о высоком риске принятия импульсивного решения. Что вы узнаете: • Какие поведенческие паттерны выдают склонность к импульсивным решениям • Как XGBoost и логистическая регрессия помогают выявить "группы риска" • Практические рекомендации по внедрению системы предупреждений • Реальные результаты анализа данных 1000+ трейдеров Ключевые находки: 88% точность предсказания импульсивных решений 5 основных факторов риска, которые можно отслеживать автоматически Снижение убыточных сделок на 23% при использовании системы Статья будет полезна как начинающим трейдерам, так и разработчикам торговых систем. Все графики, код и методология — в открытом доступе. #машинноеобучение #трейдинг #анализданных #финтех #python #xgboost

    habr.com/ru/companies/moex/art

    #инвестиции #ml #иновации #трейдинг #mlops #машинное+обучение #биржа

  19. Анализ и прогнозирование погодных условий

    Настоящее исследование посвящено комплексному анализу глобальных климатических изменений на основе исторических метеорологических данных за период с 1950 по 2024 год. Мы фокусируемся на шести ключевых странах, представляющих основные климатические зоны планеты.

    habr.com/ru/articles/913712/

    #Прогнозирование_погоды #Meteostat #postgresql #lstm #xgboost

  20. Looking for open spaces at #PyConUS? Here are the ones starting at 3:00 PM:

    Room 308: Data Engineering Meetup
    Room 309: #Python for Science & Research
    Room 316: @gnuradio / Ham Radio
    Room 318: Tabular ML (@sklearn, #XGBoost, #CatBoost, & friends)
    Room 320: Pythonic Music: MIDI, Synthesis and more

    us.pycon.org/2025/schedule/ope

    #PyConUS2025 #PyConUSOpenSpaces

  21. Как спрогнозировать вес птицы с помощью XGBoost: от предобработки данных до оптимизации модели

    Привет, Хабр! Вот когда каждый грамм действительно имеет значение: если вам нужно спрогнозировать вес птицы перед продажей, чтобы экономить на кормах и оптимизировать производство. Меня зовут Михаил Чирков, я data scientist в R-Style Softlab и сегодня хочу поделиться с вами кейсом прогнозирования с помощью XGBoost, этот проект мы делали в рамках внедрения BI-системы для птицефабрики.

    habr.com/ru/companies/rshb/art

    #XGBoost #CatBoost #Градиентный_бустинг #машинное_обучение

  22. Today I’m teaching a new course on classic #machinelearning at @efrei
    Remember #XGBoost ? It was all the rage not so long ago. Feels like reconnecting with an old friend.

  23. I appreciate the effort in this article on customer #churn prediction in Nature Scientific Reports - and I must give some serious criticism:

    1. Gradient boosting (#XGBoost or LGBM) is state of the art for practitioners in the real world. I don't believe they put much effort into tuning their benchmark models, so I don't believe the claims of higher accuracy. (#ML researchers always do this - they slave away tuning their preferred model, and use their benchmarks "as is" without tuning.)