#xgboost — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #xgboost, aggregated by home.social.
-
TabFM против XGBoost: 5 фактов, которых нет в релизе
TabFM умеет получать предсказания по таблицам без обучения на конкретном датасете — и на бенчмарках уже обходит настроенный бустинг. Разбираемся, насколько убедительны эти результаты, где у модели заканчивается преимущество и что изменится для тех, кто держит табличный ML в проде.
https://habr.com/ru/companies/otus/articles/1067734/
#TabFM #XGBoost #CatBoost #табличныеданные #градиентныйбустинг #foundationmodels #zeroshot #машинноеобучение #бенчмарк
-
От Django-дневника к интеллектуальной системе поддержки диабета: математика, SPA и машинное обучение
В предыдущих статьях я рассказывал, как появился веб-дневник диабета на Django и как постепенно оптимизировалась его производительность. Проект начинался довольно типично: пользователь вводил показатели сахара, записывал приемы пищи и дозы инсулина, а система сохраняла их в базе данных и отображала на графиках. Со временем дневник перестал быть просто электронным блокнотом. Данных становилось все больше, а вместе с ними появлялись и новые вопросы. Главный из них звучал очень просто:
https://habr.com/ru/articles/1054862/
#Django #Python #машинное_обучение #XGBoost #CatBoost #прогнозирование_глюкозы #сахарный_диабет #непрерывный_мониторинг_глюкозы #Feature_Engineering #SPA
-
Треть новых релизов на Яндекс Музыке – ИИ. Теперь точно
Прошло полтора месяца с публикации моей статьи « Я выяснил, что Яндекс Музыка на треть состоит из нейрослопа ». Всё это время я продолжал исследовать тему определения ИИ в музыке. Итогом изысканий стал алгоритм, позволяющий определять сгенерированные треки с точностью, близкой к 100%. Кроме того, я проанализировал релизы в Яндекс Музыке за первое полугодие 2026 года и выяснил, что 37% всех новых релизов имеют признаки ИИ-музыки. А если учитывать только релизы с лайками, то количество нейромузыки достигает 50%. В этой статье я подробно расскажу, как работает алгоритм детекта ИИ-музыки, почему для него не требуется GPU, а также покажу аналитику по Яндекс Музыке.
-
Как глушить нефтяную скважину… машинным обучением. Часть 2, техническая
Продолжаю рассказывать широкой общественности об интересном ML проекте, результаты которого внедряются в реальный технологический процесс. В первой части разобрались, что такое глушение и почему важно уметь рассчитывать объемы жидкостей глушения. В этой части будет непосредственно все то, как мы решали эту задачу с помощью МЛ: Построили двухконтурную систему: офлайн-обучение на XGBoost и CatBoost — и лeгкий онлайн-инференс через Flask. Вместо одного .fit() с дефолтным лоссом внедрили K‑method — асимметричную функцию потерь. Теперь модель «боится» недолить жидкость сильнее, чем перелить, потому что в реальности эти ошибки стоят по-разному. CatBoost лучше по удобству работы с «сырыми» категориями, XGBoost потребовал кастомного кодирования, но дал сравнимые метрики. На малых данных (~350 строк) случайное разбиение творит хаос: метрики скачут от сида к сиду. Поэтому отбираем топ‑20 лучших random_state, а гиперпараметры усредняем частотным методом. Весь пайплайн — от подбора параметров до прогона K‑сетки — завернули в Airflow ради повторяемости, а все эксперименты и логи складываем в MLflow.
https://habr.com/ru/articles/1045256/
#Глушение_скважин #нефтяные_скважины #нефтяная_промышленность #машинное_обучение #промышленность #промышленное_программирование #catboost #xgboost #месторождение #tradeoff
-
Поиск черной кошки в 2000-мерной темной комнате. Турнир алгоритмов машинного обучения
Добро пожаловать на мой маленький тестовый полигон. В этой статье я расскажу, как столкнул лбами двадцать один алгоритм машинного обучения - от старой доброй линейной регрессии, KNN, случайного леса до троицы табличных королей (XGBoost, LightGBM, CatBoost), нескольких многослойных нейросетей и нейросетей с механизмом внимания. И я заставил их всех решать задачу, которая на первый взгляд кажется абсурдной (только на первый взгляд?). Большинство бенчмарков в машинном обучении вроде MNIST или Titanic давно натренированы до дыр. На картинках побеждают свертки, а на табличных данных – градиентный бустинг. Предсказуемо. Скучно. Поэтому я решил устроить особый стресс-тест, соревнование немного иного формата, проверка на предельную прочность на табличных данных. Да... еще среди участников забега будет один новичок, о котором большинство читателей, вероятно, слышит впервые. Он не раскручен и не имеет армии поклонников на Kaggle. Но уже имеет красивое название – Полигармонический каскад. Это глубокая архитектура, выведенная из принципов теории случайных функций и индифферентности. В этом тестировании он выступал в роли новичка-аутсайдера. Но то, что он сделал с фаворитами, выглядит как читерство. Но об этом позже. Итак, что же это за задача?
https://habr.com/ru/articles/1044858/
#машинное+обучение #нейросети #benchmark #сравнение_моделей #lightgbm #xgboost #catboost #random_forest #исследование
-
Я выяснил, что Яндекс Музыка на треть состоит из нейрослопа
Возможно вы уже знаете, что в чарт «Яндекс Музыки» залетают треки, сгенерированные ИИ. Например, перепевка стихотворения Есенина «Сыпь, гармоника», которая сейчас на 16 месте чарта. Или трек «Ярмарка судеб» исполнителя Alena, который был даже спет в эфире телеканала Россия 1 . Мне нравились алгоритмы «Яндекс Музыки». Благодаря им в своё время я открыл много малоизвестных артистов, которых слушаю до сих пор. Но с появлением Suno, Lyria, Udio, алгоритмами рекомендаций Яндекса пользоваться стало невозможно. Мне то и дело подсовывались низкокачественные ИИ-треки. В какой-то момент меня это достало. Я провёл своё расследование и получил неутешительные результаты. В базе «Яндекс Музыки» сейчас как минимум 77 тысяч ИИ-исполнителей . Ежемесячно они загружают от 100 тысяч ИИ-треков , что составляет примерно треть от всех загружаемых треков. А каждый 10-й трек в чарте – сгенерирован ИИ . И «Яндекс» ничего с этим не делает. Читать результаты расследования
https://habr.com/ru/articles/1036166/
#ии #нейросети #музыка #машинное_обучение #xgboost #расширения_браузеров #python #typescript
-
Книга: «Машинное обучение на табличных данных: XGBoost, глубокое обучение и ИИ»
Привет, Хаброжители! Машинное обучение может ускорить выполнение повседневных бизнес-задач, таких как сверка счетов, прогнозирование спроса или автоматизация обслуживания клиентов, не говоря уже о более сложных задачах, например выявление мошенничества, прогнозное техническое обслуживание и персонализированный маркетинг. Извлекайте важную информацию из электронных таблиц, реестров, баз данных и других источников, используя градиентный бустинг, глубокое обучение и генеративный ИИ.
-
Comparative Analysis Of Seagrass Biophysical Properties Mapping Using Multi-Resolution Satellite Imagery And Machine Learning In The Shallow Waters Of Teluk Pandan, Lampung, Indonesia
--
https://doi.org/10.1016/j.rsase.2026.102002 <-- shared paper
--
#GIS #spatial #mapping #Seagrass #monitoring #conservation #accuracy #vegetation #biophysical #benthic #habitat #composition #carbonmapping #Randomforest #ExtremeGradientBoosting #XGBoost algorithms #Sentinel2 #remotesensing #sensor #shallowwater #sentinel #PlanetScope #satellite #TelukPandan #Lampung #Indonesia #AI #deeplearning #machinelearning #model #modeling #water #marine #ocean #habitat #ecosystem #spatialanalysis -
Симулятор JWST на Python: как критика Хабра заставила выучить астрофизику и почему мы сделаем открытие раньше NASA
Некоторое время назад я пришел на Хабр с простеньким ML-скриптом, который искал обитаемые экзопланеты. Я ждал похвалы, но вместо этого получил в комментариях ведро ледяной воды: "Где валидация? Что будет при сдвиге распределения? Машинное обучение без физических лимитов — это декорация!" . Вызов был принят. Я выбросил наивный подход, запер XGBoost в клетку суровых законов термодинамики и переписал всё с нуля. Спустя недели разработки и чтения научных статей я представляю ExoLogica AI 2.0 . Теперь это не табличный калькулятор, а 14-ступенчатый астрофизический конвейер. Он считает долю железного ядра, оценивает гидродинамическое сдувание атмосферы и — самое главное — генерирует синтетические спектры для телескопа Джеймса Уэбба (JWST) на лету . Под катом: почему знаменитый индекс подобия Земле (ESI) безнадежно устарел, за что наш скрипт выбросил в мусорку кандидатов от Корнеллского университета, и почему гаражный опенсорс с Хабра имеет все шансы сделать великое открытие раньше, чем бюрократы из NASA.
https://habr.com/ru/articles/1017754/
#экзопланеты #JWST #машинное_обучение #астрофизика #python #XGBoost #NASA #биосигнатуры #открытая_наука #спектроскопия
-
Как мы сломали индекс обитаемости экзопланет: Парадокс ESI, Physics-Informed ML и 9600 фейковых «Земель»
В прошлой нашей статье мы рассказывали, как написали программу ExoLogica AI для анализа экзопланет. В комментариях Senior Data Scientist'ы справедливо разнесли нас за то, что наша нейросеть ничего не знала об уравнении состояния вещества (не хватало inductive bias ). Мы признали критику, ушли переписывать архитектуру и внедрили полноценный Physics-Informed ML. Но когда мы запустили гибридную модель v2.0, мы обнаружили нечто пугающее. Оказалось, что главный астрономический Индекс Подобия Земле (ESI) систематически лжет . Рассказываем, как мы открыли «Парадокс ESI», ввели собственный индекс физической реализуемости (PRI) и математически доказали, что 71% так называемых «вторых Земель» — это просто куски раскаленного чугуна. И о том, как пара строк кода на Python сократила каталог из 9600 планет до 37 реальных миров, утерев нос популярным спискам обсерваторий.
https://habr.com/ru/articles/1016666/
#экзопланеты #машинное_обучение #астрофизика #jwst #анализ_данных #xgboost #nasa #физика
-
Космос из школьного кабинета: Как мы научили ИИ законам Кеплера после «разноса» от ученых
Существует стереотип, что современная наука об экзопланетах — это прерогатива NASA и ученых с миллионными грантами. Мы — команда обычных школьников и наш наставник — решили доказать, что для открытия новых миров достаточно ноутбука, Python и понимания того, что Машинное Обучение (ML) без физики — это просто генератор случайных чисел. Это история проекта ExoLogica AI : путь от сокрушительного провала на конференции до создания гибридного интеллекта, который видит то, что иногда пропускают профессиональные телескопы.
https://habr.com/ru/articles/1016416/
#экзопланеты #Астрофизика #машинное_обучение #Python #XGBoost #ExoLogica_AI #Kepler #NASA #KOI4878_b_масса #KOI4878_b
-
How I Built a Machine Learning Tool to Predict Drug Manufacturing Failures
A bioprocess engineer's journey into machine learning and why the pharmaceutical industry desperately needs this bridge When I tell people I work in bioprocess engineering, I usually get blank stares. When I explain that I help manufacture proteins in giant tanks for therapeutic use, the response is often: "Oh, like brewing beer?" Not quite. But close enough. What I don't usually mention is that I've been teaching myself machine learning on nights and weekends. Not because it's trendy, but […] -
Improving Forest Loss Mapping In Nepal Using Landtrendr Time-Series And Machine Learning
--
https://doi.org/10.1016/j.rsase.2025.101864 <-- share paper
--
“HIGHLIGHTS:
• ViT-based forest mask, multispectral ensemble LandTrendr and terrain shadow mask.
• District-level RF/XGBoost model training with expert-weighted validation.
• Outperformed GFC and REDD + AI benchmarks in accuracy and F1 performance.
• RF excelled in High Mountains/Himalayas; XGBoost in the lower Mountain regions.
• NBR contributed the most; snow-impacted forest loss uncertainty was observed..."
#Forestdisturbance #forest #disturbance #remotesensing #LandTrendr #workflow #timeseries #ViT #RF #XGBoost #GEE #Nepal #ForestNepal #spatial #GIS #mapping #earthobservation #landsat #Himalayas #mountains #alpine #vegetation #AI #multispectral #monitoring #spatialanalysis #spatiotemporal #loss #change #machinelearning #NDR #conservation #planning #policy #mitagion #ecology #Karnali #Bagmati, #Darchula #Siwalik #GlobalForestChange #Degradation -
-
Борьба с дисбалансом классов. Ансамблевые и комбинированные методы
Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это четвертая часть цикла о борьбе с дисбалансом классов. Предыдущие статьи: - В первой статье мы рассказали про суть проблемы дисбаланса классов и стандартные методы борьбы с ним; - Во второй статье обсуждались методы undersampling - удаление данных из распространенного класса; - В третьей статье рассматривались методы oversampling - генерация примеров редкого класса. В данной части мы рассмотрим комбинированные и ансамблевые методы библиотеки Imbalanced Learn .
https://habr.com/ru/companies/kozhindev/articles/975626/
#машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #oversampling #баланс_классов
-
Борьба с дисбалансом классов. Oversampling
Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это третья статья в цикле публикаций по теме борьбы с проблемой дисбаланса классов в машинном обучении. В первой статье мы обсудили актуальность данной проблемы в машинном обучении, а также сравнили методы борьбы с ним, без внесения изменений в сами данные: изменение весов классов и порога принятия решения моделью. Во второй статье мы сравнивали undersampling-методы, которые удаляли представителей частого класса. В данной части мы протестируем методы балансировки данных методом oversampling из библиотеки imblearn . Суть данного метода заключается в том, что мы пытаемся бороться с дисбалансом классов генерируя данные для редкого класса. Мы рассмотрим разные способы генерации таких данных и протестируем их на синтетических данных.
https://habr.com/ru/companies/kozhindev/articles/968714/
#машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #oversampling #баланс_классов
-
XGBoost альтернатива CatBoost для работы с категориальными данными???
Новый категориальный ре-кодер в XGBoost обещает избавить нас от рутины ручного кодирования и опередит CatBoost по качеству работы с категориальными данными?
https://habr.com/ru/articles/965382/
#xgboost #catboost #boosting #категориальные_данные #категориальные_признаки #сырые_данные
-
Борьба с дисбалансом классов. Undersampling
Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это вторая статья в цикле публикаций по теме борьбы с дисбалансом классов в машинном обучении. В предыдущей статье мы рассмотрели актуальность данной проблемы и сравнили методы борьбы без внесения изменений в данные: балансировка весов классов и изменение порога принятия решения моделью. В данной части будем тестировать балансировку данных методом undersampling из библиотеки imblearn.
https://habr.com/ru/companies/kozhindev/articles/954402/
#машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #баланс_классов #undersampling
-
Лучшие фреймворки для машинного обучения в 2025 году
Сегодня ни один крупный проект в области машинного обучения (ML) не обходится без фреймворков — готовых наборов библиотек, в которых базовые алгоритмы уже оптимизированы для различных архитектур. Выбор правильного фреймворка не только упрощает разработку, но и определяет успех проектов по внедрению искусственного интеллекта. В этой статье эксперты лаборатории искусственного интеллекта российской ИТ-компании «Криптонит» рассматривают самые актуальные фреймворки для машинного обучения, анализируют причины их популярности, ключевые области применения и тенденции развития. Аналитика строится как на собственном опыте, так и на данных специализированных источников, таких как GeeksforGeeks, Upgrad, Octal Software и других, чтобы предоставить аргументированный и непредвзятый обзор. Мы разделили обзор на две части. В первой рассматриваются фреймворки для глубокого обучения. Они ориентированы на построение и обучение нейронных сетей, в том числе сложных архитектур, таких как свёрточные модели и трансформеры. Вторая часть посвящена фреймворкам для классического машинного обучения. Они используются для работы с моделями, основанными на регрессии, решающих деревьях, методах ансамблирования (например, бустинг) и других алгоритмах без использования глубоких нейросетей.
https://habr.com/ru/companies/kryptonite/articles/950236/
#машинное+обучение #фреймворки #ML #pytorch #tensorflow #scikitlearn #xgboost #catboost #lightgbm #jax
-
Как мы создали систему раннего предупреждения импульсивных торговых решений: опыт отдела Rapid и Лаборатории инноваций
Система раннего предупреждения импульсивных торговых решений 🚨 Как машинное обучение помогает предотвратить эмоциональные ошибки в трейдинге Импульсивные решения — главный враг трейдера. Эмоциональные сделки, увеличение позиций после потерь, торговля в ночное время — все это приводит к убыткам даже у опытных участников рынка. В этой статье я расскажу, как с помощью анализа данных и машинного обучения создать систему, которая заранее предупреждает о высоком риске принятия импульсивного решения. Что вы узнаете: • Какие поведенческие паттерны выдают склонность к импульсивным решениям • Как XGBoost и логистическая регрессия помогают выявить "группы риска" • Практические рекомендации по внедрению системы предупреждений • Реальные результаты анализа данных 1000+ трейдеров Ключевые находки: 88% точность предсказания импульсивных решений 5 основных факторов риска, которые можно отслеживать автоматически Снижение убыточных сделок на 23% при использовании системы Статья будет полезна как начинающим трейдерам, так и разработчикам торговых систем. Все графики, код и методология — в открытом доступе. #машинноеобучение #трейдинг #анализданных #финтех #python #xgboost
https://habr.com/ru/companies/moex/articles/921284/
#инвестиции #ml #иновации #трейдинг #mlops #машинное+обучение #биржа
-
Анализ и прогнозирование погодных условий
Настоящее исследование посвящено комплексному анализу глобальных климатических изменений на основе исторических метеорологических данных за период с 1950 по 2024 год. Мы фокусируемся на шести ключевых странах, представляющих основные климатические зоны планеты.
https://habr.com/ru/articles/913712/
#Прогнозирование_погоды #Meteostat #postgresql #lstm #xgboost
-
Looking for open spaces at #PyConUS? Here are the ones starting at 3:00 PM:
Room 308: Data Engineering Meetup
Room 309: #Python for Science & Research
Room 316: @gnuradio / Ham Radio
Room 318: Tabular ML (@sklearn, #XGBoost, #CatBoost, & friends)
Room 320: Pythonic Music: MIDI, Synthesis and more -
Как спрогнозировать вес птицы с помощью XGBoost: от предобработки данных до оптимизации модели
Привет, Хабр! Вот когда каждый грамм действительно имеет значение: если вам нужно спрогнозировать вес птицы перед продажей, чтобы экономить на кормах и оптимизировать производство. Меня зовут Михаил Чирков, я data scientist в R-Style Softlab и сегодня хочу поделиться с вами кейсом прогнозирования с помощью XGBoost, этот проект мы делали в рамках внедрения BI-системы для птицефабрики.
-
Today I’m teaching a new course on classic #machinelearning at @efrei
Remember #XGBoost ? It was all the rage not so long ago. Feels like reconnecting with an old friend. -
I appreciate the effort in this article on customer #churn prediction in Nature Scientific Reports - and I must give some serious criticism:
1. Gradient boosting (#XGBoost or LGBM) is state of the art for practitioners in the real world. I don't believe they put much effort into tuning their benchmark models, so I don't believe the claims of higher accuracy. (#ML researchers always do this - they slave away tuning their preferred model, and use their benchmarks "as is" without tuning.)
-
#python #machinelearning #artificialintelligence #technology #riskmanagement
#forecasting #timeseries
#trading #investment
#XGBoost vs #GARCHHow XGBoost Outperforms GARCH in S&P 500 Volatility Prediction
^GSPC monthly volatility prediction by leveraging the ML-type XGBoost model vs AIC-optimized GARCH in Python
-
🚀 Day 6 of my 30 Kaggle Challenges in 30 Days is live! Today, I'm tackling a multi-class prediction problem to assess obesity risk using various ML models. 🤖 Tuned #XGBoost, explored #ModelStacking, and much more!
🔗 Blog: https://surajwate.com/blog/multi-class-prediction-of-obesity-risk/
📊 Notebook: https://www.kaggle.com/code/surajwate/s4e2-prediction-of-obesity-risk
📁 Code: https://github.com/surajwate/S4E2-Multi-Class-Prediction-of-Obesity-Risk#DataScience #MachineLearning #Kaggle #Python #XGBoost #MultiClassClassification #ObesityRisk #AI #30DaysOfKaggle