home.social

#lightgbm — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #lightgbm, aggregated by home.social.

  1. Слишком хороший признак: как звёзды, галактики и квазары научили меня не верить графикам

    На Kaggle завершился шестой эпизод Playground Series , и тема на этот раз была астрономическая: по горстке чисел определить, что перед нами: звезда, галактика или квазар. По этому выпуску я решил собрать почти исчерпывающий разбор EDA.

    habr.com/ru/articles/1056802/

    #kaggle #EDA #разведочный_анализ_данных #машинное_обучение #кроссвалидация #balanced_accuracy #LightGBM #астрономия #SDSS #отбор_признаков

  2. Слишком хороший признак: как звёзды, галактики и квазары научили меня не верить графикам

    На Kaggle завершился шестой эпизод Playground Series , и тема на этот раз была астрономическая: по горстке чисел определить, что перед нами: звезда, галактика или квазар. По этому выпуску я решил собрать почти исчерпывающий разбор EDA.

    habr.com/ru/articles/1056802/

    #kaggle #EDA #разведочный_анализ_данных #машинное_обучение #кроссвалидация #balanced_accuracy #LightGBM #астрономия #SDSS #отбор_признаков

  3. Слишком хороший признак: как звёзды, галактики и квазары научили меня не верить графикам

    На Kaggle завершился шестой эпизод Playground Series , и тема на этот раз была астрономическая: по горстке чисел определить, что перед нами: звезда, галактика или квазар. По этому выпуску я решил собрать почти исчерпывающий разбор EDA.

    habr.com/ru/articles/1056802/

    #kaggle #EDA #разведочный_анализ_данных #машинное_обучение #кроссвалидация #balanced_accuracy #LightGBM #астрономия #SDSS #отбор_признаков

  4. Поиск черной кошки в 2000-мерной темной комнате. Турнир алгоритмов машинного обучения

    Добро пожаловать на мой маленький тестовый полигон. В этой статье я расскажу, как столкнул лбами двадцать один алгоритм машинного обучения - от старой доброй линейной регрессии, KNN, случайного леса до троицы табличных королей (XGBoost, LightGBM, CatBoost), нескольких многослойных нейросетей и нейросетей с механизмом внимания. И я заставил их всех решать задачу, которая на первый взгляд кажется абсурдной (только на первый взгляд?). Большинство бенчмарков в машинном обучении вроде MNIST или Titanic давно натренированы до дыр. На картинках побеждают свертки, а на табличных данных – градиентный бустинг. Предсказуемо. Скучно. Поэтому я решил устроить особый стресс-тест, соревнование немного иного формата, проверка на предельную прочность на табличных данных. Да... еще среди участников забега будет один новичок, о котором большинство читателей, вероятно, слышит впервые. Он не раскручен и не имеет армии поклонников на Kaggle. Но уже имеет красивое название – Полигармонический каскад. Это глубокая архитектура, выведенная из принципов теории случайных функций и индифферентности. В этом тестировании он выступал в роли новичка-аутсайдера. Но то, что он сделал с фаворитами, выглядит как читерство. Но об этом позже. Итак, что же это за задача?

    habr.com/ru/articles/1044858/

    #машинное+обучение #нейросети #benchmark #сравнение_моделей #lightgbm #xgboost #catboost #random_forest #исследование

  5. Борьба с дисбалансом классов. Ансамблевые и комбинированные методы

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это четвертая часть цикла о борьбе с дисбалансом классов. Предыдущие статьи: - В первой статье мы рассказали про суть проблемы дисбаланса классов и стандартные методы борьбы с ним; - Во второй статье обсуждались методы undersampling - удаление данных из распространенного класса; - В третьей статье рассматривались методы oversampling - генерация примеров редкого класса. В данной части мы рассмотрим комбинированные и ансамблевые методы библиотеки Imbalanced Learn .

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #oversampling #баланс_классов

  6. Борьба с дисбалансом классов. Ансамблевые и комбинированные методы

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это четвертая часть цикла о борьбе с дисбалансом классов. Предыдущие статьи: - В первой статье мы рассказали про суть проблемы дисбаланса классов и стандартные методы борьбы с ним; - Во второй статье обсуждались методы undersampling - удаление данных из распространенного класса; - В третьей статье рассматривались методы oversampling - генерация примеров редкого класса. В данной части мы рассмотрим комбинированные и ансамблевые методы библиотеки Imbalanced Learn .

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #oversampling #баланс_классов

  7. Борьба с дисбалансом классов. Ансамблевые и комбинированные методы

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это четвертая часть цикла о борьбе с дисбалансом классов. Предыдущие статьи: - В первой статье мы рассказали про суть проблемы дисбаланса классов и стандартные методы борьбы с ним; - Во второй статье обсуждались методы undersampling - удаление данных из распространенного класса; - В третьей статье рассматривались методы oversampling - генерация примеров редкого класса. В данной части мы рассмотрим комбинированные и ансамблевые методы библиотеки Imbalanced Learn .

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #oversampling #баланс_классов

  8. Борьба с дисбалансом классов. Oversampling

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это третья статья в цикле публикаций по теме борьбы с проблемой дисбаланса классов в машинном обучении. В первой статье мы обсудили актуальность данной проблемы в машинном обучении, а также сравнили методы борьбы с ним, без внесения изменений в сами данные: изменение весов классов и порога принятия решения моделью. Во второй статье мы сравнивали undersampling-методы, которые удаляли представителей частого класса. В данной части мы протестируем методы балансировки данных методом oversampling из библиотеки imblearn . Суть данного метода заключается в том, что мы пытаемся бороться с дисбалансом классов генерируя данные для редкого класса. Мы рассмотрим разные способы генерации таких данных и протестируем их на синтетических данных.

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #oversampling #баланс_классов

  9. Борьба с дисбалансом классов. Oversampling

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это третья статья в цикле публикаций по теме борьбы с проблемой дисбаланса классов в машинном обучении. В первой статье мы обсудили актуальность данной проблемы в машинном обучении, а также сравнили методы борьбы с ним, без внесения изменений в сами данные: изменение весов классов и порога принятия решения моделью. Во второй статье мы сравнивали undersampling-методы, которые удаляли представителей частого класса. В данной части мы протестируем методы балансировки данных методом oversampling из библиотеки imblearn . Суть данного метода заключается в том, что мы пытаемся бороться с дисбалансом классов генерируя данные для редкого класса. Мы рассмотрим разные способы генерации таких данных и протестируем их на синтетических данных.

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #oversampling #баланс_классов

  10. Борьба с дисбалансом классов. Oversampling

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это третья статья в цикле публикаций по теме борьбы с проблемой дисбаланса классов в машинном обучении. В первой статье мы обсудили актуальность данной проблемы в машинном обучении, а также сравнили методы борьбы с ним, без внесения изменений в сами данные: изменение весов классов и порога принятия решения моделью. Во второй статье мы сравнивали undersampling-методы, которые удаляли представителей частого класса. В данной части мы протестируем методы балансировки данных методом oversampling из библиотеки imblearn . Суть данного метода заключается в том, что мы пытаемся бороться с дисбалансом классов генерируя данные для редкого класса. Мы рассмотрим разные способы генерации таких данных и протестируем их на синтетических данных.

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #oversampling #баланс_классов

  11. Борьба с дисбалансом классов. Undersampling

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это вторая статья в цикле публикаций по теме борьбы с дисбалансом классов в машинном обучении. В предыдущей статье мы рассмотрели актуальность данной проблемы и сравнили методы борьбы без внесения изменений в данные: балансировка весов классов и изменение порога принятия решения моделью. В данной части будем тестировать балансировку данных методом undersampling из библиотеки imblearn.

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #баланс_классов #undersampling

  12. Борьба с дисбалансом классов. Undersampling

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это вторая статья в цикле публикаций по теме борьбы с дисбалансом классов в машинном обучении. В предыдущей статье мы рассмотрели актуальность данной проблемы и сравнили методы борьбы без внесения изменений в данные: балансировка весов классов и изменение порога принятия решения моделью. В данной части будем тестировать балансировку данных методом undersampling из библиотеки imblearn.

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #баланс_классов #undersampling

  13. Борьба с дисбалансом классов. Undersampling

    Привет, Хабр! На связи KozhinDev и ml-разработчик Приходько Александр. Это вторая статья в цикле публикаций по теме борьбы с дисбалансом классов в машинном обучении. В предыдущей статье мы рассмотрели актуальность данной проблемы и сравнили методы борьбы без внесения изменений в данные: балансировка весов классов и изменение порога принятия решения моделью. В данной части будем тестировать балансировку данных методом undersampling из библиотеки imblearn.

    habr.com/ru/companies/kozhinde

    #машинное_обучение #logistic_regression #xgboost #lightgbm #catboost #баланс_классов #undersampling

  14. Лучшие фреймворки для машинного обучения в 2025 году

    Сегодня ни один крупный проект в области машинного обучения (ML) не обходится без фреймворков — готовых наборов библиотек, в которых базовые алгоритмы уже оптимизированы для различных архитектур. Выбор правильного фреймворка не только упрощает разработку, но и определяет успех проектов по внедрению искусственного интеллекта. В этой статье эксперты лаборатории искусственного интеллекта российской ИТ-компании «Криптонит» рассматривают самые актуальные фреймворки для машинного обучения, анализируют причины их популярности, ключевые области применения и тенденции развития. Аналитика строится как на собственном опыте, так и на данных специализированных источников, таких как GeeksforGeeks, Upgrad, Octal Software и других, чтобы предоставить аргументированный и непредвзятый обзор. Мы разделили обзор на две части. В первой рассматриваются фреймворки для глубокого обучения. Они ориентированы на построение и обучение нейронных сетей, в том числе сложных архитектур, таких как свёрточные модели и трансформеры. Вторая часть посвящена фреймворкам для классического машинного обучения. Они используются для работы с моделями, основанными на регрессии, решающих деревьях, методах ансамблирования (например, бустинг) и других алгоритмах без использования глубоких нейросетей.

    habr.com/ru/companies/kryptoni

    #машинное+обучение #фреймворки #ML #pytorch #tensorflow #scikitlearn #xgboost #catboost #lightgbm #jax

  15. Лучшие фреймворки для машинного обучения в 2025 году

    Сегодня ни один крупный проект в области машинного обучения (ML) не обходится без фреймворков — готовых наборов библиотек, в которых базовые алгоритмы уже оптимизированы для различных архитектур. Выбор правильного фреймворка не только упрощает разработку, но и определяет успех проектов по внедрению искусственного интеллекта. В этой статье эксперты лаборатории искусственного интеллекта российской ИТ-компании «Криптонит» рассматривают самые актуальные фреймворки для машинного обучения, анализируют причины их популярности, ключевые области применения и тенденции развития. Аналитика строится как на собственном опыте, так и на данных специализированных источников, таких как GeeksforGeeks, Upgrad, Octal Software и других, чтобы предоставить аргументированный и непредвзятый обзор. Мы разделили обзор на две части. В первой рассматриваются фреймворки для глубокого обучения. Они ориентированы на построение и обучение нейронных сетей, в том числе сложных архитектур, таких как свёрточные модели и трансформеры. Вторая часть посвящена фреймворкам для классического машинного обучения. Они используются для работы с моделями, основанными на регрессии, решающих деревьях, методах ансамблирования (например, бустинг) и других алгоритмах без использования глубоких нейросетей.

    habr.com/ru/companies/kryptoni

    #машинное+обучение #фреймворки #ML #pytorch #tensorflow #scikitlearn #xgboost #catboost #lightgbm #jax

  16. Лучшие фреймворки для машинного обучения в 2025 году

    Сегодня ни один крупный проект в области машинного обучения (ML) не обходится без фреймворков — готовых наборов библиотек, в которых базовые алгоритмы уже оптимизированы для различных архитектур. Выбор правильного фреймворка не только упрощает разработку, но и определяет успех проектов по внедрению искусственного интеллекта. В этой статье эксперты лаборатории искусственного интеллекта российской ИТ-компании «Криптонит» рассматривают самые актуальные фреймворки для машинного обучения, анализируют причины их популярности, ключевые области применения и тенденции развития. Аналитика строится как на собственном опыте, так и на данных специализированных источников, таких как GeeksforGeeks, Upgrad, Octal Software и других, чтобы предоставить аргументированный и непредвзятый обзор. Мы разделили обзор на две части. В первой рассматриваются фреймворки для глубокого обучения. Они ориентированы на построение и обучение нейронных сетей, в том числе сложных архитектур, таких как свёрточные модели и трансформеры. Вторая часть посвящена фреймворкам для классического машинного обучения. Они используются для работы с моделями, основанными на регрессии, решающих деревьях, методах ансамблирования (например, бустинг) и других алгоритмах без использования глубоких нейросетей.

    habr.com/ru/companies/kryptoni

    #машинное+обучение #фреймворки #ML #pytorch #tensorflow #scikitlearn #xgboost #catboost #lightgbm #jax

  17. В погоне за неизведанным: как ML-модель вредоносы искать училась

    Всем привет! С вами Ксения Наумова. В Positive Technologies я исследую вредоносный сетевой трафик и совершенствую инструменты его анализа в экспертном центре безопасности. Недавно перед нами встала задача — создать ML-модель для обнаружения вредоносного ПО в сети. Причем распознавать она должна была не только уже ранее детектированное нами вредоносное ПО, но и совсем новые угрозы, которые появляются в большом количестве ежедневно. В качестве первого эксперимента решили сделать модель для работы с трафиком, который передается по протоколу HTTP, поскольку наши продукты успешно расшифровывают TLS-сессии, а внутри них частенько можно найти много интересного. В статье я подробно расскажу, как мы обучали модель, и поделюсь информацией о допущенных ошибках.

    habr.com/ru/companies/pt/artic

    #ml #машинное_обучение #песочница #sandbox #сетевой_трафик #детектирование #вредоносное_по #обнаружение_вредоносного_по #lightgbm #датасет

  18. Прогнозируем движение беспилотного автомобиля (или как я вышел в тройку лидеров на Yandex Cup 2024)

    Хабр, привет! Меня зовут Николай Назаров , я работаю аналитиком данных в X5 Tech. Недавно завершился чемпионат по программированию Yandex Cup ML Challenge 2024 , в котором я занял второе место в задаче “Self-driving cars: предсказание движения беспилотного автомобиля”. В статье расскажу про задачу и подходы, которые использовал для решения.

    habr.com/ru/companies/X5Tech/a

    #selfdrivingcar #yandex_cup_2024 #machine_learning #data_science #lightgbm #чемпионат_по_программированию #kaggle #беспилотные_автомобили #python

  19. Рекурсивный отбор признаков. Динамический шаг в танце feature selection

    В статье рассматривается выбор оптимального шага при рекурсивном отборе признаков (RFE). Предлагаются три подхода: фиксированный шаг, динамический шаг, зависящий от количества признаков, и динамический шаг, основанный на значимости признаков. На основе как искусственно сгенерированных, так и реальных наборов данных проводится анализ эффективности каждого метода, выявляются их преимущества и недостатки. Также внимание уделяется недостаткам текущей реализации RFE в библиотеке Scikit-learn, и предлагаются пути их улучшения, а также креативные подходы к решению задач feature selection.

    habr.com/ru/articles/833954/

    #data_science #machine_learning #feature_selection #feature_extraction #отбор_признаков #lightgbm #машинное_обучение

  20. Рекурсивный отбор признаков. Динамический шаг в танце feature selection

    В статье рассматривается выбор оптимального шага при рекурсивном отборе признаков (RFE). Предлагаются три подхода: фиксированный шаг, динамический шаг, зависящий от количества признаков, и динамический шаг, основанный на значимости признаков. На основе как искусственно сгенерированных, так и реальных наборов данных проводится анализ эффективности каждого метода, выявляются их преимущества и недостатки. Также внимание уделяется недостаткам текущей реализации RFE в библиотеке Scikit-learn, и предлагаются пути их улучшения, а также креативные подходы к решению задач feature selection.

    habr.com/ru/articles/833954/

    #data_science #machine_learning #feature_selection #feature_extraction #отбор_признаков #lightgbm #машинное_обучение

  21. Рекурсивный отбор признаков. Динамический шаг в танце feature selection

    В статье рассматривается выбор оптимального шага при рекурсивном отборе признаков (RFE). Предлагаются три подхода: фиксированный шаг, динамический шаг, зависящий от количества признаков, и динамический шаг, основанный на значимости признаков. На основе как искусственно сгенерированных, так и реальных наборов данных проводится анализ эффективности каждого метода, выявляются их преимущества и недостатки. Также внимание уделяется недостаткам текущей реализации RFE в библиотеке Scikit-learn, и предлагаются пути их улучшения, а также креативные подходы к решению задач feature selection.

    habr.com/ru/articles/833954/

    #data_science #machine_learning #feature_selection #feature_extraction #отбор_признаков #lightgbm #машинное_обучение

  22. tidymodels has long supported parallelizing model fits across CPU cores. A couple of the modeling engines that #rstats #tidymodels supports for gradient boosting—#XGBoost and #LightGBM—have their own tools to parallelize model fits. A new blog post explores whether tidymodels users should use tidymodels' implementation, the engines', or both.

    simonpcouch.com/blog/2024-05-1

  23. Градиентный бустинг. Реализация с нуля на Python и разбор особенностей его модификаций (XGBoost, CatBoost, LightGBM)

    На сегодняшний день градиентный бустинг (gradient boosting machine) является одним из основных production-решений при работе с табличными, неоднородными данными, поскольку обладает высокой производительностью и точностью, а если быть точнее, то его модификации, речь о которых пойдёт чуть позже. В данной статье представлена не только реализация градиентного бустинга GBM с нуля на Python, но а также довольно подробно описаны ключевые особенности его наиболее популярных модификаций.

    habr.com/ru/articles/799725/

    #градиентный_бустинг #gradient_boosting #xgboost #catboost #lightgbm #алгоритмы_машинного_обучения #data_science #машинное_обучение #реализация_с_нуля #python

  24. You can get to 95% of the performance of a huge ensemble in a tabular dataset by simply running bayesian optimization with 30 steps with a GBM-like model

    Set the maximum number of trees you can

    Optimize learning rate, max depth, subsample, colsample and minimum samples per leaf

    #machinelearning #datascience #kaggle #xgboost #lightgbm

  25. #MachineLearning lesson of the day: Working with a #gradientboosting model, I got no traction cross-validating hyperparameters like tree depth and number; but different evaluation metrics (e.g. SMSE vs. MAE etc.) had a major impact. Have you tried this?

    IMHO #DNN get all the press because they do sexy human jobs like seeing and processing language. But in the business world of tabular data, #gradientboosting is where the real revolution is happening! #xgboost #catboost #lightgbm #DataScience