#computer_vision — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #computer_vision, aggregated by home.social.
-
Как оценить надёжность liveness‑проверки: гайд по метрикам для тех, кто выбирает KYC‑поставщика
Привет, Хабр! Несколько абзацев о том, как понять с помощью проверки живости, что человек, который проходит онлайн‑регистрацию — именно тот, за кого себя выдаёт? Давайте поговорим про лабораторные метрики и реальные показатели, посмотрим, по каким критериям оценивать liveness‑проверки продакт‑менеджерам, решим, насколько можно доверять автоматическим системам и маркетингу вендоров. Держите глаза открытыми, замрите
https://habr.com/ru/articles/1070214/
#ml #cv #computer_vision #fraudменеджмент #liveness_detection #kyc #знай_своего_клиента
-
RAVEL-VB — модель для детекта игроков в волейбол на площадке
Всё началось с того, что на «Хабре» мне попалась статья о модели TAPe — Theory of Active Perception, или «теории активного восприятия». В статье были громкие заявления и интересные описания, но попробовать модель на практике не удалось. Я собрал ключевые тезисы о TAPe и обратился к ChatGPT с запросом:
-
Как мы превратили видео с робота в ML-хакатон по Computer Vision в ретейле
Распознавать информацию со статичной камеры – задача уже не новая, мы давно работаем над ней в наших магазинах. А вот качественное распознавание ценников с камеры движущегося робота звучит намного интереснее и сложнее, особенно в реализации. Такой подход может закрыть сразу несколько процессов: сотрудники будут тратить меньше времени на мониторинг полок, а робот сможет быстро фиксировать нарушения и передавать информацию команде. Но чтобы этот сценарий заработал в магазине, нужно было решить технически сложную часть.
-
Открытая АСУТП – это реальность для бизнеса. Что мы показали на ЦИПР 2026
ЦИПР — это площадка, где встречаются вендоры, интеграторы и заказчики. Мы решили показать, что Открытая АСУТП — это не просто концепция, а работающий инструмент, который можно взять и внедрить уже сегодня. Мы привезли стенд, который демонстрирует полный производственный цикл: от разработки модели управления и компьютерного зрения на контроллере до выдачи производственных заданий через MES и их отработки на реальном оборудовании. И всё это — на отечественных и open-source компонентах. В статье расскажем какую бизнес-ценность представляет Открытая АСУТП сегодня.
https://habr.com/ru/companies/severstal/articles/1061910/
#Открытая_АСУТП #ПЛК_Forge_Logic #OpenFB #Computer_Vision #MES #ЦИПР #промышленная_автоматизация #Python #OPC_UA #MQTT
-
Как математическая модель победила нейросеть: ректификация документов, сложенных втрое
Сегодня практически любую задачу компьютерного зрения пытаются решить нейронной сетью. Геометрическая ректификация документов — не исключение: современные модели умеют распрямлять даже скомканные листы бумаги. Реальность устроена иначе : никто не комкает деловые документы перед распознаванием, гораздо чаще их просто складывают пополам или втрое для удобства хранения или транспортировки. Поэтому большие нейросетевые модели на самом деле представляют скорее лишь научный интерес, а для практических целей куда полезнее придумать простой, но эффективный и быстрый алгоритм. В
https://habr.com/ru/companies/smartengines/articles/1060224/
#ocr #computer_vision #распознавание_документов #алгоритмы #математическое_моделирование #smart_engines #image_processing
-
Оценка быстродействия детекторов YOLO на Raspberry Pi 5 HAT+
В предыдущей статье я описал процесс компиляции модели yolo8n в HEF-файл для нейрочипа HAILO-8L в модуле HAT+. В этой работе я оцениваю быстродействие инференса нескольких моделей YOLO для этого же чипа.
https://habr.com/ru/articles/1058804/
#raspberry_pi #hailo #hailo8l #yolo #mlops #ai #computervision #computer_vision #detection #opencv
-
От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев
Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️
https://habr.com/ru/companies/X5Tech/articles/1054688/
#computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл
-
Контроль СИЗ на палубе судна: как из потока детекций собрать подтвержденное нарушение
Заказчик контролирует технику безопасности на палубе судна: в рабочих зонах экипаж обязан быть в касках, спасательных жилетах и костюмах-поплавках. Визуальный контроль по камерам не масштабируется, оператор не сможет физически охватить все потоки за смену. Задача: автоматически фиксировать нарушения ношения СИЗ (каски, спасательные жилеты, перчатки, костюмы-поплавки) в рабочих зонах на открытой палубе судна.
https://habr.com/ru/articles/1054214/
#computer_vision #object_detection #видеоаналитика #детекция_нарушений #детекция_СИЗ #PPE_detection #машинное_обучение #компьютерное_зрение
-
Как мы реализовали оптимальное обучение CV-моделей в Luna Line. Часть 2. Сегментация
И снова здравствуйте! Продолжаю свой рассказ о поиске «универсального рецепта» для обучения моделей в Luna Line. Теперь речь пойдет о сегментации. Если вы пропустили предыдущую публикацию по классификации, то вам лучше начать читать с нее , чтобы не запутаться. Дело в том, что когда мы разобрались с классификацией, наша же методология оставила послевкусие неудовлетворенности. Мы задавали себе вопрос: а действительно ли выбранное семейство показывает максимум своих возможностей или мы просто зажали его в рамки единого пайплайна? Для сегментации мы решили действовать иначе.
https://habr.com/ru/companies/ru_mts/articles/1053300/
#computer_vision #deep_learning #machine_learning #ai #искусственный_интеллект #компьютерное_зрение #данные_для_обучения #cv #сегментация_изображений #обучение_нейронных_сетей
-
Как я устал от CVAT и в соло написал десктопный инструмент для авторазметки датасетов на PyQt5
Надоело разворачивать CVAT через докер и мириться с лагами браузера? Я расскажу свою историю, как от простецкого аннотатора собранного на коленке написал мощную легковесную отечественную альтернативу на PyQt5 и OpenGl, с пакетной авторазметкой и иерархией классов.
https://habr.com/ru/articles/1053394/
#cvat #pyqt5 #разметка_данных #yolo #computer_vision #open_source #авторазметка #active_learning #Локальный_софт
-
От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев
Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️
https://habr.com/ru/companies/X5Tech/articles/1047946/
#computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл
-
Как я мерил точность ИИ в распознавании еды: бенчмарк, LLM-as-judge и баг с варёной гречкой
Строю приложение для подсчёта калорий по фото. Пользователь снимает тарелку, модель определяет блюдо, считает КБЖУ. Идея не новая, но мне важно, чтобы это работало именно на русской еде — борщи, гречки, котлеты по-домашнему. В какой-то момент стало некомфортно: я не знал, насколько модель вообще точна. «Кажется, работает нормально» — плохой ответ, если хочешь что-то улучшать. Решил померять нормально. Расскажу, что и как мерил, что получил — и про неожиданный вывод в конце, ради которого, честно говоря, и стоило это всё делать. Спойлер: распознавание оказалось готовым к проду (93.9%), а вот confidence от модели — почти константой, на которой нельзя строить логику. И главная ошибка в калориях пряталась совсем не там, где я её искал.
https://habr.com/ru/articles/1046914/
#LLM #бенчмарк #распознавание_еды #computer_vision #RAG #Gemini #подсчёт_калорий #LLMasjudge #оценка_качества_моделей #нутриенты
-
Видеоаналитика на промышленном объекте: почему большинство внедрений разочаровывают и как сделать правильно
Там, где нет людей, нет времени и нет права на ошибку Хочу поделится одной историей из жизни. На удалённом нефтепромысле в -30С° за бортом бригада выполняет огневые работы — сварка, рядом с действующим трубопроводом. По регламенту каждый должен быть в полном комплекте СИЗ, с газоанализатором. Мастер провел инструктаж, расписался в наряде‑допуске и уехал на следующий объект. Инспектор по ТБ появится через два часа. Что происходит в эти два часа — не знает никто. Вот именно здесь я и хочу начать наш разговор о видеоаналитике в промышленности. Не о красивых дашбордах и не о технологиях будущего. А о конкретной задаче — увидеть то, что происходит на объекте прямо сейчас, когда физически там нет возможности присутствовать ответственному. Последние три года я плотно погрузился в сферу промышленной видеоаналитики — от пресейла и проектирования до запуска систем на объектах нефтегазового сектора и не только. До этого прошёл через телекоммуникации, управление ИТ‑инфраструктурой крупных нефтяных компаний, промышленную безопасность. Этот путь дал главное — понимание задачи изнутри, с обеих сторон: и как технический заказчик, который принимает систему, и как специалист, который её проектирует и внедряет. В этой статье — не маркетинг и не обзор рынка. Личный опыт, реальные цифры и честный разговор о том почему большинство внедрений не работают так как обещают.
https://habr.com/ru/articles/1045368/
#видеоаналитика #видеоаналитика_в_производстве #промышленная_безопасность #производственная_безопасность #охрана_труда #computer_vision #edge_computing
-
Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса
Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и было ли приветствие вообще, если клиент коротко ответил "ага" на фоне работающего холодильника. Дано: сеть АЗС, ручной аудит покрывает несколько процентов смен. Всё остальное — "слепая зона". Заказчик хотел её закрыть с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования, только то, что уже есть на точках. Ограничение, которое определило всю архитектуру: кассир у микрофона говорит громко и развёрнутыми фразами. Клиент отвечает коротко, тихо и иногда вообще кивает. Стандартный ASR-пайплайн из этой пары слышит только одну сторону. Видео первично: без стабильного ID клиента и временных границ сессии аудиоаналитика работает вхолостую. Начали с трекинга.
https://habr.com/ru/articles/1044914/
#ASR #распознавание_речи #компьютерное_зрение #vad #object_tracking #видеоаналитика #speech_recognition #computer_vision
-
Как и зачем мы сделали собственный OCR-бенчмарк
Однажды нам понадобилось выбрать OCR-модель для RAG-пайплайна. Казалось бы, задача простая: смотришь на лидерборды, берешь лучшую, PROFIT. Но быстро выяснилось, что, во-первых, то, что прекрасно срабатывает на каких-нибудь английских юридических документах, может не потянуть такие штуки как научные формулы, паспортные данные и таблицы на русском языке. А во-вторых, даже если крутой по всем параметрам бенчмарк для оценки качества распознавания говорит, «всё прочитали правильно, я проверил», точность ответов пользователю, который совершает запрос к чат-боту с RAG под капотом, может страдать. Почему так происходит, зачем мы потратили время на сборку собственного OCR-бенчмарка и пожалели ли мы об этом, рассказываю дальше.
https://habr.com/ru/companies/cloud_ru/articles/1043144/
#ocr #rag #LLM #deepseek #glm #markdown #векторный_поиск #data_science #computer_vision
-
Ускоряем в 10+ раз вычисление расстояния Хаусдорфа на упорядоченных контурах
История о том, как реальная performance-проблема привела к простой exact-оптимизации Hausdorff distance на упорядоченных контурах. как ускорить Hausdorff distance
https://habr.com/ru/articles/1042704/
#Hausdorff_distance #расстояние_Хаусдорфа #оптимизации #performance #обработка_изображений #image_processing #geometry #c++ #контуры #computer_vision
-
Эволюция детекции дипфейков: от подсчета морганий до распознавания микроскопических изменений цвета кожи
— …для начала нужно понять главное. — Что главное? — Ложки не существует. В 2026 году этот диалог из фильма «Матрица» звучит уже не как философская метафора, а как обыденность в интернете. Все понимают, что видео теперь не является доказательством, голос больше не подтверждает личность, а в фотографиях от реальности нет и следа. Для обычного пользователя это означает потерю доверия к контенту, а для бизнеса — риск подделки личности, мошенничества и ошибочных решений. Как же так вышло, что нас повсюду окружают симулякры?
https://habr.com/ru/companies/ru_mts/articles/1040822/
#deepfake #AI #machine_learning #computer_vision #synthetic_media #FaceForensics++ #Intel_FakeCatcher #MNW_Benchmark #информационная_безопасность #генеративный_ИИ
-
Фотограмметрическая поворотка на Arduino за 2500 рублей
Ко мне на кафедре обратились двое старшекурсников. Они пишут программу для археологов: пользователь фотографирует, что нашел, программа лезет в модель (которая натренирована на исторические архивах) и возвращает карту вероятностей, где поблизости могут лежать неметаллические артефакты, которые металлоискатель не ловит. Дерево, керамика, кость, ткань и тд. Для обучения модели им нужен был большой датасет фотографий находок времен WW2 (значки, гильзы, медали, фрагменты обмундирования) под разными углами и наклонами. Они прикинули два варианта: либо снимать каждый предмет вручную с разных ракурсов, перетаскивая штатив или поворачивая объект пальцами, либо сначала вылепить 3D-модель каждого артефакта вручную и потом программно крутить её в виртуальной сцене под разным светом, рендеря оттуда кадры для датасета. По обоим выходило пара месяцев работы. Я предложил собрать автоматическую поворотку. Спроектировал, напечатал, написал прошивку и питоновский скрипт. Сразу не заработало, переделал пару дней. К ночи рабочей версии я сидел за столом и каждые 12 минут жал ресет на Arduino, меняя предмет на платформе. К утру датасет был готов.
https://habr.com/ru/articles/1040874/
#arduino_uno #фотограмметрия #поворотный_стол #28byj48 #датасет #computer_vision #dataset #diy #3dпечать #pyserial
-
Ожидание: сделать ИИ-примерочную обоев за 2 дня. Реальность: пришлось добучать свою модель на SD
В условиях жесткой конкуренции на рынке отделочных материалов любому магазину жизненно необходимо хоть какое-то осязаемое преимущество. Стандартными каталогами и скидками уже никого не удивить. Так у нас родилась идея: сделать онлайн-примерочную обоев. Кажется, звучит как киллер-фича — дать клиенту возможность до покупки увидеть, как конкретный паттерн будет смотреться в его реальном интерьере. На тот момент на рынке вовсю хайповали генеративные модели (такие как «Nano Banana»). На первый взгляд казалось, что проблема решается в два клика. План был надежен, как швейцарские часы: получить API-ключ, отправить по эндпоинту фотографию интерьера и текстуру обоев, сопроводить это правильным промптом (с указанием учитывать перспективу, освещение и масштаб) и забирать готовый результат. Но на практике оказалось, что задача не просто нетривиальная. Она вскрыла целый пласт проблем, о которых создатели популярных генеративок предпочитают умалчивать.
https://habr.com/ru/articles/1039804/
#computer_vision #stable_diffusion #нейросети #finetuning #ecommerce #визуализация_интерьеров #chatgpt
-
Трекинг посетителей на fisheye-камерах: задача “со звездочкой”
Всем привет, на связи команда NeuroCore. Сегодня расскажем про кейс разработки системы видеоаналитики для магазинов самообслуживания: почему fisheye-камеры - настоящее проклятие, почему SORT и DeepSORT не справились с задачей, как мы выстроили конвейер от детекции до бизнес-событий, и какие инженерные решения позволили добиться стабильной работы в продакшене. Дано: магазины самообслуживания, которые работают без кассиров и продавцов. Покупатель входит по QR, выбирает товары, рассчитывается и выходит. Заказчику нужна автоматизированная система отслеживания: кто находится внутри, сколько времени, в каких зонах, а также распознает несанкционированный доступ и вход группами. В случае нарушений, система должна генерировать алерты по 7 типам событий. Что есть: одна потолочная fisheye-камера, которая покрывает весь зал. Это идеальный выбор для ритейла: угол обзора 180 градусов, не нужно ставить десятки обычных камер, не нужно сшивать панорамы. Но за этот комфорт приходится платить.
https://habr.com/ru/articles/1039354/
#ритейл #трекинг #computer_vision #машинное_зрение #компьютерное_зрение #yolo #видеоаналитика_в_retail #видеоаналитика
-
Детекция чужого почерка в экзаменационных бланках без эталонного образца
Один ученик писал экзаменационную работу, а кто-то чужой дописал часть за него. Как мы научили нейросеть распознавать это. Дано: государственная аттестация, бумажные бланки, никакого онлайн-контроля. Классический способ фальсификации: ученик начинает работу сам, потом часть дописывает кто-то другой: сосед, нанятый человек, преподаватель. Проверяющий смотрит на текст, но не оценивает почерк. Задача ИИ: поймать фальсификацию почерка без эталона: система не знает заранее, как пишет конкретный ученик. Единственное, от чего можно отталкиваться - начало бланка, мы предполагаем, что первые строки написал сам экзаменуемый. Цель: определить, написан ли весь бланк экзаменационной работы одним человеком. На входе - скан бланка, порой низкого качества. На выходе — координаты подозрительных фрагментов для ручной проверки. Все это в режиме потоковой обработки. Основной вызов: экзаменационный бланк — это смешанный документ. Рукописный текст соседствует с формулами, графиками, схемами, печатной подложкой бланка.
https://habr.com/ru/articles/1037850/
#ocr #ocrтехнологии #computer_vision #yolo #компьютерное_зрение #pytorch #распознавание_текста #распознавание_рукописного_текста
-
Подсчёт долей фракций руды на конвейере: SAM2 для разметки, YOLO и проблемы с перекрытием
На производственной площадке стоит камера над лентой конвейера, она снимает поток , а система считает доли трёх цветовых фракций — серо-белой, оранжевой, розовой — и пишет результат в JSON для следующего этапа обработки. Цвет фракции используется как косвенный признак химического состава — технолог по нему оценивает качество партии. Заказчику нужна всего одна цифра — доля оранжевой фракции . Для предприятия эта фракция самая интересная по составу, остальные классы имеют второстепенное значения. Эту цифру нужно предоставлять в режиме 24/7, без расхождений между сменами. Камера стоит в закрытом помещении внутри здания. Освещение искусственное, прожектора фиксированные. Естественного света нет, влажность стабильна, поэтому большинство стандартных проблем компьютерного зрения на улице — блики на мокрых камнях, изменение цвета по времени суток, тени от солнца — в нашем случае не возникают и в статье обсуждаться не будут.
https://habr.com/ru/articles/1034836/
#sam #instance_segmentation #yolo #SAM2 #машинное_обучение #машинное_зрение #computer_vision #разметка_данных #data_labeling
-
DIY-стенд для инспекции печатных плат (профиль, камера, шаговые двигатели и немного инженерного упрямства)
Я, как и многие, залип в датасеты , метрики и нейросети - и в какой-то момент понял, что почти не думаю о главном, как вообще проходит процесс инспекции печатных плат. Чтобы закрыть вопрос реального процесса инспекции печатных плат, было принято решение собрать собственный компактный стенд (подиум на алюминиевом профиле, камера, два шаговых двигателя и много (очень много) хомутов для проведения автоматической инспекции. Основные критерии, которые были заложены в основу будущего стенда: он должен быть простым в управлении, достаточно компактным, чтобы уместиться на рабочем столе и универсальным. Чтобы была возможность решать различные задачи инспекции. В статье расскажу, почему я не стал делать конвейер, как в промышленности, какие компромиссы пришлось принять, что пошло не так при сборке и почему этот DIY-подход оказался полезнее, чем ещё один прогон модели на готовом датасете. Если коротко, то я собрал из того, что было под рукой (местами буквально "на коленке"), и это неожиданно дало больше понимания, чем ещё одно обучение модели.
https://habr.com/ru/articles/1034422/
#diy #ии #стенд #из_говна_и_палок #диплом #ниокр #pcb #computer_vision #detection #arduino
-
Flow Matching, 276M параметров и моделирование хаоса: как мы научили генеративную модель Marchuk предсказывать погоду
Привет, Хабр! Мы команда «Генеративный ИИ для видео» лаборатории FusionBrain AIRI — группа исследователей в области Generative AI. Наш основной профиль — модели генерации изображений и видео: пиксели, временная когерентность, латентные пространства, трансформеры и diffusion/flow‑подходы. Мы — не метеорологи. Но совсем недавно мы задались вопросом: можно ли взять SOTA‑идеи из алгоритмов генерации видео и применить их к задаче предсказания глобальной погодной карты, не превращая ML‑модель в усложненный пайплайн на базе специфических метеорологических знаний? Оказалось, что да, и весьма неплохо. В этой статье мы расскажем про нашу новую модель прогноза погоды на основе алгоритма Flow Matching под названием Marchuk, которая выгодно выделяется на фоне конкурентных подходов своей компактностью и производительностью. Она даже смогла предсказать морозы в январе 2026 года!
https://habr.com/ru/companies/airi/articles/1011256/
#прогноз_погоды #диффузионные_нейросети #Machine_Learning #Weather_Forecasting #Computer_Vision #Flow_Matching #Diffusion_Models #DiT #Research