home.social

#vlm — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #vlm, aggregated by home.social.

fetched live
  1. Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

    Вам нужен OCR. В техобзорах рекомендуют Tesseract, на Хабре все пишут про VLM, идете на Hugging Face — там PaddleOCR-VL, DeepSeek-OCR, Dots.OCR, Qwen2.5-VL, и каждая называет себя SOTA. Прибавим к этому vLLM, SGLang, TGI, Native HF Transformers, и вот вы зависли между десятками комбинаций. Мы протестировали девять моделей на трех движках инференса на рукописном русском и отразили в таблице, какая модель под какую задачу лучше подходит. Велком под кат за таблицей и историей ее создания

    habr.com/ru/companies/mts_ai/a

    #OCR #vlm #mws_ai #распознавание_изображений #распознавание_текста #бенчмарки #искусственный_интеллект #ml #инференс_ллм #движки

  2. Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

    Вам нужен OCR. В техобзорах рекомендуют Tesseract, на Хабре все пишут про VLM, идете на Hugging Face — там PaddleOCR-VL, DeepSeek-OCR, Dots.OCR, Qwen2.5-VL, и каждая называет себя SOTA. Прибавим к этому vLLM, SGLang, TGI, Native HF Transformers, и вот вы зависли между десятками комбинаций. Мы протестировали девять моделей на трех движках инференса на рукописном русском и отразили в таблице, какая модель под какую задачу лучше подходит. Велком под кат за таблицей и историей ее создания

    habr.com/ru/companies/mts_ai/a

    #OCR #vlm #mws_ai #распознавание_изображений #распознавание_текста #бенчмарки #искусственный_интеллект #ml #инференс_ллм #движки

  3. Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

    Вам нужен OCR. В техобзорах рекомендуют Tesseract, на Хабре все пишут про VLM, идете на Hugging Face — там PaddleOCR-VL, DeepSeek-OCR, Dots.OCR, Qwen2.5-VL, и каждая называет себя SOTA. Прибавим к этому vLLM, SGLang, TGI, Native HF Transformers, и вот вы зависли между десятками комбинаций. Мы протестировали девять моделей на трех движках инференса на рукописном русском и отразили в таблице, какая модель под какую задачу лучше подходит. Велком под кат за таблицей и историей ее создания

    habr.com/ru/companies/mts_ai/a

    #OCR #vlm #mws_ai #распознавание_изображений #распознавание_текста #бенчмарки #искусственный_интеллект #ml #инференс_ллм #движки

  4. Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 2

    В прошлой части мы разобрали матчасть: почему классическая робототехника уперлась в потолок, как языковые модели превратились в VLA и на каких станках куется «физический интеллект». Теперь — про то, как все это живет в реальности. Про экономику, промышленность, государственные программы и человеческую природу.

    habr.com/ru/companies/bothub/a

    #робот #робототехника #VLA #VLM #PhysicalAI #LLM #teach_pendant #гуманоид #гуманоидные_роботы #автономность

  5. Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 2

    В прошлой части мы разобрали матчасть: почему классическая робототехника уперлась в потолок, как языковые модели превратились в VLA и на каких станках куется «физический интеллект». Теперь — про то, как все это живет в реальности. Про экономику, промышленность, государственные программы и человеческую природу.

    habr.com/ru/companies/bothub/a

    #робот #робототехника #VLA #VLM #PhysicalAI #LLM #teach_pendant #гуманоид #гуманоидные_роботы #автономность

  6. Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 2

    В прошлой части мы разобрали матчасть: почему классическая робототехника уперлась в потолок, как языковые модели превратились в VLA и на каких станках куется «физический интеллект». Теперь — про то, как все это живет в реальности. Про экономику, промышленность, государственные программы и человеческую природу.

    habr.com/ru/companies/bothub/a

    #робот #робототехника #VLA #VLM #PhysicalAI #LLM #teach_pendant #гуманоид #гуманоидные_роботы #автономность

  7. Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 1

    Сколько времени вам нужно, чтобы сложить футболку? Секунды три, если аккуратно. Пять, если совсем аккуратно. А теперь другой вопрос. Как вы думаете, сколько лет понадобилось мировой робототехнике, чтобы машина сложила ту же футболку сама — без жестко прописанной программы, без специальной оснастки, просто взяв мятую тряпку из корзины? Отвечаю: примерно шестьдесят. Первый промышленный робот встал на конвейер General Motors в 1961 году, а уверенно складывающего белье робота впервые показали осенью 2024-го. И это, честно говоря, было событием покрупнее многих громких презентаций.

    habr.com/ru/companies/bothub/a

    #робот #робототехника #VLA #VLM #PhysicalAI #LLM #teach_pendant #гуманоид #гуманоидные_роботы #автономность

  8. Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 1

    Сколько времени вам нужно, чтобы сложить футболку? Секунды три, если аккуратно. Пять, если совсем аккуратно. А теперь другой вопрос. Как вы думаете, сколько лет понадобилось мировой робототехнике, чтобы машина сложила ту же футболку сама — без жестко прописанной программы, без специальной оснастки, просто взяв мятую тряпку из корзины? Отвечаю: примерно шестьдесят. Первый промышленный робот встал на конвейер General Motors в 1961 году, а уверенно складывающего белье робота впервые показали осенью 2024-го. И это, честно говоря, было событием покрупнее многих громких презентаций.

    habr.com/ru/companies/bothub/a

    #робот #робототехника #VLA #VLM #PhysicalAI #LLM #teach_pendant #гуманоид #гуманоидные_роботы #автономность

  9. Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 1

    Сколько времени вам нужно, чтобы сложить футболку? Секунды три, если аккуратно. Пять, если совсем аккуратно. А теперь другой вопрос. Как вы думаете, сколько лет понадобилось мировой робототехнике, чтобы машина сложила ту же футболку сама — без жестко прописанной программы, без специальной оснастки, просто взяв мятую тряпку из корзины? Отвечаю: примерно шестьдесят. Первый промышленный робот встал на конвейер General Motors в 1961 году, а уверенно складывающего белье робота впервые показали осенью 2024-го. И это, честно говоря, было событием покрупнее многих громких презентаций.

    habr.com/ru/companies/bothub/a

    #робот #робототехника #VLA #VLM #PhysicalAI #LLM #teach_pendant #гуманоид #гуманоидные_роботы #автономность

  10. Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора

    Современный поиск по видеоконтенту — это высоконагруженная система, требующая молниеносной реакции и безупречной релевантности. Сервис VK Видео оперирует колоссальной базой в 500 миллионов видеороликов и ежедневно обрабатывает около 10 миллионов запросов пользователей. При времени ответа в 0,5 секунды и нагрузке в 1800 RPS алгоритмам необходимо моментально находить именно тот контент, который ожидает увидеть зритель. Однако развитие алгоритмов ранжирования невозможно без качественных данных, на которых они обучаются. Традиционный подход с использованием ручной разметки асессорами долгое время оставался индустриальным стандартом, но на масштабах сотен тысяч видео он неизбежно становится бутылочным горлышком продуктовой разработки. Меня зовут Владислав Чернышев, я руководитель группы качества поиска по видео в AI VK. В этой статье подробно расскажу про путь перехода от классической ручной разметки к гибридной VLM-системе, разберу ошибки и инфраструктурные барьеры, которые пришлось преодолеть для кратного ускорения процессов подготовки обучающих датасетов и офлайн-оценки качества поиска. Переходим к VLV-системе

    habr.com/ru/companies/vk/artic

    #aivk #поиск #поиск_видео #видеоконтент #vk_видео #vlm #видеопоиск

  11. Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора

    Современный поиск по видеоконтенту — это высоконагруженная система, требующая молниеносной реакции и безупречной релевантности. Сервис VK Видео оперирует колоссальной базой в 500 миллионов видеороликов и ежедневно обрабатывает около 10 миллионов запросов пользователей. При времени ответа в 0,5 секунды и нагрузке в 1800 RPS алгоритмам необходимо моментально находить именно тот контент, который ожидает увидеть зритель. Однако развитие алгоритмов ранжирования невозможно без качественных данных, на которых они обучаются. Традиционный подход с использованием ручной разметки асессорами долгое время оставался индустриальным стандартом, но на масштабах сотен тысяч видео он неизбежно становится бутылочным горлышком продуктовой разработки. Меня зовут Владислав Чернышев, я руководитель группы качества поиска по видео в AI VK. В этой статье подробно расскажу про путь перехода от классической ручной разметки к гибридной VLM-системе, разберу ошибки и инфраструктурные барьеры, которые пришлось преодолеть для кратного ускорения процессов подготовки обучающих датасетов и офлайн-оценки качества поиска. Переходим к VLV-системе

    habr.com/ru/companies/vk/artic

    #aivk #поиск #поиск_видео #видеоконтент #vk_видео #vlm #видеопоиск

  12. Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора

    Современный поиск по видеоконтенту — это высоконагруженная система, требующая молниеносной реакции и безупречной релевантности. Сервис VK Видео оперирует колоссальной базой в 500 миллионов видеороликов и ежедневно обрабатывает около 10 миллионов запросов пользователей. При времени ответа в 0,5 секунды и нагрузке в 1800 RPS алгоритмам необходимо моментально находить именно тот контент, который ожидает увидеть зритель. Однако развитие алгоритмов ранжирования невозможно без качественных данных, на которых они обучаются. Традиционный подход с использованием ручной разметки асессорами долгое время оставался индустриальным стандартом, но на масштабах сотен тысяч видео он неизбежно становится бутылочным горлышком продуктовой разработки. Меня зовут Владислав Чернышев, я руководитель группы качества поиска по видео в AI VK. В этой статье подробно расскажу про путь перехода от классической ручной разметки к гибридной VLM-системе, разберу ошибки и инфраструктурные барьеры, которые пришлось преодолеть для кратного ускорения процессов подготовки обучающих датасетов и офлайн-оценки качества поиска. Переходим к VLV-системе

    habr.com/ru/companies/vk/artic

    #aivk #поиск #поиск_видео #видеоконтент #vk_видео #vlm #видеопоиск

  13. От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев

    Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️

    habr.com/ru/companies/X5Tech/a

    #computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл

  14. От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев

    Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️

    habr.com/ru/companies/X5Tech/a

    #computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл

  15. От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев

    Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️

    habr.com/ru/companies/X5Tech/a

    #computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл

  16. Как мы построили сервис компьютерного зрения на базе внешних VLM для контроля выкладки и ценников: опыт Fix Price

    Привет, Хабр! Меня зовут Кристина Истратова и я руковожу центром аналитики данных в Fix Price . В нашей Сети более 8 000 магазинов, а в каждом из них — множество товаров. Думаю, все из нас знают, как покупатели реагируют на отсутствие ценника или неверную цену на нем, какие чувства вызывает пустая полка, где нет товара, за которым приходишь в магазин.

    habr.com/ru/companies/fix_pric

    #vlm #ии #osa #ml #машинное+обучение #машинное_обучение #изображения #разработка

  17. Как мы построили сервис компьютерного зрения на базе внешних VLM для контроля выкладки и ценников: опыт Fix Price

    Привет, Хабр! Меня зовут Кристина Истратова и я руковожу центром аналитики данных в Fix Price . В нашей Сети более 8 000 магазинов, а в каждом из них — множество товаров. Думаю, все из нас знают, как покупатели реагируют на отсутствие ценника или неверную цену на нем, какие чувства вызывает пустая полка, где нет товара, за которым приходишь в магазин.

    habr.com/ru/companies/fix_pric

    #vlm #ии #osa #ml #машинное+обучение #машинное_обучение #изображения #разработка

  18. Как мы построили сервис компьютерного зрения на базе внешних VLM для контроля выкладки и ценников: опыт Fix Price

    Привет, Хабр! Меня зовут Кристина Истратова и я руковожу центром аналитики данных в Fix Price . В нашей Сети более 8 000 магазинов, а в каждом из них — множество товаров. Думаю, все из нас знают, как покупатели реагируют на отсутствие ценника или неверную цену на нем, какие чувства вызывает пустая полка, где нет товара, за которым приходишь в магазин.

    habr.com/ru/companies/fix_pric

    #vlm #ии #osa #ml #машинное+обучение #машинное_обучение #изображения #разработка

  19. [Перевод] Почему промпты для VLM работают наоборот: как это исправить

    Недавно я пытался выжать максимум из корпоративной OCR-модели, перебирая промпты и гиперпараметры, когда наткнулся на issue в репозитории Qwen-3-VL. Автор утверждал, что точность задачи выросла просто от изменения порядка: сначала изображение, потом текст. Просто перестановка блоков.

    habr.com/ru/articles/1049176/

    #prompt_engineering #vlm #ocr #Qween #Gemma #Positional_Encoding

  20. [Перевод] Почему промпты для VLM работают наоборот: как это исправить

    Недавно я пытался выжать максимум из корпоративной OCR-модели, перебирая промпты и гиперпараметры, когда наткнулся на issue в репозитории Qwen-3-VL. Автор утверждал, что точность задачи выросла просто от изменения порядка: сначала изображение, потом текст. Просто перестановка блоков.

    habr.com/ru/articles/1049176/

    #prompt_engineering #vlm #ocr #Qween #Gemma #Positional_Encoding

  21. [Перевод] Почему промпты для VLM работают наоборот: как это исправить

    Недавно я пытался выжать максимум из корпоративной OCR-модели, перебирая промпты и гиперпараметры, когда наткнулся на issue в репозитории Qwen-3-VL. Автор утверждал, что точность задачи выросла просто от изменения порядка: сначала изображение, потом текст. Просто перестановка блоков.

    habr.com/ru/articles/1049176/

    #prompt_engineering #vlm #ocr #Qween #Gemma #Positional_Encoding

  22. От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев

    Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️

    habr.com/ru/companies/X5Tech/a

    #computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл

  23. От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев

    Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️

    habr.com/ru/companies/X5Tech/a

    #computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл

  24. От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев

    Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️

    habr.com/ru/companies/X5Tech/a

    #computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл

  25. 📯„Karikaturen digitaler Umwelten: Computer-Natur-Beziehungen im Anthropozän mit Vision Language Models erforschen“ präsentiert Martin Schmitt (Universität Paderborn) im #DigitalHistoryOFK in dieser Woche.

    Anhand von 1.250 Computerkarikaturen zeigt er, wie Computer-Vision-Modelle neue Perspektiven auf digitale Kulturen und #Umweltgeschichte eröffnen.

    📅3.06.26, 16Uhr (CET), im ZZF & online
    ℹ️dhistory.hypotheses.org/13713

    #4memory #VLM

  26. 📯„Karikaturen digitaler Umwelten: Computer-Natur-Beziehungen im Anthropozän mit Vision Language Models erforschen“ präsentiert Martin Schmitt (Universität Paderborn) im #DigitalHistoryOFK in dieser Woche.

    Anhand von 1.250 Computerkarikaturen zeigt er, wie Computer-Vision-Modelle neue Perspektiven auf digitale Kulturen und #Umweltgeschichte eröffnen.

    📅3.06.26, 16Uhr (CET), im ZZF & online
    ℹ️dhistory.hypotheses.org/13713

    #4memory #VLM

  27. 📯„Karikaturen digitaler Umwelten: Computer-Natur-Beziehungen im Anthropozän mit Vision Language Models erforschen“ präsentiert Martin Schmitt (Universität Paderborn) im #DigitalHistoryOFK in dieser Woche.

    Anhand von 1.250 Computerkarikaturen zeigt er, wie Computer-Vision-Modelle neue Perspektiven auf digitale Kulturen und #Umweltgeschichte eröffnen.

    📅3.06.26, 16Uhr (CET), im ZZF & online
    ℹ️dhistory.hypotheses.org/13713

    #4memory #VLM

  28. 📯„Karikaturen digitaler Umwelten: Computer-Natur-Beziehungen im Anthropozän mit Vision Language Models erforschen“ präsentiert Martin Schmitt (Universität Paderborn) im #DigitalHistoryOFK in dieser Woche.

    Anhand von 1.250 Computerkarikaturen zeigt er, wie Computer-Vision-Modelle neue Perspektiven auf digitale Kulturen und #Umweltgeschichte eröffnen.

    📅3.06.26, 16Uhr (CET), im ZZF & online
    ℹ️dhistory.hypotheses.org/13713

    #4memory #VLM

  29. Hanwha and Ambarella Enter Into Long-Term Edge AI

    Represents Ambarella’s Broadest Long-Term Partnership Valued in Excess of $800 Million in Potential Revenue Groundbreaking long-term agreement among…
    #EuropeSays #Korea #KR #Hanwha #ADAS #Ambarella #autonomous #ComputerVision #EdgeAI #EdgeEndpoint #EdgeInference #GenAI #HanwhaGroup #LLMsattheedge #Nasdaq:AMBA #Radar #Robotic #Telematics #VLM #VLMs
    europesays.com/korea/36490/

  30. Hanwha and Ambarella Enter Into Long-Term Edge AI

    Represents Ambarella’s Broadest Long-Term Partnership Valued in Excess of $800 Million in Potential Revenue Groundbreaking long-term agreement among…
    #EuropeSays #Korea #KR #Hanwha #ADAS #Ambarella #autonomous #ComputerVision #EdgeAI #EdgeEndpoint #EdgeInference #GenAI #HanwhaGroup #LLMsattheedge #Nasdaq:AMBA #Radar #Robotic #Telematics #VLM #VLMs
    europesays.com/korea/36000/

  31. Hanwha and Ambarella Enter Into Long-Term Edge AI

    Represents Ambarella’s Broadest Long-Term Partnership Valued in Excess of $800 Million in Potential Revenue Groundbreaking long-term agreement among…
    #EuropeSays #Korea #KR #Hanwha #ADAS #Ambarella #autonomous #ComputerVision #EdgeAI #EdgeEndpoint #EdgeInference #GenAI #HanwhaGroup #LLMsattheedge #Nasdaq:AMBA #Radar #Robotic #Telematics #VLM #VLMs
    europesays.com/korea/35048/

  32. От OCR к смыслу: как мы научили модель понимать, кто кому отец, мать, жених и свидетель

    В 2023 году мы рассказывали, как в Поиске по архивам появилось распознавание рукописных документов и почему сама по себе расшифровка архивного текста — нетривиальная задача. Старые почерки, сложная вёрстка, нестандартные формулировки и огромное разнообразие источников делают архивы трудным доменом даже для сильных OCR‑моделей. По мере развития сервиса стало ясно, что одной только расшифровки недостаточно: чтобы действительно помогать пользователям находить своих родственников, нужно не просто видеть слова на скане, а понимать, кто именно упомянут в записи, в какой роли и как связан с другими людьми. Теперь в Поиске по архивам работает новая модель распознавания документов. Она не только распознаёт текст архивного файла, но и структурирует информацию из него. Например, понимает роли и связи между разными людьми: «родившийся», «отец» и «мать» для рождения или «жених», «невеста», «свидетель» для брака. Меня зовут Даша Виноградова, я руковожу универсальными применениями компьютерного зрения в Яндексе. Вместе с Аней Сидоровой, главным разработчиком распознавания архивов, мы расскажем, как мы сделали шаг от распознавания текста к извлечению структуры и смысла из архивных документов: как мы перестраивали OCR‑пайплайн, почему нам не подошли универсальные VLM‑модели и как пытались разобраться, кто есть кто: отец, мать, жених или свидетель.

    habr.com/ru/companies/yandex/a

    #яндекс #ai #vlm #ocr

  33. От OCR к смыслу: как мы научили модель понимать, кто кому отец, мать, жених и свидетель

    В 2023 году мы рассказывали, как в Поиске по архивам появилось распознавание рукописных документов и почему сама по себе расшифровка архивного текста — нетривиальная задача. Старые почерки, сложная вёрстка, нестандартные формулировки и огромное разнообразие источников делают архивы трудным доменом даже для сильных OCR‑моделей. По мере развития сервиса стало ясно, что одной только расшифровки недостаточно: чтобы действительно помогать пользователям находить своих родственников, нужно не просто видеть слова на скане, а понимать, кто именно упомянут в записи, в какой роли и как связан с другими людьми. Теперь в Поиске по архивам работает новая модель распознавания документов. Она не только распознаёт текст архивного файла, но и структурирует информацию из него. Например, понимает роли и связи между разными людьми: «родившийся», «отец» и «мать» для рождения или «жених», «невеста», «свидетель» для брака. Меня зовут Даша Виноградова, я руковожу универсальными применениями компьютерного зрения в Яндексе. Вместе с Аней Сидоровой, главным разработчиком распознавания архивов, мы расскажем, как мы сделали шаг от распознавания текста к извлечению структуры и смысла из архивных документов: как мы перестраивали OCR‑пайплайн, почему нам не подошли универсальные VLM‑модели и как пытались разобраться, кто есть кто: отец, мать, жених или свидетель.

    habr.com/ru/companies/yandex/a

    #яндекс #ai #vlm #ocr

  34. От OCR к смыслу: как мы научили модель понимать, кто кому отец, мать, жених и свидетель

    В 2023 году мы рассказывали, как в Поиске по архивам появилось распознавание рукописных документов и почему сама по себе расшифровка архивного текста — нетривиальная задача. Старые почерки, сложная вёрстка, нестандартные формулировки и огромное разнообразие источников делают архивы трудным доменом даже для сильных OCR‑моделей. По мере развития сервиса стало ясно, что одной только расшифровки недостаточно: чтобы действительно помогать пользователям находить своих родственников, нужно не просто видеть слова на скане, а понимать, кто именно упомянут в записи, в какой роли и как связан с другими людьми. Теперь в Поиске по архивам работает новая модель распознавания документов. Она не только распознаёт текст архивного файла, но и структурирует информацию из него. Например, понимает роли и связи между разными людьми: «родившийся», «отец» и «мать» для рождения или «жених», «невеста», «свидетель» для брака. Меня зовут Даша Виноградова, я руковожу универсальными применениями компьютерного зрения в Яндексе. Вместе с Аней Сидоровой, главным разработчиком распознавания архивов, мы расскажем, как мы сделали шаг от распознавания текста к извлечению структуры и смысла из архивных документов: как мы перестраивали OCR‑пайплайн, почему нам не подошли универсальные VLM‑модели и как пытались разобраться, кто есть кто: отец, мать, жених или свидетель.

    habr.com/ru/companies/yandex/a

    #яндекс #ai #vlm #ocr

  35. Sea Levels Rising Dramatically In Some Areas Due To Land Subsidence [global]
    --
    phys.org/news/2026-05-sea-area <-- shared technical article
    --
    doi.org/10.1038/s41467-026-722 <-- shared paper
    --
    [#VLM = vertical land motion; #ASL = absolute sea-level; #RSL = relative sea-level; #GIA = (global) Glacial Isostatic Adjustment; #inSAR = Interferometric Synthetic Aperture Radar; #GNSS = Global Navigation Satellite System (~GPS); #OE24 = paper, doi.org/10.1038/s41561-023-013, interpolated VLM reconstruction based on the joint analysis of GNSS, tide gauges (TGs), and satellite altimetry]
    #GIS #spatial #mapping #remotesensing #earthobservation #sealevel #verticallandmotion #absolutesealevel #relativesealevel #GlacialIsostaticAdjustment #geomorphometry #SLR #sealevelrise #coast #coastal #flood #flooding #subsidence #landmass #landsubsidence #global #globalsealevelrise #climatechange #city #urban #farmlands #population #demographics #cities #planning #community #elevation #monitoring #spatialanalysis #spatiotemporal #altimetry

  36. Sea Levels Rising Dramatically In Some Areas Due To Land Subsidence [global]
    --
    phys.org/news/2026-05-sea-area <-- shared technical article
    --
    doi.org/10.1038/s41467-026-722 <-- shared paper
    --
    [#VLM = vertical land motion; #ASL = absolute sea-level; #RSL = relative sea-level; #GIA = (global) Glacial Isostatic Adjustment; #inSAR = Interferometric Synthetic Aperture Radar; #GNSS = Global Navigation Satellite System (~GPS); #OE24 = paper, doi.org/10.1038/s41561-023-013, interpolated VLM reconstruction based on the joint analysis of GNSS, tide gauges (TGs), and satellite altimetry]
    #GIS #spatial #mapping #remotesensing #earthobservation #sealevel #verticallandmotion #absolutesealevel #relativesealevel #GlacialIsostaticAdjustment #geomorphometry #SLR #sealevelrise #coast #coastal #flood #flooding #subsidence #landmass #landsubsidence #global #globalsealevelrise #climatechange #city #urban #farmlands #population #demographics #cities #planning #community #elevation #monitoring #spatialanalysis #spatiotemporal #altimetry

  37. Sea Levels Rising Dramatically In Some Areas Due To Land Subsidence [global]
    --
    phys.org/news/2026-05-sea-area <-- shared technical article
    --
    doi.org/10.1038/s41467-026-722 <-- shared paper
    --
    [#VLM = vertical land motion; #ASL = absolute sea-level; #RSL = relative sea-level; #GIA = (global) Glacial Isostatic Adjustment; #inSAR = Interferometric Synthetic Aperture Radar; #GNSS = Global Navigation Satellite System (~GPS); #OE24 = paper, doi.org/10.1038/s41561-023-013, interpolated VLM reconstruction based on the joint analysis of GNSS, tide gauges (TGs), and satellite altimetry]
    #GIS #spatial #mapping #remotesensing #earthobservation #sealevel #verticallandmotion #absolutesealevel #relativesealevel #GlacialIsostaticAdjustment #geomorphometry #SLR #sealevelrise #coast #coastal #flood #flooding #subsidence #landmass #landsubsidence #global #globalsealevelrise #climatechange #city #urban #farmlands #population #demographics #cities #planning #community #elevation #monitoring #spatialanalysis #spatiotemporal #altimetry

  38. Sea Levels Rising Dramatically In Some Areas Due To Land Subsidence [global]
    --
    phys.org/news/2026-05-sea-area <-- shared technical article
    --
    doi.org/10.1038/s41467-026-722 <-- shared paper
    --
    [#VLM = vertical land motion; #ASL = absolute sea-level; #RSL = relative sea-level; #GIA = (global) Glacial Isostatic Adjustment; #inSAR = Interferometric Synthetic Aperture Radar; #GNSS = Global Navigation Satellite System (~GPS); #OE24 = paper, doi.org/10.1038/s41561-023-013, interpolated VLM reconstruction based on the joint analysis of GNSS, tide gauges (TGs), and satellite altimetry]
    #GIS #spatial #mapping #remotesensing #earthobservation #sealevel #verticallandmotion #absolutesealevel #relativesealevel #GlacialIsostaticAdjustment #geomorphometry #SLR #sealevelrise #coast #coastal #flood #flooding #subsidence #landmass #landsubsidence #global #globalsealevelrise #climatechange #city #urban #farmlands #population #demographics #cities #planning #community #elevation #monitoring #spatialanalysis #spatiotemporal #altimetry

  39. Sea Levels Rising Dramatically In Some Areas Due To Land Subsidence [global]
    --
    phys.org/news/2026-05-sea-area <-- shared technical article
    --
    doi.org/10.1038/s41467-026-722 <-- shared paper
    --
    [#VLM = vertical land motion; = absolute sea-level; = relative sea-level; = (global) Glacial Isostatic Adjustment; = Interferometric Synthetic Aperture Radar; = Global Navigation Satellite System (~GPS); = paper, doi.org/10.1038/s41561-023-013, interpolated VLM reconstruction based on the joint analysis of GNSS, tide gauges (TGs), and satellite altimetry]

  40. Как Vision-Language Models учатся работать с 3D-миром

    Привет, Хабр! Сегодня поговорим о том, как роботы работают с предметами в реальной жизни. Современные роботы умеют выполнять множество простых операций, но терпят катастрофический провал в задачах, требующих понимания трехмерных пространственных отношений и физической осуществимости действий. Попробуем разобраться, как с помощью vision-language models (VLM) роботы учатся работать с предметами в пространстве.

    habr.com/ru/companies/ru_mts/a

    #VLM #VisionLanguage_Models #робототехника #компьютерное_зрение #3Dмоделирование #spatial_reasoning #retrievalaugmented_generation #NVIDIA #манипуляторы #искусственный_интеллект

  41. Как Vision-Language Models учатся работать с 3D-миром

    Привет, Хабр! Сегодня поговорим о том, как роботы работают с предметами в реальной жизни. Современные роботы умеют выполнять множество простых операций, но терпят катастрофический провал в задачах, требующих понимания трехмерных пространственных отношений и физической осуществимости действий. Попробуем разобраться, как с помощью vision-language models (VLM) роботы учатся работать с предметами в пространстве.

    habr.com/ru/companies/ru_mts/a

    #VLM #VisionLanguage_Models #робототехника #компьютерное_зрение #3Dмоделирование #spatial_reasoning #retrievalaugmented_generation #NVIDIA #манипуляторы #искусственный_интеллект

  42. Как Vision-Language Models учатся работать с 3D-миром

    Привет, Хабр! Сегодня поговорим о том, как роботы работают с предметами в реальной жизни. Современные роботы умеют выполнять множество простых операций, но терпят катастрофический провал в задачах, требующих понимания трехмерных пространственных отношений и физической осуществимости действий. Попробуем разобраться, как с помощью vision-language models (VLM) роботы учатся работать с предметами в пространстве.

    habr.com/ru/companies/ru_mts/a

    #VLM #VisionLanguage_Models #робототехника #компьютерное_зрение #3Dмоделирование #spatial_reasoning #retrievalaugmented_generation #NVIDIA #манипуляторы #искусственный_интеллект

  43. Axera AX650N: архитектура Edge ML SoC под CNN, LLM и VLM

    Большинство задач современной робототехники так или иначе завязаны на нейронных сетях: детекция объектов, оценка глубины, локализация, планирование. Всё это ресурсоёмко, и вопрос выбора компактного вычислителя (достаточно часто алгоритмы должны работать локально) встает довольно остро. На практике выбор сводится к трём классам устройств: NVIDIA Jetson , внешний ускоритель (один из самых популярных — Hailo) и китайский (не всегда, конечно, но в современных реалиях обычно китайский) SoC с интегрированным NPU. В этой статье я рассмотрю представителя третьего класса — Axera AX650N , а NVIDIA Jetson будет использоваться для сравнения, так как это единственное массовое edge-решение с универсальными вычислительными ядрами (CUDA) . Это первая часть цикла. Здесь я разберу аппаратную архитектуру самого AX650N — CPU, NPU, DSP, ISP, память — и поделюсь результатами первых тестов: YOLO, Depth Anything, SuperPoint и мультимодальный Qwen3. Подробные бенчмарки и сравнения — во второй части. Я тестировал AX650N в рамках готового устройства от Sipeed — Maix4 Hat . Он состоит из двух частей: SoM , на котором расположены SoC и 8 GB RAM (2x4 GB, так как у AX650N два отдельных DDR-контроллера) , и baseboard от Sipeed с минимальным количеством интерфейсов. Скромность интерфейсов объясняется просто: baseboard — это HAT для Raspberry Pi 5, подключающийся по PCIe 2.0. В такой конфигурации AX650N работает как внешний ML-ускоритель, аналогично Hailo . В рамках этой и последующих статей я буду использовать Maix4 Hat как самостоятельный микрокомпьютер.

    habr.com/ru/articles/1035776/

    #Axera #NPU #VLM #llm #embedded #cnn #нейросети #sipeed #электроника #компьютерное_зрение

  44. Axera AX650N: архитектура Edge ML SoC под CNN, LLM и VLM

    Большинство задач современной робототехники так или иначе завязаны на нейронных сетях: детекция объектов, оценка глубины, локализация, планирование. Всё это ресурсоёмко, и вопрос выбора компактного вычислителя (достаточно часто алгоритмы должны работать локально) встает довольно остро. На практике выбор сводится к трём классам устройств: NVIDIA Jetson , внешний ускоритель (один из самых популярных — Hailo) и китайский (не всегда, конечно, но в современных реалиях обычно китайский) SoC с интегрированным NPU. В этой статье я рассмотрю представителя третьего класса — Axera AX650N , а NVIDIA Jetson будет использоваться для сравнения, так как это единственное массовое edge-решение с универсальными вычислительными ядрами (CUDA) . Это первая часть цикла. Здесь я разберу аппаратную архитектуру самого AX650N — CPU, NPU, DSP, ISP, память — и поделюсь результатами первых тестов: YOLO, Depth Anything, SuperPoint и мультимодальный Qwen3. Подробные бенчмарки и сравнения — во второй части. Я тестировал AX650N в рамках готового устройства от Sipeed — Maix4 Hat . Он состоит из двух частей: SoM , на котором расположены SoC и 8 GB RAM (2x4 GB, так как у AX650N два отдельных DDR-контроллера) , и baseboard от Sipeed с минимальным количеством интерфейсов. Скромность интерфейсов объясняется просто: baseboard — это HAT для Raspberry Pi 5, подключающийся по PCIe 2.0. В такой конфигурации AX650N работает как внешний ML-ускоритель, аналогично Hailo . В рамках этой и последующих статей я буду использовать Maix4 Hat как самостоятельный микрокомпьютер.

    habr.com/ru/articles/1035776/

    #Axera #NPU #VLM #llm #embedded #cnn #нейросети #sipeed #электроника #компьютерное_зрение

  45. Axera AX650N: архитектура Edge ML SoC под CNN, LLM и VLM

    Большинство задач современной робототехники так или иначе завязаны на нейронных сетях: детекция объектов, оценка глубины, локализация, планирование. Всё это ресурсоёмко, и вопрос выбора компактного вычислителя (достаточно часто алгоритмы должны работать локально) встает довольно остро. На практике выбор сводится к трём классам устройств: NVIDIA Jetson , внешний ускоритель (один из самых популярных — Hailo) и китайский (не всегда, конечно, но в современных реалиях обычно китайский) SoC с интегрированным NPU. В этой статье я рассмотрю представителя третьего класса — Axera AX650N , а NVIDIA Jetson будет использоваться для сравнения, так как это единственное массовое edge-решение с универсальными вычислительными ядрами (CUDA) . Это первая часть цикла. Здесь я разберу аппаратную архитектуру самого AX650N — CPU, NPU, DSP, ISP, память — и поделюсь результатами первых тестов: YOLO, Depth Anything, SuperPoint и мультимодальный Qwen3. Подробные бенчмарки и сравнения — во второй части. Я тестировал AX650N в рамках готового устройства от Sipeed — Maix4 Hat . Он состоит из двух частей: SoM , на котором расположены SoC и 8 GB RAM (2x4 GB, так как у AX650N два отдельных DDR-контроллера) , и baseboard от Sipeed с минимальным количеством интерфейсов. Скромность интерфейсов объясняется просто: baseboard — это HAT для Raspberry Pi 5, подключающийся по PCIe 2.0. В такой конфигурации AX650N работает как внешний ML-ускоритель, аналогично Hailo . В рамках этой и последующих статей я буду использовать Maix4 Hat как самостоятельный микрокомпьютер.

    habr.com/ru/articles/1035776/

    #Axera #NPU #VLM #llm #embedded #cnn #нейросети #sipeed #электроника #компьютерное_зрение

  46. Is there a FOSS model that does #OCR using #VLM #LLM machine vision learning tricks to get text of tricky docs where #tesseract fails? Using #apitokens to get #chatgpt & co to do it is stomach-turning....

  47. Is there a FOSS model that does using machine vision learning tricks to get text of tricky docs where fails? Using to get & co to do it is stomach-turning....

  48. Is there a FOSS model that does #OCR using #VLM #LLM machine vision learning tricks to get text of tricky docs where #tesseract fails? Using #apitokens to get #chatgpt & co to do it is stomach-turning....

  49. Is there a FOSS model that does #OCR using #VLM #LLM machine vision learning tricks to get text of tricky docs where #tesseract fails? Using #apitokens to get #chatgpt & co to do it is stomach-turning....

  50. Is there a FOSS model that does #OCR using #VLM #LLM machine vision learning tricks to get text of tricky docs where #tesseract fails? Using #apitokens to get #chatgpt & co to do it is stomach-turning....