#vlm — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #vlm, aggregated by home.social.
-
Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском
Вам нужен OCR. В техобзорах рекомендуют Tesseract, на Хабре все пишут про VLM, идете на Hugging Face — там PaddleOCR-VL, DeepSeek-OCR, Dots.OCR, Qwen2.5-VL, и каждая называет себя SOTA. Прибавим к этому vLLM, SGLang, TGI, Native HF Transformers, и вот вы зависли между десятками комбинаций. Мы протестировали девять моделей на трех движках инференса на рукописном русском и отразили в таблице, какая модель под какую задачу лучше подходит. Велком под кат за таблицей и историей ее создания
https://habr.com/ru/companies/mts_ai/articles/1065182/
#OCR #vlm #mws_ai #распознавание_изображений #распознавание_текста #бенчмарки #искусственный_интеллект #ml #инференс_ллм #движки
-
Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 2
В прошлой части мы разобрали матчасть: почему классическая робототехника уперлась в потолок, как языковые модели превратились в VLA и на каких станках куется «физический интеллект». Теперь — про то, как все это живет в реальности. Про экономику, промышленность, государственные программы и человеческую природу.
https://habr.com/ru/companies/bothub/articles/1062340/
#робот #робототехника #VLA #VLM #PhysicalAI #LLM #teach_pendant #гуманоид #гуманоидные_роботы #автономность
-
Большой разбор Physical AI: VLA-модели, гуманоиды, гонка Китая и США и что есть у России. Часть 1
Сколько времени вам нужно, чтобы сложить футболку? Секунды три, если аккуратно. Пять, если совсем аккуратно. А теперь другой вопрос. Как вы думаете, сколько лет понадобилось мировой робототехнике, чтобы машина сложила ту же футболку сама — без жестко прописанной программы, без специальной оснастки, просто взяв мятую тряпку из корзины? Отвечаю: примерно шестьдесят. Первый промышленный робот встал на конвейер General Motors в 1961 году, а уверенно складывающего белье робота впервые показали осенью 2024-го. И это, честно говоря, было событием покрупнее многих громких презентаций.
https://habr.com/ru/companies/bothub/articles/1062198/
#робот #робототехника #VLA #VLM #PhysicalAI #LLM #teach_pendant #гуманоид #гуманоидные_роботы #автономность
-
Photo Of The Day 21st July 2026.
Tails Tuesday 21st July 2026.https://mancavgeek.co.uk/2026/07/21/photo-of-the-day-21st-july-2026/
-
Photo Of The Day 21st July 2026.
Tails Tuesday 21st July 2026.https://mancavgeek.co.uk/2026/07/21/photo-of-the-day-21st-july-2026/
-
Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора
Современный поиск по видеоконтенту — это высоконагруженная система, требующая молниеносной реакции и безупречной релевантности. Сервис VK Видео оперирует колоссальной базой в 500 миллионов видеороликов и ежедневно обрабатывает около 10 миллионов запросов пользователей. При времени ответа в 0,5 секунды и нагрузке в 1800 RPS алгоритмам необходимо моментально находить именно тот контент, который ожидает увидеть зритель. Однако развитие алгоритмов ранжирования невозможно без качественных данных, на которых они обучаются. Традиционный подход с использованием ручной разметки асессорами долгое время оставался индустриальным стандартом, но на масштабах сотен тысяч видео он неизбежно становится бутылочным горлышком продуктовой разработки. Меня зовут Владислав Чернышев, я руководитель группы качества поиска по видео в AI VK. В этой статье подробно расскажу про путь перехода от классической ручной разметки к гибридной VLM-системе, разберу ошибки и инфраструктурные барьеры, которые пришлось преодолеть для кратного ускорения процессов подготовки обучающих датасетов и офлайн-оценки качества поиска. Переходим к VLV-системе
https://habr.com/ru/companies/vk/articles/1057830/
#aivk #поиск #поиск_видео #видеоконтент #vk_видео #vlm #видеопоиск
-
От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев
Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️
https://habr.com/ru/companies/X5Tech/articles/1054688/
#computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл
-
Как мы построили сервис компьютерного зрения на базе внешних VLM для контроля выкладки и ценников: опыт Fix Price
Привет, Хабр! Меня зовут Кристина Истратова и я руковожу центром аналитики данных в Fix Price . В нашей Сети более 8 000 магазинов, а в каждом из них — множество товаров. Думаю, все из нас знают, как покупатели реагируют на отсутствие ценника или неверную цену на нем, какие чувства вызывает пустая полка, где нет товара, за которым приходишь в магазин.
https://habr.com/ru/companies/fix_price/articles/1053156/
#vlm #ии #osa #ml #машинное+обучение #машинное_обучение #изображения #разработка
-
[Перевод] Почему промпты для VLM работают наоборот: как это исправить
Недавно я пытался выжать максимум из корпоративной OCR-модели, перебирая промпты и гиперпараметры, когда наткнулся на issue в репозитории Qwen-3-VL. Автор утверждал, что точность задачи выросла просто от изменения порядка: сначала изображение, потом текст. Просто перестановка блоков.
https://habr.com/ru/articles/1049176/
#prompt_engineering #vlm #ocr #Qween #Gemma #Positional_Encoding
-
От 0 до 10 миллионов ИИ-проверок в месяц: как мы продуктивизировали CV в Пятёрочке за 8 месяцев
Статья про то, как CV-сервис вырос с MVP до 10 миллионов проверок фото в месяц и не развалился в проде. 🔧 Это не про «у нас классные модели» и не про «просто прикрутили YOLO», а про честную инженерную продуктивизацию. Про то как универсальный классификатор путал фарш с грязью, почему часть анкет всё равно лучше отдавать человеку, зачем отдельно мониторить качество моделей и что приходится чинить, когда реальный мир меняется быстрее обучающей выборки. Внутри: компьютерное зрение, 26 моделей, 62 проверки, CNN, VLM, Triton, vLLM, Kafka, Human-in-the-loop, мониторинг качества, сезонность, баги под нагрузкой и немного «веган-версии ИИ». Заходите, читайте и делитесь своим опытом продакшена ML-сервисов ❤️
https://habr.com/ru/companies/X5Tech/articles/1047946/
#computer_vision #multimodal #yolo #resnet #vlm #cnn #tritoninferenceserver #humanintheloop #kafka #ритейл
-
Photo of the Day 10th June 2026.
On This Day 10th June 1993.https://mancavgeek.co.uk/2026/06/10/photo-of-the-day-10th-june-2026/
-
Photo of the Day 10th June 2026.
On This Day 10th June 1993.https://mancavgeek.co.uk/2026/06/10/photo-of-the-day-10th-june-2026/
-
📯„Karikaturen digitaler Umwelten: Computer-Natur-Beziehungen im Anthropozän mit Vision Language Models erforschen“ präsentiert Martin Schmitt (Universität Paderborn) im #DigitalHistoryOFK in dieser Woche.
Anhand von 1.250 Computerkarikaturen zeigt er, wie Computer-Vision-Modelle neue Perspektiven auf digitale Kulturen und #Umweltgeschichte eröffnen.
📅3.06.26, 16Uhr (CET), im ZZF & online
ℹ️https://dhistory.hypotheses.org/13713 -
📯„Karikaturen digitaler Umwelten: Computer-Natur-Beziehungen im Anthropozän mit Vision Language Models erforschen“ präsentiert Martin Schmitt (Universität Paderborn) im #DigitalHistoryOFK in dieser Woche.
Anhand von 1.250 Computerkarikaturen zeigt er, wie Computer-Vision-Modelle neue Perspektiven auf digitale Kulturen und #Umweltgeschichte eröffnen.
📅3.06.26, 16Uhr (CET), im ZZF & online
ℹ️https://dhistory.hypotheses.org/13713 -
От OCR к смыслу: как мы научили модель понимать, кто кому отец, мать, жених и свидетель
В 2023 году мы рассказывали, как в Поиске по архивам появилось распознавание рукописных документов и почему сама по себе расшифровка архивного текста — нетривиальная задача. Старые почерки, сложная вёрстка, нестандартные формулировки и огромное разнообразие источников делают архивы трудным доменом даже для сильных OCR‑моделей. По мере развития сервиса стало ясно, что одной только расшифровки недостаточно: чтобы действительно помогать пользователям находить своих родственников, нужно не просто видеть слова на скане, а понимать, кто именно упомянут в записи, в какой роли и как связан с другими людьми. Теперь в Поиске по архивам работает новая модель распознавания документов. Она не только распознаёт текст архивного файла, но и структурирует информацию из него. Например, понимает роли и связи между разными людьми: «родившийся», «отец» и «мать» для рождения или «жених», «невеста», «свидетель» для брака. Меня зовут Даша Виноградова, я руковожу универсальными применениями компьютерного зрения в Яндексе. Вместе с Аней Сидоровой, главным разработчиком распознавания архивов, мы расскажем, как мы сделали шаг от распознавания текста к извлечению структуры и смысла из архивных документов: как мы перестраивали OCR‑пайплайн, почему нам не подошли универсальные VLM‑модели и как пытались разобраться, кто есть кто: отец, мать, жених или свидетель.
-
Sea Levels Rising Dramatically In Some Areas Due To Land Subsidence [global]
--
https://phys.org/news/2026-05-sea-areas-due-subsidence.html <-- shared technical article
--
https://doi.org/10.1038/s41467-026-72293-z <-- shared paper
--
[#VLM = vertical land motion; #ASL = absolute sea-level; #RSL = relative sea-level; #GIA = (global) Glacial Isostatic Adjustment; #inSAR = Interferometric Synthetic Aperture Radar; #GNSS = Global Navigation Satellite System (~GPS); #OE24 = paper, https://doi.org/10.1038/s41561-023-01357-2, interpolated VLM reconstruction based on the joint analysis of GNSS, tide gauges (TGs), and satellite altimetry]
#GIS #spatial #mapping #remotesensing #earthobservation #sealevel #verticallandmotion #absolutesealevel #relativesealevel #GlacialIsostaticAdjustment #geomorphometry #SLR #sealevelrise #coast #coastal #flood #flooding #subsidence #landmass #landsubsidence #global #globalsealevelrise #climatechange #city #urban #farmlands #population #demographics #cities #planning #community #elevation #monitoring #spatialanalysis #spatiotemporal #altimetry -
Sea Levels Rising Dramatically In Some Areas Due To Land Subsidence [global]
--
https://phys.org/news/2026-05-sea-areas-due-subsidence.html <-- shared technical article
--
https://doi.org/10.1038/s41467-026-72293-z <-- shared paper
--
[#VLM = vertical land motion; #ASL = absolute sea-level; #RSL = relative sea-level; #GIA = (global) Glacial Isostatic Adjustment; #inSAR = Interferometric Synthetic Aperture Radar; #GNSS = Global Navigation Satellite System (~GPS); #OE24 = paper, https://doi.org/10.1038/s41561-023-01357-2, interpolated VLM reconstruction based on the joint analysis of GNSS, tide gauges (TGs), and satellite altimetry]
#GIS #spatial #mapping #remotesensing #earthobservation #sealevel #verticallandmotion #absolutesealevel #relativesealevel #GlacialIsostaticAdjustment #geomorphometry #SLR #sealevelrise #coast #coastal #flood #flooding #subsidence #landmass #landsubsidence #global #globalsealevelrise #climatechange #city #urban #farmlands #population #demographics #cities #planning #community #elevation #monitoring #spatialanalysis #spatiotemporal #altimetry -
Как Vision-Language Models учатся работать с 3D-миром
Привет, Хабр! Сегодня поговорим о том, как роботы работают с предметами в реальной жизни. Современные роботы умеют выполнять множество простых операций, но терпят катастрофический провал в задачах, требующих понимания трехмерных пространственных отношений и физической осуществимости действий. Попробуем разобраться, как с помощью vision-language models (VLM) роботы учатся работать с предметами в пространстве.
https://habr.com/ru/companies/ru_mts/articles/1035508/
#VLM #VisionLanguage_Models #робототехника #компьютерное_зрение #3Dмоделирование #spatial_reasoning #retrievalaugmented_generation #NVIDIA #манипуляторы #искусственный_интеллект
-
Axera AX650N: архитектура Edge ML SoC под CNN, LLM и VLM
Большинство задач современной робототехники так или иначе завязаны на нейронных сетях: детекция объектов, оценка глубины, локализация, планирование. Всё это ресурсоёмко, и вопрос выбора компактного вычислителя (достаточно часто алгоритмы должны работать локально) встает довольно остро. На практике выбор сводится к трём классам устройств: NVIDIA Jetson , внешний ускоритель (один из самых популярных — Hailo) и китайский (не всегда, конечно, но в современных реалиях обычно китайский) SoC с интегрированным NPU. В этой статье я рассмотрю представителя третьего класса — Axera AX650N , а NVIDIA Jetson будет использоваться для сравнения, так как это единственное массовое edge-решение с универсальными вычислительными ядрами (CUDA) . Это первая часть цикла. Здесь я разберу аппаратную архитектуру самого AX650N — CPU, NPU, DSP, ISP, память — и поделюсь результатами первых тестов: YOLO, Depth Anything, SuperPoint и мультимодальный Qwen3. Подробные бенчмарки и сравнения — во второй части. Я тестировал AX650N в рамках готового устройства от Sipeed — Maix4 Hat . Он состоит из двух частей: SoM , на котором расположены SoC и 8 GB RAM (2x4 GB, так как у AX650N два отдельных DDR-контроллера) , и baseboard от Sipeed с минимальным количеством интерфейсов. Скромность интерфейсов объясняется просто: baseboard — это HAT для Raspberry Pi 5, подключающийся по PCIe 2.0. В такой конфигурации AX650N работает как внешний ML-ускоритель, аналогично Hailo . В рамках этой и последующих статей я буду использовать Maix4 Hat как самостоятельный микрокомпьютер.
https://habr.com/ru/articles/1035776/
#Axera #NPU #VLM #llm #embedded #cnn #нейросети #sipeed #электроника #компьютерное_зрение
-
Is there a FOSS model that does #OCR using #VLM #LLM machine vision learning tricks to get text of tricky docs where #tesseract fails? Using #apitokens to get #chatgpt & co to do it is stomach-turning....
-
Is there a FOSS model that does #OCR using #VLM #LLM machine vision learning tricks to get text of tricky docs where #tesseract fails? Using #apitokens to get #chatgpt & co to do it is stomach-turning....
-
Browser agent için 8 gorsel LLM'i ekran goruntusu temellendirmede kıyasladık.
Şaşırtıcı bulgu: Qwen 3.5-9B, 308B parametreli MiMo V2.5'in kaçırdığı bir dropdown affordance'ını doğru sınıflandırıyor. Affordance parametre sayısıyla ölçeklenmiyor.
8 modelden sadece 1'i (Qwen 3.6-35B-A3B) kalibrasyonda dürüst belirsizlik gösteriyor.
Detaylı yazı + VRAM önerileri:
https://webbrain.one/blogGitHub'da ⭐ atarsanız çok seviniriz 🙏
https://github.com/esokullu/webbrain -
Browser agent için 8 gorsel LLM'i ekran goruntusu temellendirmede kıyasladık.
Şaşırtıcı bulgu: Qwen 3.5-9B, 308B parametreli MiMo V2.5'in kaçırdığı bir dropdown affordance'ını doğru sınıflandırıyor. Affordance parametre sayısıyla ölçeklenmiyor.
8 modelden sadece 1'i (Qwen 3.6-35B-A3B) kalibrasyonda dürüst belirsizlik gösteriyor.
Detaylı yazı + VRAM önerileri:
https://webbrain.one/blogGitHub'da ⭐ atarsanız çok seviniriz 🙏
https://github.com/esokullu/webbrain -
Робот, способный создать себя сам. Режим «Инженера» в робототехнике
Скажите роботу «настрой манипулятор» — и он напишет драйвер сам. Звучит как фантастика из тех самых фильмов 80-х и 90-х, но мы уже реализовали это в OpenGrall. Рассказываю, как работает режим Инженера и почему последнее слово всегда остаётся за человеком
https://habr.com/ru/articles/1030526/
#LLM #VLM #робототехника #OpenGrall #ИИ #Python #WebSocket #YandexGPT #DeepSeek #самокодинг
-
Робот, способный создать себя сам. Режим «Инженера» в робототехнике Скажите роботу «настрой манипулятор» ...
#LLM #VLM #робототехника #OpenGrall #ИИ #Python #WebSocket #YandexGPT #DeepSeek #самокодинг
Origin | Interest | Match -
z.ai GLM 5.1: Как я научил слепую модель видеть
Если у вас есть неограниченный доступ к фронтир моделям (Calude, Codex и т.д.), то эта статья не для вас. Сегодня доступны отличные недорогие модели для кодинга и архитектуры. Например, GLM-5.1 (реферальная ссылка +10% бонус на пополнение) умеет генерировать, рефакторить, отлаживать код, строить архитектуру – в десятки раз дешевле фронтит моделей или вообще бесплатно при локальном развёртывании. Но у всех таких моделей часто есть общая слепая зона: они не видят результат своей работы . В этой статье я рассказываю, как "научить модель видеть".
https://habr.com/ru/articles/1029682/
#MCP #vision #VLM #qwen3vl #Ollama #кодингагент #тестирование #скриншот #opensource #prompttuning
-
手書き・チェック・丸印も認識できる?OCI Generative AI の VLM で伝票を読ませてみた
https://qiita.com/engchina/items/7accb885f62d28b67a88?utm_campaign=popular_items&utm_medium=feed&utm_source=popular_items -
RE: https://mastodon.social/@xlth/116144192667591833
Not the ideal conditions for geospatial applications of VLMs 😅
#GIScience #VLM #spatiotemporal #MobilityDataScience #SpatialDataScience
-
Vertical Land Motion And Human Exposure Across India's Coastal Regions
--
https://doi.org/10.1029/2025GL120539 <-- shared paper 🔗
--
https://www.indiaspend.com/climate-change/indias-coastal-cities-face-heavy-flooding-risk-due-to-sea-level-rise-970906 <-- shared media article 🔗
--
#SeaLevelRise #Subsidence #India #InSAR #radar #Postdoc #GIS #spatial #mapping #inSAR #LandSubsidence #remotesensing #coast #coastal #coastline #India #earthobservation #subsidence #rise #urban #city #SLR #ClimateChange #spatialanalysis #spatiotemporal #marine #ocean #water #hydrology #risk #hazard #humanimpacts #flood #flooding #model #modeling #floodrisk #infrastructure #damage #costs #economics #verticallandmotion #VLM #ESA #Sentinel #Ahmedabad #Chennai #Amaravathi #Kochi #Kakinada #Kolkata #deltas #estuary #demographics #population #coastalsubsidence #landuse #planning #mitigation #farmland #agriculture #foodsecurity #groundwater #pumping #extraction -
Manchester Monday 23rd February 2026.
[…]https://mancavgeek.co.uk/2026/02/23/manchester-monday-23rd-february-2026/
-
Updated "Captions With Attitude" to use the new yzma release, and now it runs without CGo just using the webcam and browser + pure Go server.
Have a fun weekend!
-
Aviation weather for Teniente Coronel Rafael Pabón airport in Villamontes area (Bolivia) is “SLVM 101600Z 00000KT 9999 NSC 37/20 Q1008” : See what it means on https://www.bigorre.org/aero/meteo/slvm/en #tenientecoronelrafaelpabonairport #airport #villamontes #bolivia #slvm #vlm #metar #aviation #aviationweather #avgeek vl
-
yzma 1.7 is out! With support for the very latest llama.cpp features and models, hardware acceleration, and all from Go without needing CGo.
You should go get it right now!
-
Sipeed MaixCAM2 combines 4K imaging and edge AI in an open camera platform
-
Raspberry Pi AI HAT+ 2 Enables Generative AI on Raspberry Pi 5
-
"Captions With Attitude" in your browser from your webcam generated by a Vision Language Model (VLM) from a Go program running entirely on your local machine using llama.cpp!
-
Building Damage Risk In Sinking Indian Megacities
--
https://doi.org/10.1038/s41893-025-01663-0 <-- shared paper
--
https://doi.org/10.5194/isprs-annals-X-G-2025-613-2025 <-- shared paper
--
https://www.downtoearth.org.in/urbanisation/writing-on-the-wall-groundwater-exploitation-is-triggering-subsidence-in-indo-gangetic-plain-90523 <-- shared media article
--
#GIS #spatial #mapping #spatialanalysis #India #subsidence #risk #hazard #groundwater #depletion #exploitation #pumping #sinking #overpumping #aquifer #watermanagement #structural #damage #infrastructure #cost #residential #publicsafety #economics #engineering #construction #buildingcodes #remotesensing #model #modeling #satellite #earthobservation #elevation #megacities #city #cities #urban #differential #settlement #planning #policy #mitigation #maintainence #inSAR #verticallandmovement #VLM #engineeringgeology #geostatistics #flood #flooding #sediment -
"Cutting-edge Open OCR Models / We’ve seen an incredible wave of new models this past year. Because so much work is happening in the open, these players build on and benefit from each other’s work. A great example is AllenAI’s release of OlmOCR, which not only released a model but also the dataset used to train it. With these, others can build upon them in new directions. The field is incredibly active, but it’s not always obvious which model to use."
-
yzma is a new Go package for local inference with Vision Language Models (VLMs) & Large Language Models (LLMs) using llama.cpp without CGo.