#multimodal_llm — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #multimodal_llm, aggregated by home.social.
-
SLAY-ASR, или как я перестал волноваться и полюбил тренировать модели
Как добавить аудио-модальность в LLMку максимально экономно? Рассказываю про серию попыток добиться совместимости эмбеддингов разной природы Погрузиться
https://habr.com/ru/articles/1009614/
#representation_learning #multimodality #multimodal_llm #machine_learning #audiomodality #regularization #contrastive_learning #whisper #gemma3
-
SLAY-ASR, или как я перестал волноваться и полюбил тренировать модели
Как добавить аудио-модальность в LLMку максимально экономно? Рассказываю про серию попыток добиться совместимости эмбеддингов разной природы Погрузиться
https://habr.com/ru/articles/1009614/
#representation_learning #multimodality #multimodal_llm #machine_learning #audiomodality #regularization #contrastive_learning #whisper #gemma3
-
SLAY-ASR, или как я перестал волноваться и полюбил тренировать модели
Как добавить аудио-модальность в LLMку максимально экономно? Рассказываю про серию попыток добиться совместимости эмбеддингов разной природы Погрузиться
https://habr.com/ru/articles/1009614/
#representation_learning #multimodality #multimodal_llm #machine_learning #audiomodality #regularization #contrastive_learning #whisper #gemma3
-
Основные метрики DeepEval для тестирования AI. Возможности и способы применения
DeepEval - фреймворк для оценки работы AI с открытым исходным кодом. Содержит в себе множество метрик и бенчмарков для оценки качества работы AI моделей, а также предоставляет инструменты для аналитики изменений качества работы в течение разных периодов времени. В предыдущей статье мы уже частично осветили имеющиеся у DeepEval метрики (метрики для оценки RAG). В этой статье постараемся объяснить, какой еще функционал предлагается DeepEval для работы с AI.
https://habr.com/ru/articles/955314/
#тестирование #ai #искусственный_интеллект #искусственный_интелект #aiagent #aiагенты #mcpserver #conversational_ai #multimodal_llm #multimodal_large_language_models
-
Основные метрики DeepEval для тестирования AI. Возможности и способы применения
DeepEval - фреймворк для оценки работы AI с открытым исходным кодом. Содержит в себе множество метрик и бенчмарков для оценки качества работы AI моделей, а также предоставляет инструменты для аналитики изменений качества работы в течение разных периодов времени. В предыдущей статье мы уже частично осветили имеющиеся у DeepEval метрики (метрики для оценки RAG). В этой статье постараемся объяснить, какой еще функционал предлагается DeepEval для работы с AI.
https://habr.com/ru/articles/955314/
#тестирование #ai #искусственный_интеллект #искусственный_интелект #aiagent #aiагенты #mcpserver #conversational_ai #multimodal_llm #multimodal_large_language_models
-
Основные метрики DeepEval для тестирования AI. Возможности и способы применения
DeepEval - фреймворк для оценки работы AI с открытым исходным кодом. Содержит в себе множество метрик и бенчмарков для оценки качества работы AI моделей, а также предоставляет инструменты для аналитики изменений качества работы в течение разных периодов времени. В предыдущей статье мы уже частично осветили имеющиеся у DeepEval метрики (метрики для оценки RAG). В этой статье постараемся объяснить, какой еще функционал предлагается DeepEval для работы с AI.
https://habr.com/ru/articles/955314/
#тестирование #ai #искусственный_интеллект #искусственный_интелект #aiagent #aiагенты #mcpserver #conversational_ai #multimodal_llm #multimodal_large_language_models
-
Что я вынес из Oxford Machine Learning Summer School 2025
Побывал на Oxford Machine Learning Summer School 2025 — одной из крупнейших летних школ, посвящённых искусственному интеллекту, проходившей в самом центре Оксфорда. В течение четырёх дней мы слушали лекции исследователей из DeepMind, Hugging Face, Amazon, Google, ученых топовых европейских вузов. Обсуждали foundation models, reinforcement learning, generative AI и on-device ML. В статье делюсь своими впечатлениями и кратким пересказом программы, отражающей мировые тренды в развитии современного машинного обучения.
https://habr.com/ru/articles/956138/
#машинное_обучение #llm #computer_vision #multimodal_llm #generative_ai #reinforcementlearning #edge_ai #diffusion_models #образование_в_it #oxford
-
MWS Vision Bench: первый русскоязычный бенчмарк для бизнес‑OCR в эпоху мультимодалок
Мультимодальные LLM уже умеют «читать» документы — от договоров и таблиц до рукописей и диаграмм. Но измерять их качество на реальных бизнес‑сценариях негде и нечем, особенно если дело касается работы с тяжелым OCR-контентом на русском. Мы собрали MWS Vision Bench — бенчмарк из 5 практических заданий: полностраничный OCR (страница→текст), структурированный OCR (страница→markdown), grounding (координаты текста), KIE/JSON (извлечение ключей) и VQA (вопрос‑ответ). Размер: 800 изображений, 2580 вопросов (валидация - 1 302, тест - 1 278). Код и валидационный сплит открываем; приватный тест — по запросу. Повторить запуск можно менее чем за 1 час. За подробностями
https://habr.com/ru/companies/mts_ai/articles/953292/
#llmмодели #multimodal_llm #vlm #бенчмарки #бенчмарки_бям #мультимодальность #мультимодальные_модели #датасеты
-
Новый вид контента: ИИллюстрированная аудиокнига
Недавно мне пришла в голову идея написать приложение для автоматической генерации иллюстраций к аудиокнигам. Видео-модели пока не умеют создавать длинные видео, но ведь можно экранизировать аудиокниги с помощью серии иллюстраций! Эта идея меня захватила, и я написал небольшой проект...
-
Понимает ли Vision Llama импрессионистов?
Всем привет, меня зовут Арсений, я Data Scientist в компании Raft, и сегодня я расскажу вам про Visual Language Models (VLM). Большие языковые модели уже стали частью нашей жизни и мы применяем их, чтобы упростить современную рутину, а так же используем для решения бизнес задач. Недавно вышло новое поколение vision transformer моделей, которые заметно упростили анализ изображений, из какой бы сферы эти изображения не были. Особенно заметным был сентябрьский релиз Llama-3.2-11b, и не только потому что это первая vision модель от Llama, сколько потому, что с ней вместе вышло целое семейство моделей, включая маленькие на 1B и 3B параметров. А как вы знаете, меньше, значит юзабельнее.
https://habr.com/ru/companies/raft/articles/857118/
#Vision_Transformers #Vision_Language_Models #multimodal_llm #Llama32 #qwen2vl #llava #art #art_history