#asr — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #asr, aggregated by home.social.
-
📰 CALCIOMERCATO | Koné, si muove l’Al-Ahli: contatti avviati con la Roma
#️⃣ #Calciomercato #asroma #ASR #asromanews #dajeroma #thelabsocial @altbot
🔗 https://www.giallorossi.net/calciomercato-kone-si-muove-lal-ahli-contatti-avviati-con-la-roma/
-
I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.
I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.
https://codeberg.org/cryptomilk/crane-wyoming
#homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust
-
I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.
I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.
https://codeberg.org/cryptomilk/crane-wyoming
#homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust
-
I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.
I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.
https://codeberg.org/cryptomilk/crane-wyoming
#homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust
-
I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.
I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.
https://codeberg.org/cryptomilk/crane-wyoming
#homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust
-
I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.
I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.
https://codeberg.org/cryptomilk/crane-wyoming
#homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust
-
Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов
Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.
https://habr.com/ru/articles/1058944/
#ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл
-
Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов
Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.
https://habr.com/ru/articles/1058944/
#ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл
-
Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов
Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.
https://habr.com/ru/articles/1058944/
#ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл
-
自動車由来廃プラからケミカルリサイクル油を生産 循環型社会目指す出光興産グループ
https://www.kyodo.co.jp/sponsored/2026-07-02_4020321/#kyodo #SPONSORED #ASR #CRJ #CR油 #カーボンニュートラル #ケミカルリサイクル_ジャパン #ケミカルリサイクル油 #サーマルリサイクル #プラスチック #マテリアルリサイクル #出光興産 #出光興産グループ #岡村仁彦 #廃プラ
-
Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS
Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.
https://habr.com/ru/articles/1054566/
#iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS
-
Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS
Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.
https://habr.com/ru/articles/1054566/
#iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS
-
Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS
Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.
https://habr.com/ru/articles/1054566/
#iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS
-
audiogear: как разметить миллионы аудиозаписей для TTS
Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт.
-
Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте
Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...
https://habr.com/ru/articles/1051580/
#Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source
-
Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте
Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...
https://habr.com/ru/articles/1051580/
#Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source
-
Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте
Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...
https://habr.com/ru/articles/1051580/
#Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source
-
Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ
Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранном и записывать все руками, но в потоке задач это неудобно. Гораздо проще надиктовать мысли голосом или записать разговор, а расшифровку доверить сервису. Сегодня ASR-системы нового поколения способны учитывать контекст беседы и выдавать осмысленный текст. Однако у любой медали есть обратная сторона — архитектурные ограничения. Чтобы понять, готовы ли эти модели к жизненным сценариям, мы устроили им бенчмарк на Hugging Face. Ниже — разбор того, ломается ли контекстное окно алгоритмов на длинных видеозаписях и как фоновый шум влияет на итоговое качество транскрибации.
https://habr.com/ru/companies/selectel/articles/1050826/
#selectel #распознавание_речи #whisper #qwen #asr #транскрибация_речи #автоматическое_распознавание_речи #искусственный_интеллект #тестирование_моделей
-
Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли
«ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.
https://habr.com/ru/articles/1050336/
#ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup
-
Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли
«ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.
https://habr.com/ru/articles/1050336/
#ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup
-
Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли
«ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.
https://habr.com/ru/articles/1050336/
#ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup
-
Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.
Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:
- не успеваю записывать и одновременно воспринимать полноценно то, что на экране
- потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM
А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.
Теперь у меня есть скриптик, который делает слудующее:
- получает от меня имя файла с записью занятия (которую я делаю в OBS)
- с
ffmpegвынимает аудио - с
ffmpegделает скриншоты картинки раз в 15 секунд - скармливает аудио занятия
whisper.cpp:main-vulkan(предварительно скачав с HuggingFace нужную модельку если её нет) - упаковывает субтитры, аудио и скриншоты в тарбол
- я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
- Markdown (Obsidian)
- EPUB (e-Ink читалка)
- PDF (десктоп)
Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.
P.S. В появлении этого поста вините @rayslava
#LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language
-
Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.
Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:
- не успеваю записывать и одновременно воспринимать полноценно то, что на экране
- потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM
А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.
Теперь у меня есть скриптик, который делает слудующее:
- получает от меня имя файла с записью занятия (которую я делаю в OBS)
- с
ffmpegвынимает аудио - с
ffmpegделает скриншоты картинки раз в 15 секунд - скармливает аудио занятия
whisper.cpp:main-vulkan(предварительно скачав с HuggingFace нужную модельку если её нет) - упаковывает субтитры, аудио и скриншоты в тарбол
- я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
- Markdown (Obsidian)
- EPUB (e-Ink читалка)
- PDF (десктоп)
Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.
P.S. В появлении этого поста вините @rayslava
#LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language
-
🗓️Vi ricordate il motivo?
#ASRoma #Petrachi #dajeRoma #Rome #forzaRoma #ASR #Roma #vocegiallorossa #dajeromadaje -
-
-
Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса
Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и было ли приветствие вообще, если клиент коротко ответил "ага" на фоне работающего холодильника. Дано: сеть АЗС, ручной аудит покрывает несколько процентов смен. Всё остальное — "слепая зона". Заказчик хотел её закрыть с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования, только то, что уже есть на точках. Ограничение, которое определило всю архитектуру: кассир у микрофона говорит громко и развёрнутыми фразами. Клиент отвечает коротко, тихо и иногда вообще кивает. Стандартный ASR-пайплайн из этой пары слышит только одну сторону. Видео первично: без стабильного ID клиента и временных границ сессии аудиоаналитика работает вхолостую. Начали с трекинга.
https://habr.com/ru/articles/1044914/
#ASR #распознавание_речи #компьютерное_зрение #vad #object_tracking #видеоаналитика #speech_recognition #computer_vision
-
Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса
Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и было ли приветствие вообще, если клиент коротко ответил "ага" на фоне работающего холодильника. Дано: сеть АЗС, ручной аудит покрывает несколько процентов смен. Всё остальное — "слепая зона". Заказчик хотел её закрыть с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования, только то, что уже есть на точках. Ограничение, которое определило всю архитектуру: кассир у микрофона говорит громко и развёрнутыми фразами. Клиент отвечает коротко, тихо и иногда вообще кивает. Стандартный ASR-пайплайн из этой пары слышит только одну сторону. Видео первично: без стабильного ID клиента и временных границ сессии аудиоаналитика работает вхолостую. Начали с трекинга.
https://habr.com/ru/articles/1044914/
#ASR #распознавание_речи #компьютерное_зрение #vad #object_tracking #видеоаналитика #speech_recognition #computer_vision
-
Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса
Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и было ли приветствие вообще, если клиент коротко ответил "ага" на фоне работающего холодильника. Дано: сеть АЗС, ручной аудит покрывает несколько процентов смен. Всё остальное — "слепая зона". Заказчик хотел её закрыть с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования, только то, что уже есть на точках. Ограничение, которое определило всю архитектуру: кассир у микрофона говорит громко и развёрнутыми фразами. Клиент отвечает коротко, тихо и иногда вообще кивает. Стандартный ASR-пайплайн из этой пары слышит только одну сторону. Видео первично: без стабильного ID клиента и временных границ сессии аудиоаналитика работает вхолостую. Начали с трекинга.
https://habr.com/ru/articles/1044914/
#ASR #распознавание_речи #компьютерное_зрение #vad #object_tracking #видеоаналитика #speech_recognition #computer_vision
-
Почему WER недостаточно: Семантическая декомпозиция ошибок ASR
В продуктах, построенных поверх моделей распознавания речи (Automatic Speech Recognition models, ASR), качество распознавания речи напрямую влияет на пользовательский опыт. О том, какие есть методы оценки качества таких моделей, какие у них ограничения и как мы измеряем качество их работы — и пойдет речь.
https://habr.com/ru/articles/1043102/
#wer #asr #ner #nlp #речевые_технологии #распознавание_речи #whisper #машинное_обучение #Оценка_качества_моделей #речь_в_текст
-
Почему WER недостаточно: Семантическая декомпозиция ошибок ASR
В продуктах, построенных поверх моделей распознавания речи (Automatic Speech Recognition models, ASR), качество распознавания речи напрямую влияет на пользовательский опыт. О том, какие есть методы оценки качества таких моделей, какие у них ограничения и как мы измеряем качество их работы — и пойдет речь.
https://habr.com/ru/articles/1043102/
#wer #asr #ner #nlp #речевые_технологии #распознавание_речи #whisper #машинное_обучение #Оценка_качества_моделей #речь_в_текст
-
Почему WER недостаточно: Семантическая декомпозиция ошибок ASR
В продуктах, построенных поверх моделей распознавания речи (Automatic Speech Recognition models, ASR), качество распознавания речи напрямую влияет на пользовательский опыт. О том, какие есть методы оценки качества таких моделей, какие у них ограничения и как мы измеряем качество их работы — и пойдет речь.
https://habr.com/ru/articles/1043102/
#wer #asr #ner #nlp #речевые_технологии #распознавание_речи #whisper #машинное_обучение #Оценка_качества_моделей #речь_в_текст
-
Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы
Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.
https://habr.com/ru/articles/1042574/
#распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание
-
Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы
Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.
https://habr.com/ru/articles/1042574/
#распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание
-
Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы
Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.
https://habr.com/ru/articles/1042574/
#распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание
-
Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.
Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.
Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...
#SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma
-
Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.
Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.
Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...
#SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma
-
Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.
Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.
Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...
#SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma
-
Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.
Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.
Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...
#SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma
-
Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.
Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.
Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...
#SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma
-
FINO A MORIRE IN CAMPO.
SENZA VOCE MA CON IL CUORE PIENO E LE LACRIME PIENE DI EMOZIONI DOPO IL GOL PIÙ ROMANTICO CON STEPHAN.Siamo in Champions e ora GODIAMOCELA.
FORZA ROMA!💛❤️
#ASRoma #ASR #forzaroma -
Speech-to-LaTeX: распознавание математических выражений и предложений в LaTeX
Представьте семинар у физиков или математиков. Идёт автоматическая запись лекции, а затем распознавание речи в аккуратный текст. В большинстве мест современные ASR-системы справятся неплохо. Но значительная часть такой записи будет состоять из фраз вроде «интеграл от икс в квадрате до бесконечности», «сумма по i от единицы до n» или «производная по t от функции f». Формально голос может быть распознан правильно. В расшифровке даже могут появляться отдельные символы вроде + , π или x . Но если человек произносит длинную формулу, результат почти всегда превращается в линейную фразу, читать которую физически больно. Хочется другого: чтобы система сразу понимала, где обычный текст, где математическое выражение, и выдавала не «один делить на икс плюс два», а корректный LaTeX-код, например, \frac{1}{x+2} или \frac{1}{x}+2 , в зависимости от смысла. Эта задача называется Speech-to-LaTeX или S2L: преобразование озвученных математических выражений и предложений в формальную LaTeX-запись. В отличие от обычного speech-to-text, здесь нужно распознать не только слова, но и структуру: дроби, индексы, степени, пределы, суммы, интегралы, скобки, вложенные выражения и границы формул. Например, фраза «два делить на пи» в обычной расшифровке может остаться как «2 делить на π». Но в LaTeX она должна стать \frac{2}{\pi} . Именно такой формат нужен для статей, учебников, конспектов, Overleaf и других LaTeX-редакторов. Несмотря на прогресс в automatic speech recognition (ASR), задача прямого преобразования озвученной математики в LaTeX долго оставалась почти неразработанной. Более того, нормальных открытых датасетов с человеческими аудиозаписями для такой задачи практически не было. В нашей работе мы попытались закрыть этот пробел: собрали открытый двуязычный датасет и сравнили несколько подходов к Speech-to-LaTeX. В статье , которую мы представили на ICLR 2026, описан датасет из более чем 66 тысяч человеческих аудиозаписей и 571 тысячи синтетических аудиозаписей на английском и русском языках.