home.social

#asr — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #asr, aggregated by home.social.

  1. I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.

    I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.

    codeberg.org/cryptomilk/crane-

    #homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust

  2. I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.

    I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.

    codeberg.org/cryptomilk/crane-

    #homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust

  3. I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.

    I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.

    codeberg.org/cryptomilk/crane-

    #homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust

  4. I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.

    I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.

    codeberg.org/cryptomilk/crane-

    #homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust

  5. I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.

    I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.

    codeberg.org/cryptomilk/crane-

    #homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust

  6. Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов

    Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.

    habr.com/ru/articles/1058944/

    #ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл

  7. Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов

    Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.

    habr.com/ru/articles/1058944/

    #ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл

  8. Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов

    Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.

    habr.com/ru/articles/1058944/

    #ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл

  9. Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS

    Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.

    habr.com/ru/articles/1054566/

    #iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS

  10. Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS

    Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.

    habr.com/ru/articles/1054566/

    #iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS

  11. Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS

    Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.

    habr.com/ru/articles/1054566/

    #iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS

  12. audiogear: как разметить миллионы аудиозаписей для TTS

    Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт.

    habr.com/ru/articles/1053986/

    #asr #tts #data #data_science #data_mining

  13. Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте

    Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...

    habr.com/ru/articles/1051580/

    #Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source

  14. Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте

    Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...

    habr.com/ru/articles/1051580/

    #Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source

  15. Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте

    Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...

    habr.com/ru/articles/1051580/

    #Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source

  16. Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ

    Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранном и записывать все руками, но в потоке задач это неудобно. Гораздо проще надиктовать мысли голосом или записать разговор, а расшифровку доверить сервису. Сегодня ASR-системы нового поколения способны учитывать контекст беседы и выдавать осмысленный текст. Однако у любой медали есть обратная сторона — архитектурные ограничения. Чтобы понять, готовы ли эти модели к жизненным сценариям, мы устроили им бенчмарк на Hugging Face. Ниже — разбор того, ломается ли контекстное окно алгоритмов на длинных видеозаписях и как фоновый шум влияет на итоговое качество транскрибации.

    habr.com/ru/companies/selectel

    #selectel #распознавание_речи #whisper #qwen #asr #транскрибация_речи #автоматическое_распознавание_речи #искусственный_интеллект #тестирование_моделей

  17. Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли

    «ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.

    habr.com/ru/articles/1050336/

    #ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup

  18. Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли

    «ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.

    habr.com/ru/articles/1050336/

    #ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup

  19. Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли

    «ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.

    habr.com/ru/articles/1050336/

    #ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup

  20. Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.

    Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:

    • не успеваю записывать и одновременно воспринимать полноценно то, что на экране
    • потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM

    А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.

    Теперь у меня есть скриптик, который делает слудующее:

    • получает от меня имя файла с записью занятия (которую я делаю в OBS)
    • с ffmpeg вынимает аудио
    • с ffmpeg делает скриншоты картинки раз в 15 секунд
    • скармливает аудио занятия whisper.cpp:main-vulkan (предварительно скачав с HuggingFace нужную модельку если её нет)
    • упаковывает субтитры, аудио и скриншоты в тарбол
    • я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
      • Markdown (Obsidian)
      • EPUB (e-Ink читалка)
      • PDF (десктоп)

    Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.

    P.S. В появлении этого поста вините @rayslava

    #LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language

  21. Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.

    Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:

    • не успеваю записывать и одновременно воспринимать полноценно то, что на экране
    • потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM

    А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.

    Теперь у меня есть скриптик, который делает слудующее:

    • получает от меня имя файла с записью занятия (которую я делаю в OBS)
    • с ffmpeg вынимает аудио
    • с ffmpeg делает скриншоты картинки раз в 15 секунд
    • скармливает аудио занятия whisper.cpp:main-vulkan (предварительно скачав с HuggingFace нужную модельку если её нет)
    • упаковывает субтитры, аудио и скриншоты в тарбол
    • я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
      • Markdown (Obsidian)
      • EPUB (e-Ink читалка)
      • PDF (десктоп)

    Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.

    P.S. В появлении этого поста вините @rayslava

    #LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language

  22. Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса

    Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и было ли приветствие вообще, если клиент коротко ответил "ага" на фоне работающего холодильника. Дано: сеть АЗС, ручной аудит покрывает несколько процентов смен. Всё остальное — "слепая зона". Заказчик хотел её закрыть с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования, только то, что уже есть на точках. Ограничение, которое определило всю архитектуру: кассир у микрофона говорит громко и развёрнутыми фразами. Клиент отвечает коротко, тихо и иногда вообще кивает. Стандартный ASR-пайплайн из этой пары слышит только одну сторону. Видео первично: без стабильного ID клиента и временных границ сессии аудиоаналитика работает вхолостую. Начали с трекинга.

    habr.com/ru/articles/1044914/

    #ASR #распознавание_речи #компьютерное_зрение #vad #object_tracking #видеоаналитика #speech_recognition #computer_vision

  23. Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса

    Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и было ли приветствие вообще, если клиент коротко ответил "ага" на фоне работающего холодильника. Дано: сеть АЗС, ручной аудит покрывает несколько процентов смен. Всё остальное — "слепая зона". Заказчик хотел её закрыть с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования, только то, что уже есть на точках. Ограничение, которое определило всю архитектуру: кассир у микрофона говорит громко и развёрнутыми фразами. Клиент отвечает коротко, тихо и иногда вообще кивает. Стандартный ASR-пайплайн из этой пары слышит только одну сторону. Видео первично: без стабильного ID клиента и временных границ сессии аудиоаналитика работает вхолостую. Начали с трекинга.

    habr.com/ru/articles/1044914/

    #ASR #распознавание_речи #компьютерное_зрение #vad #object_tracking #видеоаналитика #speech_recognition #computer_vision

  24. Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса

    Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и было ли приветствие вообще, если клиент коротко ответил "ага" на фоне работающего холодильника. Дано: сеть АЗС, ручной аудит покрывает несколько процентов смен. Всё остальное — "слепая зона". Заказчик хотел её закрыть с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования, только то, что уже есть на точках. Ограничение, которое определило всю архитектуру: кассир у микрофона говорит громко и развёрнутыми фразами. Клиент отвечает коротко, тихо и иногда вообще кивает. Стандартный ASR-пайплайн из этой пары слышит только одну сторону. Видео первично: без стабильного ID клиента и временных границ сессии аудиоаналитика работает вхолостую. Начали с трекинга.

    habr.com/ru/articles/1044914/

    #ASR #распознавание_речи #компьютерное_зрение #vad #object_tracking #видеоаналитика #speech_recognition #computer_vision

  25. Почему WER недостаточно: Семантическая декомпозиция ошибок ASR

    В продуктах, построенных поверх моделей распознавания речи (Automatic Speech Recognition models, ASR), качество распознавания речи напрямую влияет на пользовательский опыт. О том, какие есть методы оценки качества таких моделей, какие у них ограничения и как мы измеряем качество их работы — и пойдет речь.

    habr.com/ru/articles/1043102/

    #wer #asr #ner #nlp #речевые_технологии #распознавание_речи #whisper #машинное_обучение #Оценка_качества_моделей #речь_в_текст

  26. Почему WER недостаточно: Семантическая декомпозиция ошибок ASR

    В продуктах, построенных поверх моделей распознавания речи (Automatic Speech Recognition models, ASR), качество распознавания речи напрямую влияет на пользовательский опыт. О том, какие есть методы оценки качества таких моделей, какие у них ограничения и как мы измеряем качество их работы — и пойдет речь.

    habr.com/ru/articles/1043102/

    #wer #asr #ner #nlp #речевые_технологии #распознавание_речи #whisper #машинное_обучение #Оценка_качества_моделей #речь_в_текст

  27. Почему WER недостаточно: Семантическая декомпозиция ошибок ASR

    В продуктах, построенных поверх моделей распознавания речи (Automatic Speech Recognition models, ASR), качество распознавания речи напрямую влияет на пользовательский опыт. О том, какие есть методы оценки качества таких моделей, какие у них ограничения и как мы измеряем качество их работы — и пойдет речь.

    habr.com/ru/articles/1043102/

    #wer #asr #ner #nlp #речевые_технологии #распознавание_речи #whisper #машинное_обучение #Оценка_качества_моделей #речь_в_текст

  28. Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы

    Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.

    habr.com/ru/articles/1042574/

    #распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание

  29. Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы

    Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.

    habr.com/ru/articles/1042574/

    #распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание

  30. Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы

    Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.

    habr.com/ru/articles/1042574/

    #распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание

  31. Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.

    Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.

    Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...

    #SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma

  32. Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.

    Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.

    Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...

    #SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma

  33. Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.

    Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.

    Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...

    #SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma

  34. Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.

    Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.

    Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...

    #SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma

  35. Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.

    Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.

    Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...

    #SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma

  36. FINO A MORIRE IN CAMPO.
    SENZA VOCE MA CON IL CUORE PIENO E LE LACRIME PIENE DI EMOZIONI DOPO IL GOL PIÙ ROMANTICO CON STEPHAN.

    Siamo in Champions e ora GODIAMOCELA.
    FORZA ROMA!💛❤️
    #ASRoma #ASR #forzaroma

  37. Speech-to-LaTeX: распознавание математических выражений и предложений в LaTeX

    Представьте семинар у физиков или математиков. Идёт автоматическая запись лекции, а затем распознавание речи в аккуратный текст. В большинстве мест современные ASR-системы справятся неплохо. Но значительная часть такой записи будет состоять из фраз вроде «интеграл от икс в квадрате до бесконечности», «сумма по i от единицы до n» или «производная по t от функции f». Формально голос может быть распознан правильно. В расшифровке даже могут появляться отдельные символы вроде + , π или x . Но если человек произносит длинную формулу, результат почти всегда превращается в линейную фразу, читать которую физически больно. Хочется другого: чтобы система сразу понимала, где обычный текст, где математическое выражение, и выдавала не «один делить на икс плюс два», а корректный LaTeX-код, например, \frac{1}{x+2} или \frac{1}{x}+2 , в зависимости от смысла. Эта задача называется Speech-to-LaTeX или S2L: преобразование озвученных математических выражений и предложений в формальную LaTeX-запись. В отличие от обычного speech-to-text, здесь нужно распознать не только слова, но и структуру: дроби, индексы, степени, пределы, суммы, интегралы, скобки, вложенные выражения и границы формул. Например, фраза «два делить на пи» в обычной расшифровке может остаться как «2 делить на π». Но в LaTeX она должна стать \frac{2}{\pi} . Именно такой формат нужен для статей, учебников, конспектов, Overleaf и других LaTeX-редакторов. Несмотря на прогресс в automatic speech recognition (ASR), задача прямого преобразования озвученной математики в LaTeX долго оставалась почти неразработанной. Более того, нормальных открытых датасетов с человеческими аудиозаписями для такой задачи практически не было. В нашей работе мы попытались закрыть этот пробел: собрали открытый двуязычный датасет и сравнили несколько подходов к Speech-to-LaTeX. В статье , которую мы представили на ICLR 2026, описан датасет из более чем 66 тысяч человеческих аудиозаписей и 571 тысячи синтетических аудиозаписей на английском и русском языках.

    habr.com/ru/companies/airi/art

    #ASR #llmмодели #latex #speechtotext #speechtolatex