home.social

#asr — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #asr, aggregated by home.social.

  1. Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов

    Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.

    habr.com/ru/articles/1058944/

    #ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл

  2. Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS

    Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.

    habr.com/ru/articles/1054566/

    #iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS

  3. audiogear: как разметить миллионы аудиозаписей для TTS

    Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт.

    habr.com/ru/articles/1053986/

    #asr #tts #data #data_science #data_mining

  4. Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте

    Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...

    habr.com/ru/articles/1051580/

    #Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source

  5. Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ

    Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранном и записывать все руками, но в потоке задач это неудобно. Гораздо проще надиктовать мысли голосом или записать разговор, а расшифровку доверить сервису. Сегодня ASR-системы нового поколения способны учитывать контекст беседы и выдавать осмысленный текст. Однако у любой медали есть обратная сторона — архитектурные ограничения. Чтобы понять, готовы ли эти модели к жизненным сценариям, мы устроили им бенчмарк на Hugging Face. Ниже — разбор того, ломается ли контекстное окно алгоритмов на длинных видеозаписях и как фоновый шум влияет на итоговое качество транскрибации.

    habr.com/ru/companies/selectel

    #selectel #распознавание_речи #whisper #qwen #asr #транскрибация_речи #автоматическое_распознавание_речи #искусственный_интеллект #тестирование_моделей

  6. Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли

    «ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.

    habr.com/ru/articles/1050336/

    #ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup

  7. Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.

    Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:

    • не успеваю записывать и одновременно воспринимать полноценно то, что на экране
    • потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM

    А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.

    Теперь у меня есть скриптик, который делает слудующее:

    • получает от меня имя файла с записью занятия (которую я делаю в OBS)
    • с ffmpeg вынимает аудио
    • с ffmpeg делает скриншоты картинки раз в 15 секунд
    • скармливает аудио занятия whisper.cpp:main-vulkan (предварительно скачав с HuggingFace нужную модельку если её нет)
    • упаковывает субтитры, аудио и скриншоты в тарбол
    • я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
      • Markdown (Obsidian)
      • EPUB (e-Ink читалка)
      • PDF (десктоп)

    Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.

    P.S. В появлении этого поста вините @rayslava

    #LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language

  8. Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.

    Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:

    • не успеваю записывать и одновременно воспринимать полноценно то, что на экране
    • потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM

    А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.

    Теперь у меня есть скриптик, который делает слудующее:

    • получает от меня имя файла с записью занятия (которую я делаю в OBS)
    • с ffmpeg вынимает аудио
    • с ffmpeg делает скриншоты картинки раз в 15 секунд
    • скармливает аудио занятия whisper.cpp:main-vulkan (предварительно скачав с HuggingFace нужную модельку если её нет)
    • упаковывает субтитры, аудио и скриншоты в тарбол
    • я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
      • Markdown (Obsidian)
      • EPUB (e-Ink читалка)
      • PDF (десктоп)

    Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.

    P.S. В появлении этого поста вините @rayslava

    #LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language

  9. Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса

    Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и было ли приветствие вообще, если клиент коротко ответил "ага" на фоне работающего холодильника. Дано: сеть АЗС, ручной аудит покрывает несколько процентов смен. Всё остальное — "слепая зона". Заказчик хотел её закрыть с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования, только то, что уже есть на точках. Ограничение, которое определило всю архитектуру: кассир у микрофона говорит громко и развёрнутыми фразами. Клиент отвечает коротко, тихо и иногда вообще кивает. Стандартный ASR-пайплайн из этой пары слышит только одну сторону. Видео первично: без стабильного ID клиента и временных границ сессии аудиоаналитика работает вхолостую. Начали с трекинга.

    habr.com/ru/articles/1044914/

    #ASR #распознавание_речи #компьютерное_зрение #vad #object_tracking #видеоаналитика #speech_recognition #computer_vision

  10. Почему WER недостаточно: Семантическая декомпозиция ошибок ASR

    В продуктах, построенных поверх моделей распознавания речи (Automatic Speech Recognition models, ASR), качество распознавания речи напрямую влияет на пользовательский опыт. О том, какие есть методы оценки качества таких моделей, какие у них ограничения и как мы измеряем качество их работы — и пойдет речь.

    habr.com/ru/articles/1043102/

    #wer #asr #ner #nlp #речевые_технологии #распознавание_речи #whisper #машинное_обучение #Оценка_качества_моделей #речь_в_текст

  11. Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы

    Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.

    habr.com/ru/articles/1042574/

    #распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание

  12. Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.

    Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.

    Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...

    #SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma

  13. Prossimo pallone calciato in un contesto utile: intorno al 23 agosto 2026.

    Tre mesi di pausa... E non parlatemi di #Mondiali perché per me c'è solo la #ASRoma.

    Tocca resistere. Il #calcio, a volte, sa essere crudele. E lentissimo...

    #SerieA #PausaEstiva #DesertoCalcistico #ASR #Roma #DajeRoma

  14. FINO A MORIRE IN CAMPO.
    SENZA VOCE MA CON IL CUORE PIENO E LE LACRIME PIENE DI EMOZIONI DOPO IL GOL PIÙ ROMANTICO CON STEPHAN.

    Siamo in Champions e ora GODIAMOCELA.
    FORZA ROMA!💛❤️
    #ASRoma #ASR #forzaroma

  15. Speech-to-LaTeX: распознавание математических выражений и предложений в LaTeX

    Представьте семинар у физиков или математиков. Идёт автоматическая запись лекции, а затем распознавание речи в аккуратный текст. В большинстве мест современные ASR-системы справятся неплохо. Но значительная часть такой записи будет состоять из фраз вроде «интеграл от икс в квадрате до бесконечности», «сумма по i от единицы до n» или «производная по t от функции f». Формально голос может быть распознан правильно. В расшифровке даже могут появляться отдельные символы вроде + , π или x . Но если человек произносит длинную формулу, результат почти всегда превращается в линейную фразу, читать которую физически больно. Хочется другого: чтобы система сразу понимала, где обычный текст, где математическое выражение, и выдавала не «один делить на икс плюс два», а корректный LaTeX-код, например, \frac{1}{x+2} или \frac{1}{x}+2 , в зависимости от смысла. Эта задача называется Speech-to-LaTeX или S2L: преобразование озвученных математических выражений и предложений в формальную LaTeX-запись. В отличие от обычного speech-to-text, здесь нужно распознать не только слова, но и структуру: дроби, индексы, степени, пределы, суммы, интегралы, скобки, вложенные выражения и границы формул. Например, фраза «два делить на пи» в обычной расшифровке может остаться как «2 делить на π». Но в LaTeX она должна стать \frac{2}{\pi} . Именно такой формат нужен для статей, учебников, конспектов, Overleaf и других LaTeX-редакторов. Несмотря на прогресс в automatic speech recognition (ASR), задача прямого преобразования озвученной математики в LaTeX долго оставалась почти неразработанной. Более того, нормальных открытых датасетов с человеческими аудиозаписями для такой задачи практически не было. В нашей работе мы попытались закрыть этот пробел: собрали открытый двуязычный датасет и сравнили несколько подходов к Speech-to-LaTeX. В статье , которую мы представили на ICLR 2026, описан датасет из более чем 66 тысяч человеческих аудиозаписей и 571 тысячи синтетических аудиозаписей на английском и русском языках.

    habr.com/ru/companies/airi/art

    #ASR #llmмодели #latex #speechtotext #speechtolatex

  16. Study of NLCS Impact on ASR Performance:
    📊 135,647 words analyzed, 3284 NLCS (2.4%)
    ❓ 76 NLCS used for key info (0.06%)
    🔍 WER: Google 11.8%, Amazon 12.8%
    ⚠️ NLCS misrecognized at 40.8% (Google), 57.2% (Amazon)
    #ASR #ClinicalDocumentation #PatientSafety tnyp.me/uTyoMoyV/m

  17. Test 1 Are non-lexical conversational sounds barriers for clinical documentation?

    🔍 NLCS like "Mm-hm" affect ASR accuracy
    🗣 135,647 words, 2.4% NLCS
    ⚠️ 94.7% WER for Google ASR with clinically relevant NLCS
    tnyp.me/uTyoMoyV/m #ASR #NLP #clinicaltranscription #JAMIA

  18. Когда «умная» колонка ведёт себя как табуретка: почему голосовые ИИ одновременно поражают и тупят

    Голосовые ассистенты вроде Алисы давно перестали быть просто «озвученным поиском». Современная колонка — это гибрид из:

    систем распознавания речи,

    рекомендательных алгоритмов,

    LLM-моделей,

    пайплайнов синтеза голоса,

    intent-routing,

    контекстных менеджеров,

    и огромного количества эвристик.

    Именно поэтому пользователь регулярно сталкивается с парадоксом:

    > Колонка способна философски ответить на экзистенциальный вопрос, но через минуту не может корректно включить нужную песню.

    Со стороны это выглядит как «натуральная тупость». На практике — это последствия архитектуры современных conversational AI.

    ---

    Иллюзия личности как продукт

    Одним из главных отличий «Алисы» от ранних голосовых ассистентов стала намеренная попытка создать ощущение характера.

    Ранние версии:

    Siri,

    Google Assistant,

    Alexa

    строились вокруг идеи «нейтрального помощника».

    Яндекс пошёл другим путём:

    сарказм,

    эмоциональные ответы,

    псевдофилософия,

    мемная подача,

    шутки,

    реакция на грубость.

    Это оказалось критически важным UX-решением.

    Пользователь гораздо легче прощает ошибки системе, если воспринимает её не как интерфейс, а как «странного собеседника».

    ---

    Почему колонка кажется «живой»

    Основная причина — языковые модели великолепно имитируют человеческую речь.

    LLM не:

    «думает»,

    «понимает»,

    «осознаёт».

    Она статистически предсказывает следующий токен.

    Но человеческий мозг крайне плохо отличает:

    настоящее понимание,

    от правдоподобной речевой симуляции.

    Из-за этого возникают феномены антропоморфизации:

    люди приписывают ИИ эмоции,

    намерения,

    характер,

    настроение,

    «обиду»,

    «упрямство».

    Хотя на практике это:

    probabilistic generation,

    routing errors,

    context collapse,

    recommendation conflicts.

    ---

    Ловушка контекста

    Одна из главных проблем голосовых ассистентов — хрупкость conversational context.

    Пример:

    1. «Кто написал “Войну и мир”?»

    2. «Сколько ему было лет?»

    Система ещё удерживает сущность:

    Лев Толстой.

    Но если вставить:

    > «Какая завтра погода?»

    контекст может разрушиться полностью.

    Почему так происходит?

    Потому что внутри колонки обычно работает не одна модель, а целый конвейер:

    ASR → Intent → Dialogue Manager → Search → LLM → TTS

    Где:

    ASR — распознавание речи,

    Intent — определение намерения,

    Dialogue Manager — управление контекстом,

    Search — поиск,

    LLM — генерация ответа,

    TTS — синтез голоса.

    Контекст может потеряться буквально между этапами.

    Особенно в гибридных системах, где:

    часть запросов идёт в search engine,

    часть — в rule-based handlers,

    часть — в LLM.

    ---

    Почему ИИ уверенно врёт

    Самая опасная особенность современных LLM — галлюцинации.

    Модель не хранит знания как база данных.

    Она строит:

    > наиболее вероятную последовательность слов.

    Поэтому возникают:

    несуществующие цитаты,

    вымышленные учёные,

    фальшивые версии ПО,

    придуманные события,

    несуществующие функции API.

    Особенно неприятно то, что модель:

    почти никогда не демонстрирует естественную неуверенность,

    и генерирует бред с тем же тоном, что и правду.

    Для пользователя это выглядит как:

    > «Она врёт и сама в это верит».

    Но технически «веры» там нет вообще.

    ---

    VAD: почему колонка «оживает» ночью

    Один из самых криповых эффектов — ложные активации.

    Колонка внезапно начинает говорить:

    ночью,

    на фоне телевизора,

    из-за шума,

    из-за музыки,

    иногда даже из-за кашля или шорохов.

    Причина — технология VAD.

    Что такое VAD

    VAD — Voice Activity Detection.

    Система постоянно анализирует аудиопоток:

    локально,

    в ожидании wake-word,

    без постоянной отправки всего звука в облако.

    Но алгоритм может ошибаться.

    Тогда:

    случайный шум,

    слово из фильма,

    обрывок фразы,

    созвучие имени ассистента

    воспринимаются как команда активации.

    Именно отсюда берутся знаменитые:

    > «Я здесь.»

    в полной темноте в 3 часа ночи.

    ---

    Почему вместо Rammstein включается «Синий трактор»

    Это уже конфликт двух независимых систем:

    1. ASR (распознавание речи),

    2. recommender system.

    Если в аккаунте:

    дети,

    мультфильмы,

    детские песни,

    семейный профиль,

    то recommendation engine начинает aggressively priorize детский контент.

    Даже если пользователь произнёс запрос корректно.

    С точки зрения алгоритма:

    > «детская музыка» — statistically safer recommendation.

    Для пользователя:

    > «колонка сошла с ума».

    ---

    Самый интересный эффект: интеллект без понимания

    Вот здесь начинается самая странная часть.

    Современные LLM:

    прекрасно имитируют язык,

    но крайне плохо строят устойчивую world model.

    Из-за этого они способны:

    обсуждать философию,

    писать код,

    поддерживать стиль,

    шутить,

    спорить.

    И одновременно:

    проваливать базовую логику,

    путать сущности,

    ломать причинно-следственные связи,

    забывать контекст через две реплики.

    Получается феномен:

    > «интеллектуально звучащей системы без полноценного понимания».

    ---

    Почему это психологически пугает

    Человеческий мозг автоматически ищет субъектность.

    Если объект:

    говорит,

    реагирует,

    использует эмоции,

    меняет интонации,

    спорит,

    шутит,

    то мы начинаем воспринимать его как агента.

    Даже если это:

    набор вероятностных моделей,

    intent-routing,

    рекомендательные алгоритмы,

    и несколько нейросетей поверх ASR.

    Именно поэтому сбои голосовых ИИ воспринимаются не как обычные баги.

    Пользователь интерпретирует их как:

    «странное поведение»,

    «характер»,

    «эмоции»,

    «обиду»,

    «упрямство».

    Хотя на практике это всего лишь:

    probabilistic failure,

    context collapse,

    false activation,

    ranking conflict.

    ---

    Итог

    Современные голосовые ассистенты находятся в странной точке эволюции.

    Они уже:

    слишком разговорчивы, чтобы считаться обычным интерфейсом,

    но ещё слишком нестабильны, чтобы считаться полноценным интеллектом.

    Поэтому возникает тот самый эффект:

    > между «восстанием машин» и «интеллектом табуретки».

    И, возможно, именно эта смесь:

    уверенного тона,

    человеческой интонации,

    псевдоэмоций,

    случайных сбоев,

    и статистической генерации

    делает современные колонки одновременно:

    полезными,

    смешными,

    раздражающими,

    и местами откровенно криповыми.

    #ИИ #ИскусственныйИнтеллект #AI #LLM #YandexGPT #Алиса #УмнаяКолонка #ГолосовойАссистент #Нейросети #MachineLearning #DeepLearning #ASR #TTS #VAD #ConversationalAI #GenerativeAI #Habr #Хабр #Технологии #IT #UX #Интернет #РекомендательныеСистемы #BigData #Цифровизация #Автоматизация #FutureTech #AIethics #Chatbot #VoiceAI

    bastyon.com/svalmon37?ref=PJ51

  19. Когда «умная» колонка ведёт себя как табуретка: почему голосовые ИИ одновременно поражают и тупят

    Голосовые ассистенты вроде Алисы давно перестали быть просто «озвученным поиском». Современная колонка — это гибрид из:

    систем распознавания речи,

    рекомендательных алгоритмов,

    LLM-моделей,

    пайплайнов синтеза голоса,

    intent-routing,

    контекстных менеджеров,

    и огромного количества эвристик.

    Именно поэтому пользователь регулярно сталкивается с парадоксом:

    > Колонка способна философски ответить на экзистенциальный вопрос, но через минуту не может корректно включить нужную песню.

    Со стороны это выглядит как «натуральная тупость». На практике — это последствия архитектуры современных conversational AI.

    ---

    Иллюзия личности как продукт

    Одним из главных отличий «Алисы» от ранних голосовых ассистентов стала намеренная попытка создать ощущение характера.

    Ранние версии:

    Siri,

    Google Assistant,

    Alexa

    строились вокруг идеи «нейтрального помощника».

    Яндекс пошёл другим путём:

    сарказм,

    эмоциональные ответы,

    псевдофилософия,

    мемная подача,

    шутки,

    реакция на грубость.

    Это оказалось критически важным UX-решением.

    Пользователь гораздо легче прощает ошибки системе, если воспринимает её не как интерфейс, а как «странного собеседника».

    ---

    Почему колонка кажется «живой»

    Основная причина — языковые модели великолепно имитируют человеческую речь.

    LLM не:

    «думает»,

    «понимает»,

    «осознаёт».

    Она статистически предсказывает следующий токен.

    Но человеческий мозг крайне плохо отличает:

    настоящее понимание,

    от правдоподобной речевой симуляции.

    Из-за этого возникают феномены антропоморфизации:

    люди приписывают ИИ эмоции,

    намерения,

    характер,

    настроение,

    «обиду»,

    «упрямство».

    Хотя на практике это:

    probabilistic generation,

    routing errors,

    context collapse,

    recommendation conflicts.

    ---

    Ловушка контекста

    Одна из главных проблем голосовых ассистентов — хрупкость conversational context.

    Пример:

    1. «Кто написал “Войну и мир”?»

    2. «Сколько ему было лет?»

    Система ещё удерживает сущность:

    Лев Толстой.

    Но если вставить:

    > «Какая завтра погода?»

    контекст может разрушиться полностью.

    Почему так происходит?

    Потому что внутри колонки обычно работает не одна модель, а целый конвейер:

    ASR → Intent → Dialogue Manager → Search → LLM → TTS

    Где:

    ASR — распознавание речи,

    Intent — определение намерения,

    Dialogue Manager — управление контекстом,

    Search — поиск,

    LLM — генерация ответа,

    TTS — синтез голоса.

    Контекст может потеряться буквально между этапами.

    Особенно в гибридных системах, где:

    часть запросов идёт в search engine,

    часть — в rule-based handlers,

    часть — в LLM.

    ---

    Почему ИИ уверенно врёт

    Самая опасная особенность современных LLM — галлюцинации.

    Модель не хранит знания как база данных.

    Она строит:

    > наиболее вероятную последовательность слов.

    Поэтому возникают:

    несуществующие цитаты,

    вымышленные учёные,

    фальшивые версии ПО,

    придуманные события,

    несуществующие функции API.

    Особенно неприятно то, что модель:

    почти никогда не демонстрирует естественную неуверенность,

    и генерирует бред с тем же тоном, что и правду.

    Для пользователя это выглядит как:

    > «Она врёт и сама в это верит».

    Но технически «веры» там нет вообще.

    ---

    VAD: почему колонка «оживает» ночью

    Один из самых криповых эффектов — ложные активации.

    Колонка внезапно начинает говорить:

    ночью,

    на фоне телевизора,

    из-за шума,

    из-за музыки,

    иногда даже из-за кашля или шорохов.

    Причина — технология VAD.

    Что такое VAD

    VAD — Voice Activity Detection.

    Система постоянно анализирует аудиопоток:

    локально,

    в ожидании wake-word,

    без постоянной отправки всего звука в облако.

    Но алгоритм может ошибаться.

    Тогда:

    случайный шум,

    слово из фильма,

    обрывок фразы,

    созвучие имени ассистента

    воспринимаются как команда активации.

    Именно отсюда берутся знаменитые:

    > «Я здесь.»

    в полной темноте в 3 часа ночи.

    ---

    Почему вместо Rammstein включается «Синий трактор»

    Это уже конфликт двух независимых систем:

    1. ASR (распознавание речи),

    2. recommender system.

    Если в аккаунте:

    дети,

    мультфильмы,

    детские песни,

    семейный профиль,

    то recommendation engine начинает aggressively priorize детский контент.

    Даже если пользователь произнёс запрос корректно.

    С точки зрения алгоритма:

    > «детская музыка» — statistically safer recommendation.

    Для пользователя:

    > «колонка сошла с ума».

    ---

    Самый интересный эффект: интеллект без понимания

    Вот здесь начинается самая странная часть.

    Современные LLM:

    прекрасно имитируют язык,

    но крайне плохо строят устойчивую world model.

    Из-за этого они способны:

    обсуждать философию,

    писать код,

    поддерживать стиль,

    шутить,

    спорить.

    И одновременно:

    проваливать базовую логику,

    путать сущности,

    ломать причинно-следственные связи,

    забывать контекст через две реплики.

    Получается феномен:

    > «интеллектуально звучащей системы без полноценного понимания».

    ---

    Почему это психологически пугает

    Человеческий мозг автоматически ищет субъектность.

    Если объект:

    говорит,

    реагирует,

    использует эмоции,

    меняет интонации,

    спорит,

    шутит,

    то мы начинаем воспринимать его как агента.

    Даже если это:

    набор вероятностных моделей,

    intent-routing,

    рекомендательные алгоритмы,

    и несколько нейросетей поверх ASR.

    Именно поэтому сбои голосовых ИИ воспринимаются не как обычные баги.

    Пользователь интерпретирует их как:

    «странное поведение»,

    «характер»,

    «эмоции»,

    «обиду»,

    «упрямство».

    Хотя на практике это всего лишь:

    probabilistic failure,

    context collapse,

    false activation,

    ranking conflict.

    ---

    Итог

    Современные голосовые ассистенты находятся в странной точке эволюции.

    Они уже:

    слишком разговорчивы, чтобы считаться обычным интерфейсом,

    но ещё слишком нестабильны, чтобы считаться полноценным интеллектом.

    Поэтому возникает тот самый эффект:

    > между «восстанием машин» и «интеллектом табуретки».

    И, возможно, именно эта смесь:

    уверенного тона,

    человеческой интонации,

    псевдоэмоций,

    случайных сбоев,

    и статистической генерации

    делает современные колонки одновременно:

    полезными,

    смешными,

    раздражающими,

    и местами откровенно криповыми.

    #ИИ #ИскусственныйИнтеллект #AI #LLM #YandexGPT #Алиса #УмнаяКолонка #ГолосовойАссистент #Нейросети #MachineLearning #DeepLearning #ASR #TTS #VAD #ConversationalAI #GenerativeAI #Habr #Хабр #Технологии #IT #UX #Интернет #РекомендательныеСистемы #BigData #Цифровизация #Автоматизация #FutureTech #AIethics #Chatbot #VoiceAI

    bastyon.com/svalmon37?ref=PJ51

  20. Когда «умная» колонка ведёт себя как табуретка: почему голосовые ИИ одновременно поражают и тупят

    Голосовые ассистенты вроде Алисы давно перестали быть просто «озвученным поиском». Современная колонка — это гибрид из:

    систем распознавания речи,

    рекомендательных алгоритмов,

    LLM-моделей,

    пайплайнов синтеза голоса,

    intent-routing,

    контекстных менеджеров,

    и огромного количества эвристик.

    Именно поэтому пользователь регулярно сталкивается с парадоксом:

    > Колонка способна философски ответить на экзистенциальный вопрос, но через минуту не может корректно включить нужную песню.

    Со стороны это выглядит как «натуральная тупость». На практике — это последствия архитектуры современных conversational AI.

    ---

    Иллюзия личности как продукт

    Одним из главных отличий «Алисы» от ранних голосовых ассистентов стала намеренная попытка создать ощущение характера.

    Ранние версии:

    Siri,

    Google Assistant,

    Alexa

    строились вокруг идеи «нейтрального помощника».

    Яндекс пошёл другим путём:

    сарказм,

    эмоциональные ответы,

    псевдофилософия,

    мемная подача,

    шутки,

    реакция на грубость.

    Это оказалось критически важным UX-решением.

    Пользователь гораздо легче прощает ошибки системе, если воспринимает её не как интерфейс, а как «странного собеседника».

    ---

    Почему колонка кажется «живой»

    Основная причина — языковые модели великолепно имитируют человеческую речь.

    LLM не:

    «думает»,

    «понимает»,

    «осознаёт».

    Она статистически предсказывает следующий токен.

    Но человеческий мозг крайне плохо отличает:

    настоящее понимание,

    от правдоподобной речевой симуляции.

    Из-за этого возникают феномены антропоморфизации:

    люди приписывают ИИ эмоции,

    намерения,

    характер,

    настроение,

    «обиду»,

    «упрямство».

    Хотя на практике это:

    probabilistic generation,

    routing errors,

    context collapse,

    recommendation conflicts.

    ---

    Ловушка контекста

    Одна из главных проблем голосовых ассистентов — хрупкость conversational context.

    Пример:

    1. «Кто написал “Войну и мир”?»

    2. «Сколько ему было лет?»

    Система ещё удерживает сущность:

    Лев Толстой.

    Но если вставить:

    > «Какая завтра погода?»

    контекст может разрушиться полностью.

    Почему так происходит?

    Потому что внутри колонки обычно работает не одна модель, а целый конвейер:

    ASR → Intent → Dialogue Manager → Search → LLM → TTS

    Где:

    ASR — распознавание речи,

    Intent — определение намерения,

    Dialogue Manager — управление контекстом,

    Search — поиск,

    LLM — генерация ответа,

    TTS — синтез голоса.

    Контекст может потеряться буквально между этапами.

    Особенно в гибридных системах, где:

    часть запросов идёт в search engine,

    часть — в rule-based handlers,

    часть — в LLM.

    ---

    Почему ИИ уверенно врёт

    Самая опасная особенность современных LLM — галлюцинации.

    Модель не хранит знания как база данных.

    Она строит:

    > наиболее вероятную последовательность слов.

    Поэтому возникают:

    несуществующие цитаты,

    вымышленные учёные,

    фальшивые версии ПО,

    придуманные события,

    несуществующие функции API.

    Особенно неприятно то, что модель:

    почти никогда не демонстрирует естественную неуверенность,

    и генерирует бред с тем же тоном, что и правду.

    Для пользователя это выглядит как:

    > «Она врёт и сама в это верит».

    Но технически «веры» там нет вообще.

    ---

    VAD: почему колонка «оживает» ночью

    Один из самых криповых эффектов — ложные активации.

    Колонка внезапно начинает говорить:

    ночью,

    на фоне телевизора,

    из-за шума,

    из-за музыки,

    иногда даже из-за кашля или шорохов.

    Причина — технология VAD.

    Что такое VAD

    VAD — Voice Activity Detection.

    Система постоянно анализирует аудиопоток:

    локально,

    в ожидании wake-word,

    без постоянной отправки всего звука в облако.

    Но алгоритм может ошибаться.

    Тогда:

    случайный шум,

    слово из фильма,

    обрывок фразы,

    созвучие имени ассистента

    воспринимаются как команда активации.

    Именно отсюда берутся знаменитые:

    > «Я здесь.»

    в полной темноте в 3 часа ночи.

    ---

    Почему вместо Rammstein включается «Синий трактор»

    Это уже конфликт двух независимых систем:

    1. ASR (распознавание речи),

    2. recommender system.

    Если в аккаунте:

    дети,

    мультфильмы,

    детские песни,

    семейный профиль,

    то recommendation engine начинает aggressively priorize детский контент.

    Даже если пользователь произнёс запрос корректно.

    С точки зрения алгоритма:

    > «детская музыка» — statistically safer recommendation.

    Для пользователя:

    > «колонка сошла с ума».

    ---

    Самый интересный эффект: интеллект без понимания

    Вот здесь начинается самая странная часть.

    Современные LLM:

    прекрасно имитируют язык,

    но крайне плохо строят устойчивую world model.

    Из-за этого они способны:

    обсуждать философию,

    писать код,

    поддерживать стиль,

    шутить,

    спорить.

    И одновременно:

    проваливать базовую логику,

    путать сущности,

    ломать причинно-следственные связи,

    забывать контекст через две реплики.

    Получается феномен:

    > «интеллектуально звучащей системы без полноценного понимания».

    ---

    Почему это психологически пугает

    Человеческий мозг автоматически ищет субъектность.

    Если объект:

    говорит,

    реагирует,

    использует эмоции,

    меняет интонации,

    спорит,

    шутит,

    то мы начинаем воспринимать его как агента.

    Даже если это:

    набор вероятностных моделей,

    intent-routing,

    рекомендательные алгоритмы,

    и несколько нейросетей поверх ASR.

    Именно поэтому сбои голосовых ИИ воспринимаются не как обычные баги.

    Пользователь интерпретирует их как:

    «странное поведение»,

    «характер»,

    «эмоции»,

    «обиду»,

    «упрямство».

    Хотя на практике это всего лишь:

    probabilistic failure,

    context collapse,

    false activation,

    ranking conflict.

    ---

    Итог

    Современные голосовые ассистенты находятся в странной точке эволюции.

    Они уже:

    слишком разговорчивы, чтобы считаться обычным интерфейсом,

    но ещё слишком нестабильны, чтобы считаться полноценным интеллектом.

    Поэтому возникает тот самый эффект:

    > между «восстанием машин» и «интеллектом табуретки».

    И, возможно, именно эта смесь:

    уверенного тона,

    человеческой интонации,

    псевдоэмоций,

    случайных сбоев,

    и статистической генерации

    делает современные колонки одновременно:

    полезными,

    смешными,

    раздражающими,

    и местами откровенно криповыми.

    #ИИ #ИскусственныйИнтеллект #AI #LLM #YandexGPT #Алиса #УмнаяКолонка #ГолосовойАссистент #Нейросети #MachineLearning #DeepLearning #ASR #TTS #VAD #ConversationalAI #GenerativeAI #Habr #Хабр #Технологии #IT #UX #Интернет #РекомендательныеСистемы #BigData #Цифровизация #Автоматизация #FutureTech #AIethics #Chatbot #VoiceAI

    bastyon.com/svalmon37?ref=PJ51

  21. Когда «умная» колонка ведёт себя как табуретка: почему голосовые ИИ одновременно поражают и тупят

    Голосовые ассистенты вроде Алисы давно перестали быть просто «озвученным поиском». Современная колонка — это гибрид из:

    систем распознавания речи,

    рекомендательных алгоритмов,

    LLM-моделей,

    пайплайнов синтеза голоса,

    intent-routing,

    контекстных менеджеров,

    и огромного количества эвристик.

    Именно поэтому пользователь регулярно сталкивается с парадоксом:

    > Колонка способна философски ответить на экзистенциальный вопрос, но через минуту не может корректно включить нужную песню.

    Со стороны это выглядит как «натуральная тупость». На практике — это последствия архитектуры современных conversational AI.

    ---

    Иллюзия личности как продукт

    Одним из главных отличий «Алисы» от ранних голосовых ассистентов стала намеренная попытка создать ощущение характера.

    Ранние версии:

    Siri,

    Google Assistant,

    Alexa

    строились вокруг идеи «нейтрального помощника».

    Яндекс пошёл другим путём:

    сарказм,

    эмоциональные ответы,

    псевдофилософия,

    мемная подача,

    шутки,

    реакция на грубость.

    Это оказалось критически важным UX-решением.

    Пользователь гораздо легче прощает ошибки системе, если воспринимает её не как интерфейс, а как «странного собеседника».

    ---

    Почему колонка кажется «живой»

    Основная причина — языковые модели великолепно имитируют человеческую речь.

    LLM не:

    «думает»,

    «понимает»,

    «осознаёт».

    Она статистически предсказывает следующий токен.

    Но человеческий мозг крайне плохо отличает:

    настоящее понимание,

    от правдоподобной речевой симуляции.

    Из-за этого возникают феномены антропоморфизации:

    люди приписывают ИИ эмоции,

    намерения,

    характер,

    настроение,

    «обиду»,

    «упрямство».

    Хотя на практике это:

    probabilistic generation,

    routing errors,

    context collapse,

    recommendation conflicts.

    ---

    Ловушка контекста

    Одна из главных проблем голосовых ассистентов — хрупкость conversational context.

    Пример:

    1. «Кто написал “Войну и мир”?»

    2. «Сколько ему было лет?»

    Система ещё удерживает сущность:

    Лев Толстой.

    Но если вставить:

    > «Какая завтра погода?»

    контекст может разрушиться полностью.

    Почему так происходит?

    Потому что внутри колонки обычно работает не одна модель, а целый конвейер:

    ASR → Intent → Dialogue Manager → Search → LLM → TTS

    Где:

    ASR — распознавание речи,

    Intent — определение намерения,

    Dialogue Manager — управление контекстом,

    Search — поиск,

    LLM — генерация ответа,

    TTS — синтез голоса.

    Контекст может потеряться буквально между этапами.

    Особенно в гибридных системах, где:

    часть запросов идёт в search engine,

    часть — в rule-based handlers,

    часть — в LLM.

    ---

    Почему ИИ уверенно врёт

    Самая опасная особенность современных LLM — галлюцинации.

    Модель не хранит знания как база данных.

    Она строит:

    > наиболее вероятную последовательность слов.

    Поэтому возникают:

    несуществующие цитаты,

    вымышленные учёные,

    фальшивые версии ПО,

    придуманные события,

    несуществующие функции API.

    Особенно неприятно то, что модель:

    почти никогда не демонстрирует естественную неуверенность,

    и генерирует бред с тем же тоном, что и правду.

    Для пользователя это выглядит как:

    > «Она врёт и сама в это верит».

    Но технически «веры» там нет вообще.

    ---

    VAD: почему колонка «оживает» ночью

    Один из самых криповых эффектов — ложные активации.

    Колонка внезапно начинает говорить:

    ночью,

    на фоне телевизора,

    из-за шума,

    из-за музыки,

    иногда даже из-за кашля или шорохов.

    Причина — технология VAD.

    Что такое VAD

    VAD — Voice Activity Detection.

    Система постоянно анализирует аудиопоток:

    локально,

    в ожидании wake-word,

    без постоянной отправки всего звука в облако.

    Но алгоритм может ошибаться.

    Тогда:

    случайный шум,

    слово из фильма,

    обрывок фразы,

    созвучие имени ассистента

    воспринимаются как команда активации.

    Именно отсюда берутся знаменитые:

    > «Я здесь.»

    в полной темноте в 3 часа ночи.

    ---

    Почему вместо Rammstein включается «Синий трактор»

    Это уже конфликт двух независимых систем:

    1. ASR (распознавание речи),

    2. recommender system.

    Если в аккаунте:

    дети,

    мультфильмы,

    детские песни,

    семейный профиль,

    то recommendation engine начинает aggressively priorize детский контент.

    Даже если пользователь произнёс запрос корректно.

    С точки зрения алгоритма:

    > «детская музыка» — statistically safer recommendation.

    Для пользователя:

    > «колонка сошла с ума».

    ---

    Самый интересный эффект: интеллект без понимания

    Вот здесь начинается самая странная часть.

    Современные LLM:

    прекрасно имитируют язык,

    но крайне плохо строят устойчивую world model.

    Из-за этого они способны:

    обсуждать философию,

    писать код,

    поддерживать стиль,

    шутить,

    спорить.

    И одновременно:

    проваливать базовую логику,

    путать сущности,

    ломать причинно-следственные связи,

    забывать контекст через две реплики.

    Получается феномен:

    > «интеллектуально звучащей системы без полноценного понимания».

    ---

    Почему это психологически пугает

    Человеческий мозг автоматически ищет субъектность.

    Если объект:

    говорит,

    реагирует,

    использует эмоции,

    меняет интонации,

    спорит,

    шутит,

    то мы начинаем воспринимать его как агента.

    Даже если это:

    набор вероятностных моделей,

    intent-routing,

    рекомендательные алгоритмы,

    и несколько нейросетей поверх ASR.

    Именно поэтому сбои голосовых ИИ воспринимаются не как обычные баги.

    Пользователь интерпретирует их как:

    «странное поведение»,

    «характер»,

    «эмоции»,

    «обиду»,

    «упрямство».

    Хотя на практике это всего лишь:

    probabilistic failure,

    context collapse,

    false activation,

    ranking conflict.

    ---

    Итог

    Современные голосовые ассистенты находятся в странной точке эволюции.

    Они уже:

    слишком разговорчивы, чтобы считаться обычным интерфейсом,

    но ещё слишком нестабильны, чтобы считаться полноценным интеллектом.

    Поэтому возникает тот самый эффект:

    > между «восстанием машин» и «интеллектом табуретки».

    И, возможно, именно эта смесь:

    уверенного тона,

    человеческой интонации,

    псевдоэмоций,

    случайных сбоев,

    и статистической генерации

    делает современные колонки одновременно:

    полезными,

    смешными,

    раздражающими,

    и местами откровенно криповыми.

    #ИИ #ИскусственныйИнтеллект #AI #LLM #YandexGPT #Алиса #УмнаяКолонка #ГолосовойАссистент #Нейросети #MachineLearning #DeepLearning #ASR #TTS #VAD #ConversationalAI #GenerativeAI #Habr #Хабр #Технологии #IT #UX #Интернет #РекомендательныеСистемы #BigData #Цифровизация #Автоматизация #FutureTech #AIethics #Chatbot #VoiceAI

    bastyon.com/svalmon37?ref=PJ51

  22. Examines the impact of NLCS on ASR for clinical documentation.
    🍃 High NLCS error rates: 40.8% (Google) and 57.2% (Amazon).
    🗣️ Clinical relevance errors: 94.7% (Google), 98.7% (Amazon).
    📊 Total words: 135,647; NLCS: 2.4%.

    #ASR #NLP #ClinicalDocumentation #PatientSafety #Pub2Post
    tnyp.me/Npmiz0F4/m

  23. От MVP на Whisper до собственной ASR: как мы построили платформу субтитров для RUTUBE

    Автоматическое создание субтитров для пользовательского контента может выглядеть довольно простой задачей: берем готовую ASR‑модель, распознаем аудио из видео и сохраняем результат. Именно таким и был наш первый MVP в RUTUBE — сервис на базе Whisper, который позволил быстро проверить гипотезу и запустить субтитры в production. Но очень быстро стало понятно, что между «распознать речь» и «сделать субтитры для всего контента» лежит огромный пласт работы. Миллионы новых видео, ролики длиной до 24 часов, неизвестный язык, шумный пользовательский контент, требования к качеству текста и жесткие ограничения по скорости обработки — всё это превратило задачу из простого ASR в полноценную платформу с микросервисной архитектурой и собственной системой распознавания речи. В статье расскажу, почему Whisper не подошел для production, как мы перестроили всю архитектуру и за счет чего смогли выйти на производительность около 1200 видео в час на один ASR.

    habr.com/ru/companies/habr_rut

    #asr #whisper #распознавание_речи #highload #субтитры #production_ml #machine_learning

  24. Non-lexical sounds impact ASR in clinical documentation.

    🔊 NLCS: 2.4% of total words, conveying key clinical info
    😷 Google's WER: 40.8%, Amazon's: 57.2% (all NLCS)
    ❌ Error rates for clinically relevant NLCS: Google 94.7%, Amazon 98.7%
    📝 Total words: 135,647; 3284 NLCS; 76 conveyed critical data
    🗣️ Described implications on documentation accuracy

    #ASR #ClinicalDocumentation #SpeechRecognition #AI #NLPSolutions #Pub2Post tnyp.me/Npmiz0F4/m

  25. Non-lexical sounds impact ASR in clinical documentation.

    🔊 NLCS: 2.4% of total words, conveying key clinical info
    😷 Google's WER: 40.8%, Amazon's: 57.2% (all NLCS)
    ❌ Error rates for clinically relevant NLCS: Google 94.7%, Amazon 98.7%
    📝 Total words: 135,647; 3284 NLCS; 76 conveyed critical data
    🗣️ Described implications on documentation accuracy

    #ASR #ClinicalDocumentation #SpeechRecognition #AI #NLPSolutions #Pub2Post tnyp.me/Npmiz0F4/m

  26. Почему Cluely и другие плохо слышат русских айтишников: разбор того, как Whisper ломается и что мы сделали с этим

    В январе я купил подписки на Cluely, Final Round AI и Sensei. Хотел посмотреть как они справляются с русским айти-собесами, раз уж все три заявляют о поддержке русского. Подключил по очереди к тестовому звонку в Телемосте (сомневаюсь, что платформа имела роль, но все же), прогнал одну и ту же запись: Senior Python backend разработчик, 45 минут, стек FastAPI + PostgreSQL + Kafka + Kubernetes. Обычный русский спикер, если важно - из Москвы, с речью проблем не было, нормальный микрофон Все три выдали транскрипт и все три провалились, как неожиданно.. "Кафка" в половине случаев становилась "как-то" или "кофта". "Кубернетис" превращался в "губер нет тест". "Сабскрайбер патерн" - в "саб скрайп патерн". "Middleware для CSRF" - "мидл-вер для си эс эр эф" - это еще норм Проблема не в том, что человек говорил по-русски, и не в том, что Whisper не умеет русский (сноска: хорошо не умеет). Whisper умеет русский нормально, около 9.8% WER на Common Voice. Проблема в другом: русскоязычный айтишник не говорит ни на чистом русском, ни на чистом английском. Он говорит на гибриде: русская грамматика плюс английские термины плюс своеобразное произношение этих терминов плюс местами свой жаргон вроде "гошечки" и "крудошлёпа" Этот гибрид ни один из популярных STT не держит. Потому что его в тренировочных данных почти нет Разбираю ниже, как устроена эта проблема, что с ней делают конкуренты (почти ничего), и что сделали мы

    habr.com/ru/articles/1026778/

    #Whisper #STT #speechtotext #finetuning #LoRA #ASR #NLP #распознавание_речи #русский_язык #codeswitching

  27. Aomer Gaya Ouldali de l'Université de Béjaïa vient de publier son code pour "Mmeslay" (Parle) en kabyle.

    Demo sur HF : huggingface.co/spaces/g1ya/Mme

    Projet initialement amorcé avec @belkacem77

    cc @Taflelli @azwaw

    #Kabyle #ASR

  28. Quanto ha inciso il pareggio di Roma-Juve sugli ultimi risultati della Roma? 🤔

    #Iromanisti1927 #ASR #romajuve #ASRoma #dajeroma

  29. Quanto ha inciso il pareggio di Roma-Juve sugli ultimi risultati della Roma? 🤔

    #Iromanisti1927 #ASR #romajuve #ASRoma #dajeroma

  30. After A LOT of studying BLAS internals, my PR to the gemm crate is finally open: it introduces mixed-precision BF16 matmuls (optimal for use cases like small models doing autoregressive decoding on CPU)

    github.com/sarah-quinones/gemm

    #programming #rust #ai #inference #deeplearning #qwen #asr #opensource #rustlang

  31. - Cohere Transcribe automatic speech recognition model supports 14 languages with impressive benchmarks: cohere.com/blog/transcribe huggingface.co/CohereLabs/cohe MLX port already: github.com/Blaizzy/mlx-audio

    - Distributed ML training across MacBooks via MLX + Airdrop, cool! github.com/swarnim-j/grove

    - Rumours: iOS 27 will open Siri to run any AI service (Bloomberg) + Anthropic acknowledges testing 'step change' level model after 'leak' (fortune.com)

    #AI #AINews #ASR #cohere #mlx #rumours #siri #anthropic

  32. Just shipped a Rust CPU inference engine for Qwen3-ASR. Clone it, throw a wav file at it and get a transcription *locally*

    github.com/gicrisf/qwen-asr-rs

    #ai #llm #qwen #rust #asr

  33. Как я снизил WER с 33% до 3.3% для русской речи на CPU: сравнение GigaAM, Whisper и Vosk

    За два месяца я перепробовал три ASR-движка, шесть моделей Whisper, адаптивное чанкование, T5-коррекцию и ансамблевое голосование — и большая часть идей оказалась тупиком. В статье — подробный разбор шести тупиков и одной находки: почему GigaAM от Сбера на обычном CPU показывает 3.3% WER на русском, обходя Whisper large-v3-turbo на RTX 4090 (7.9%) в 2.4 раза. С бенчмарками, кодом и честными оговорками.

    habr.com/ru/articles/1002260/

    #speechtotext #gigaam #whisper #vosk #onnx #распознавание_речи #WER #голосовой_ввод #ASR #python