#whisper — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #whisper, aggregated by home.social.
-
Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText https://www.linuxeasy.org/openwhispr-porta-dettatura-vocale-e-agenti-ai-open-source-su-linux/
-
Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText https://www.linuxeasy.org/openwhispr-porta-dettatura-vocale-e-agenti-ai-open-source-su-linux/
-
Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText https://www.linuxeasy.org/openwhispr-porta-dettatura-vocale-e-agenti-ai-open-source-su-linux/
-
Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText https://www.linuxeasy.org/openwhispr-porta-dettatura-vocale-e-agenti-ai-open-source-su-linux/
-
Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText https://www.linuxeasy.org/openwhispr-porta-dettatura-vocale-e-agenti-ai-open-source-su-linux/
-
Étude du consortium ARIANE sur la transcription via IA générative avec le LLM Whisper : « Whisper : transcription automatique de sources sonores » https://hal.science/hal-05706209 #Whisper #LLM #ESR
-
Étude du consortium ARIANE sur la transcription via IA générative avec le LLM Whisper : « Whisper : transcription automatique de sources sonores » https://hal.science/hal-05706209 #Whisper #LLM #ESR
-
Étude du consortium ARIANE sur la transcription via IA générative avec le LLM Whisper : « Whisper : transcription automatique de sources sonores » https://hal.science/hal-05706209 #Whisper #LLM #ESR
-
Étude du consortium ARIANE sur la transcription via IA générative avec le LLM Whisper : « Whisper : transcription automatique de sources sonores » https://hal.science/hal-05706209 #Whisper #LLM #ESR
-
Étude du consortium ARIANE sur la transcription via IA générative avec le LLM Whisper : « Whisper : transcription automatique de sources sonores » https://hal.science/hal-05706209 #Whisper #LLM #ESR
-
Разговорили гуманоида: как за месяц мы построили русскоязычный голосовой стек для китайского робота
Можно ли управлять гуманоидом Walker Tienkung через свой голосовой ассистент по-русски? Мы решили проверить — и быстро выяснили, что ответ сложнее, чем кажется. Штатная система понимала только китайский, Whisper ошибался на коротких командах, LLM добавляла задержку, а динамик съедал начало фразы после паузы. «Беги» превращалось в «begin», а «встань» — в «Таня». Рассказываем, как нам удалось построить свой собственный модульный русскоязычный стек, разделить команды и диалог, ускорить синтез речи, и добиться реакции за доли секунды. С архитектурой, тестами и новыми нерешёнными задачами. Полный гайд как заставить робота ростом 173 см и весом 75 кг слушать вас и понимать! Читать гайд
https://habr.com/ru/companies/361robotics/articles/1069312/
#распознавание_речи #синтез_речи #whisper #silero #vosk #голосовой_ассистент #робототехника #гуманоид #llm #эмбеддинги
-
Разговорили гуманоида: как за месяц мы построили русскоязычный голосовой стек для китайского робота
Можно ли управлять гуманоидом Walker Tienkung через свой голосовой ассистент по-русски? Мы решили проверить — и быстро выяснили, что ответ сложнее, чем кажется. Штатная система понимала только китайский, Whisper ошибался на коротких командах, LLM добавляла задержку, а динамик съедал начало фразы после паузы. «Беги» превращалось в «begin», а «встань» — в «Таня». Рассказываем, как нам удалось построить свой собственный модульный русскоязычный стек, разделить команды и диалог, ускорить синтез речи, и добиться реакции за доли секунды. С архитектурой, тестами и новыми нерешёнными задачами. Полный гайд как заставить робота ростом 173 см и весом 75 кг слушать вас и понимать! Читать гайд
https://habr.com/ru/companies/361robotics/articles/1069312/
#распознавание_речи #синтез_речи #whisper #silero #vosk #голосовой_ассистент #робототехника #гуманоид #llm #эмбеддинги
-
Разговорили гуманоида: как за месяц мы построили русскоязычный голосовой стек для китайского робота
Можно ли управлять гуманоидом Walker Tienkung через свой голосовой ассистент по-русски? Мы решили проверить — и быстро выяснили, что ответ сложнее, чем кажется. Штатная система понимала только китайский, Whisper ошибался на коротких командах, LLM добавляла задержку, а динамик съедал начало фразы после паузы. «Беги» превращалось в «begin», а «встань» — в «Таня». Рассказываем, как нам удалось построить свой собственный модульный русскоязычный стек, разделить команды и диалог, ускорить синтез речи, и добиться реакции за доли секунды. С архитектурой, тестами и новыми нерешёнными задачами. Полный гайд как заставить робота ростом 173 см и весом 75 кг слушать вас и понимать! Читать гайд
https://habr.com/ru/companies/361robotics/articles/1069312/
#распознавание_речи #синтез_речи #whisper #silero #vosk #голосовой_ассистент #робототехника #гуманоид #llm #эмбеддинги
-
Как сжать 300+ часов D&D сериала в пересказ для актеров
Я давно играю в ДнД и почти с самого начала смотрю «Грядут приключения» - ребята снимают настольные ролевые игры как сериалы: живая партия актеров за столом, постоянный каст, сквозной сюжет, серии по пять-шесть часов. Нравится у них всё, но больше всего - «Архипелаг» и «Эндемия». В какой-то момент несравненный Мастер Гоша Воронин кинул в своём канале клич: проекту нужна помощь с пересказом сериала. Нужен был текст, по которому актёры смогут прочитать всё случившееся за 55 серий. Обычно такие вещи делают руками. Энтузиасты берут источник, сами его пересматривают, сами расписывают сценарий, сами переводят всё в текст. Работа адская даже когда в источнике пара часов записи, а тут триста. Я решил попробовать по-новому и написал в комментах, что могу помочь: работаю с ИИ и большими данными, сделаю это в разы быстрее, чем руками, и никому не придётся месяцами сидеть над расшифровками. Так я и взялся разобрать все 55 серий в базу знаний и написать по ней текст видеопересказа для актеров на 30-60 минут.
https://habr.com/ru/articles/1065794/
#GigaAM #Whisper #ASR #распознавание_речи #диаризация #Claude #Opus #LLM #база_знаний #транскрибация
-
Как сжать 300+ часов D&D сериала в пересказ для актеров
Я давно играю в ДнД и почти с самого начала смотрю «Грядут приключения» - ребята снимают настольные ролевые игры как сериалы: живая партия актеров за столом, постоянный каст, сквозной сюжет, серии по пять-шесть часов. Нравится у них всё, но больше всего - «Архипелаг» и «Эндемия». В какой-то момент несравненный Мастер Гоша Воронин кинул в своём канале клич: проекту нужна помощь с пересказом сериала. Нужен был текст, по которому актёры смогут прочитать всё случившееся за 55 серий. Обычно такие вещи делают руками. Энтузиасты берут источник, сами его пересматривают, сами расписывают сценарий, сами переводят всё в текст. Работа адская даже когда в источнике пара часов записи, а тут триста. Я решил попробовать по-новому и написал в комментах, что могу помочь: работаю с ИИ и большими данными, сделаю это в разы быстрее, чем руками, и никому не придётся месяцами сидеть над расшифровками. Так я и взялся разобрать все 55 серий в базу знаний и написать по ней текст видеопересказа для актеров на 30-60 минут.
https://habr.com/ru/articles/1065794/
#GigaAM #Whisper #ASR #распознавание_речи #диаризация #Claude #Opus #LLM #база_знаний #транскрибация
-
Как сжать 300+ часов D&D сериала в пересказ для актеров
Я давно играю в ДнД и почти с самого начала смотрю «Грядут приключения» - ребята снимают настольные ролевые игры как сериалы: живая партия актеров за столом, постоянный каст, сквозной сюжет, серии по пять-шесть часов. Нравится у них всё, но больше всего - «Архипелаг» и «Эндемия». В какой-то момент несравненный Мастер Гоша Воронин кинул в своём канале клич: проекту нужна помощь с пересказом сериала. Нужен был текст, по которому актёры смогут прочитать всё случившееся за 55 серий. Обычно такие вещи делают руками. Энтузиасты берут источник, сами его пересматривают, сами расписывают сценарий, сами переводят всё в текст. Работа адская даже когда в источнике пара часов записи, а тут триста. Я решил попробовать по-новому и написал в комментах, что могу помочь: работаю с ИИ и большими данными, сделаю это в разы быстрее, чем руками, и никому не придётся месяцами сидеть над расшифровками. Так я и взялся разобрать все 55 серий в базу знаний и написать по ней текст видеопересказа для актеров на 30-60 минут.
https://habr.com/ru/articles/1065794/
#GigaAM #Whisper #ASR #распознавание_речи #диаризация #Claude #Opus #LLM #база_знаний #транскрибация
-
56 минут созвона → текст за 5 минут на M4 без OBS и облака
У меня от трёх до пяти созвонов в день, почти все в браузере: Meet, Яндекс Телемост, ktalk, реже всего Zoom. Детали встреч мне нужны в тексте, иначе договорённости расползаются. Писал я звонки через OBS с захватом экрана, и на самих звонках началось веселье: звук временами жёстко квакал, всё чуть-чуть подвисало. Причину до конца не выяснял, моё предположение - процессор зажирался захватом и перебивал сам разговор; ktalk и браузер тут ни при чём. А экран, как потом дошло, мне вообще был не нужен. Дальше вторая серия. Расшифровку я гонял своими Python-скриптами: конвертация → транскрибация → диаризация (разметка, кто когда говорил). На встрече с пятью участниками диаризация расставляла голоса крайне плохо, половину фраз всё равно восстанавливал по памяти. Пошёл искать вариант, чтобы запись не мешала звонку, результат был приличный и всё крутилось локально: не хотелось ни отдавать записи в облако, ни платить подписку за минуты. Нашёл платный Audio Hijack , он подкупил лёгкостью и простотой настройки. Потом узнал, что на M-чипе быстрее всего у меня отрабатывает mlx-whisper на MLX : веса large-v3-turbo с Hugging Face, инференс на GPU Mac. Это архитектура Whisper, но рантайм — пакет mlx-whisper и бинарь mlx_whisper , не pip install openai-whisper и не репозиторий openai/whisper . Так собрался стек: Hijack пишет один mp3, mlx_whisper делает VTT, pyannote раскладывает по SPEAKER_XX. На 56-минутном звонке транскрипция заняла около пяти минут. Платный только Hijack — разовая лицензия, без подписки (цену смотрите на сайте Rogue Amoeba). Скрипты выложил в mac-call-transcribe под MIT. Ниже сборка, замеры с двух реальных звонков и грабли; повторяется на любом Mac с M-чипом.
https://habr.com/ru/articles/1062068/
#whisper #mlx #pyannote #speaker_diarization #расшифровка_звонков #python #apple_silicon #транскрибация_звонков
-
Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы
Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.
https://habr.com/ru/articles/1042574/
#распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание
-
Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы
Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.
https://habr.com/ru/articles/1042574/
#распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание
-
Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы
Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.
https://habr.com/ru/articles/1042574/
#распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание
-
Qwen3.5 на двух V100, reverse SSH вместо Cloudflare в Telegram Mini App: собираю AI-репетитора английского
У меня в углу комнаты стоит сервер с двумя Tesla V100 32GB. Они доcтались мне для другой задачи, которая отвалилась, и полгода стояли мёртвым грузом. Параллельно я в очередной раз пробовал заниматься английским — Simpler, Doalingo, ещё пара продуктов. Хорошие, но мне не подходил формат: я хотел сценарий «открыл телефон дома на семь минут, поговорил, закрыл». Без расписания, без камеры, без поиска тьютора, который понимает мой акцент с пятого раза. Сошлось. Идея: Telegram Mini App, в нём кнопка «говорить», за ней — AI-репетитор, который слышит, что я сказал, отвечает голосом, помнит контекст разговора, тыкает в мои повторяющиеся ошибки и подбрасывает слова, которые я пытаюсь выучить. Полностью бесплатно. Модель Qwen3.5 вышла 25 февраля , я её гоняю всего несколько недель, продукт сырой. Эта статья — про архитектурные решения и про то, на какие грабли я уже успел наступить.
https://habr.com/ru/articles/1042166/
#vllm #qwen35 #telegram_bot #telegram_mini_apps #aiogram_3 #fastapi #selfhosted_llm #kokoro_tts #whisper #tesla_v100
-
Как я решил проблему русской диктовки для ИИ
По мере погружения в ИИ и вайб‑кодинг, я столкнулся с одним неудобным моментом — отсутствием возможности диктовать на русском языке в некоторых программах. И если OpenAI в своем приложении позаботились об этом, то в Anthropic такой возможности на тот момент просто не оказалось. А мне уже так понравилось, откинувшись на спинку кресла с чашкой чая, надиктовывать промпты без клавиатуры. Но я быстро нашел выход, хоть и костыльный — просто диктовать свой текст в окошке GPT, потом копировать его и вставлять в Claude. Вроде несложно, но и удобным этот метод я бы не назвал. И я задумался, как этот процесс оптимизировать. И какая же идея могла прийти в голову в 3 часа ночи человеку, который полжизни занимается программированием? Ну конечно же — разработать свое приложение. Посоветовавшись с Claude и GPT, я набросал небольшой план и приступил к разработке. Поскольку я работаю на macOS, то для начала не стал заморачиваться с мультиплатформенностью и решил делать все на Swift.
https://habr.com/ru/articles/1039248/
#AI #OpenAI #Claude #Whisper #speechtotext #диктовка #voice_input #Apple_Silicon
-
I've been working in #Pitxu these days.
- I left behind the Infinite-loop approach to a Callback-based one triggered by VAD, reducing about a 40% of the load and imilar battery life improvement.
- Added a Long Term Memory system, so that I can reduce the amount of context in use per session relaying on an external support, making it faster and cheaper.
- I've switched #Vosk for #Whisper in the Speech-To-Text step, that brings an incredible improvement on the transcription, which at its turn improves the overall user experience.
- I switched from Gemini 2.5 Flash to Gemini 3.1 Flash-Lite, which improves quality but also penalizes reaction speed.
- I delegated some background work into a new Support process that takes it out from the main (user experience) thread.
- I corrected numerous visualization bugs that improves the user-Pitxu interaction.
All in all, I just had a long conversation with Pitxu, and has been by far the best demo I ever had in year and a half.
This is a self-tap-on-the-shoulder post, thank you for your attention 🙂
-
I've been working in #Pitxu these days.
- I left behind the Infinite-loop approach to a Callback-based one triggered by VAD, reducing about a 40% of the load and imilar battery life improvement.
- Added a Long Term Memory system, so that I can reduce the amount of context in use per session relaying on an external support, making it faster and cheaper.
- I've switched #Vosk for #Whisper in the Speech-To-Text step, that brings an incredible improvement on the transcription, which at its turn improves the overall user experience.
- I switched from Gemini 2.5 Flash to Gemini 3.1 Flash-Lite, which improves quality but also penalizes reaction speed.
- I delegated some background work into a new Support process that takes it out from the main (user experience) thread.
- I corrected numerous visualization bugs that improves the user-Pitxu interaction.
All in all, I just had a long conversation with Pitxu, and has been by far the best demo I ever had in year and a half.
This is a self-tap-on-the-shoulder post, thank you for your attention 🙂
-
I've been working in #Pitxu these days.
- I left behind the Infinite-loop approach to a Callback-based one triggered by VAD, reducing about a 40% of the load and imilar battery life improvement.
- Added a Long Term Memory system, so that I can reduce the amount of context in use per session relaying on an external support, making it faster and cheaper.
- I've switched #Vosk for #Whisper in the Speech-To-Text step, that brings an incredible improvement on the transcription, which at its turn improves the overall user experience.
- I switched from Gemini 2.5 Flash to Gemini 3.1 Flash-Lite, which improves quality but also penalizes reaction speed.
- I delegated some background work into a new Support process that takes it out from the main (user experience) thread.
- I corrected numerous visualization bugs that improves the user-Pitxu interaction.
All in all, I just had a long conversation with Pitxu, and has been by far the best demo I ever had in year and a half.
This is a self-tap-on-the-shoulder post, thank you for your attention 🙂
-
OpenAI, çağrışım dilini başarıyla sesli yapay zeka uygulamalarıyla birleştiriyor: GPT‑Realtime‑2, Translate ve Whisper elemanlarıyla gerçek zamanlı konuşma, çeviri ve transkripsiyon sistemini tek bir akışta sunuyor.
-
От MVP на Whisper до собственной ASR: как мы построили платформу субтитров для RUTUBE
Автоматическое создание субтитров для пользовательского контента может выглядеть довольно простой задачей: берем готовую ASR‑модель, распознаем аудио из видео и сохраняем результат. Именно таким и был наш первый MVP в RUTUBE — сервис на базе Whisper, который позволил быстро проверить гипотезу и запустить субтитры в production. Но очень быстро стало понятно, что между «распознать речь» и «сделать субтитры для всего контента» лежит огромный пласт работы. Миллионы новых видео, ролики длиной до 24 часов, неизвестный язык, шумный пользовательский контент, требования к качеству текста и жесткие ограничения по скорости обработки — всё это превратило задачу из простого ASR в полноценную платформу с микросервисной архитектурой и собственной системой распознавания речи. В статье расскажу, почему Whisper не подошел для production, как мы перестроили всю архитектуру и за счет чего смогли выйти на производительность около 1200 видео в час на один ASR.
https://habr.com/ru/companies/habr_rutube/articles/1028476/
#asr #whisper #распознавание_речи #highload #субтитры #production_ml #machine_learning
-
Топ локальных нейросетей ︎◍ 2026: подборка ИИ для запуска из дома
Сознаюсь: когда я впервые попытался запустить большую языковую модель на своём ноутбуке, всё закончилось вертушкой кулера, жутким лагом и системным сообщением “Недостаточно памяти”. Казалось, что домашний ИИ – удел владельцев космических станций с жидким азотом. Но прошло совсем немного времени, и ситуация изменилась до неузнаваемости. Теперь достаточно обычной RTX 3060 и получаса свободного вечера, чтобы завести себе персонального ассистента, который работает на даче без интернета и умеет шутить (или хотя бы пытается). Я расскажу обо всём по порядку – без воды и фанатизма. Что вообще запускать, на чём запускать, какие подводные камни ждут и почему “самая новая модель” дома – далеко не всегда лучший выбор. Поехали! Готовьте отвёртку и VRAM – мы начинаем!
https://habr.com/ru/companies/bothub/articles/1028906/
#gemma_4 #qwen36 #qwen35 #gptoss30b #mistral_7b #phi4 #deepseek_v32 #whisper #nemotron_cascade_2
-
Голосовой ввод на русско-английском в 2026: WisprFlow, Handy, OpenWhispr, GigaAM v3 — для диктовки нейросетям и кода
Голосом мы говорим в 2-3 раза быстрее, чем печатаем — это давно известно. Вопрос только в том, умеет ли голосовой ввод разбираться с русско-английской смесью, на которой мы общаемся с LLM и пишем код: «объясни на русском», «открой в Cursor», «проверь, что deploy прошёл». За полгода я перепробовал 5+ приложений и 5 моделей, чтобы найти те, что умеют. Приложения : WisprFlow, SpeakFlow, Handy, OpenWhispr, SuperWhisper — облачные и локальные, платные и open source. Модели : Whisper Large v3, Turbo, GigaAM v3 от Сбера, Canary 1B v2 от NVIDIA, Parakeet V3. Внутри: — Замена облачного WisprFlow на бесплатный open source без потери качества. — Один текстовый промпт, починивший пропадающую пунктуацию в 99% случаев — без LLM-постпроцессоров и задержек. — Мой бенчмарк Whisper Turbo vs Large v3 на RTX 5070 Ti (Vulkan на Blackwell внезапно быстрее CUDA на 50%). — GigaAM v3 и Canary 1B v2 — где конкурируют с Whisper, а где ломают английские слова в кириллицу («Gemini» → «Jemni»). — Первый в моей жизни принятый в main pull request в open source. Актуально на апрель 2026.
https://habr.com/ru/articles/1024634/
#whisper #голосовой_ввод #транскрибация #gigaam #распознавание_речи #openwhispr #cuda #vulkan #superwhisper #нейросети
-
Голосовой ввод на русско-английском в 2026: WisprFlow, Handy, OpenWhispr, GigaAM v3 — для диктовки нейросетям и кода
Голосом мы говорим в 2-3 раза быстрее, чем печатаем — это давно известно. Вопрос только в том, умеет ли голосовой ввод разбираться с русско-английской смесью, на которой мы общаемся с LLM и пишем код: «объясни на русском», «открой в Cursor», «проверь, что deploy прошёл». За полгода я перепробовал 5+ приложений и 5 моделей, чтобы найти те, что умеют. Приложения : WisprFlow, SpeakFlow, Handy, OpenWhispr, SuperWhisper — облачные и локальные, платные и open source. Модели : Whisper Large v3, Turbo, GigaAM v3 от Сбера, Canary 1B v2 от NVIDIA, Parakeet V3. Внутри: — Замена облачного WisprFlow на бесплатный open source без потери качества. — Один текстовый промпт, починивший пропадающую пунктуацию в 99% случаев — без LLM-постпроцессоров и задержек. — Мой бенчмарк Whisper Turbo vs Large v3 на RTX 5070 Ti (Vulkan на Blackwell внезапно быстрее CUDA на 50%). — GigaAM v3 и Canary 1B v2 — где конкурируют с Whisper, а где ломают английские слова в кириллицу («Gemini» → «Jemni»). — Первый в моей жизни принятый в main pull request в open source. Актуально на апрель 2026.
https://habr.com/ru/articles/1024634/
#whisper #голосовой_ввод #транскрибация #gigaam #распознавание_речи #openwhispr #cuda #vulkan #superwhisper #нейросети
-
Голосовой ввод на русско-английском в 2026: WisprFlow, Handy, OpenWhispr, GigaAM v3 — для диктовки нейросетям и кода
Голосом мы говорим в 2-3 раза быстрее, чем печатаем — это давно известно. Вопрос только в том, умеет ли голосовой ввод разбираться с русско-английской смесью, на которой мы общаемся с LLM и пишем код: «объясни на русском», «открой в Cursor», «проверь, что deploy прошёл». За полгода я перепробовал 5+ приложений и 5 моделей, чтобы найти те, что умеют. Приложения : WisprFlow, SpeakFlow, Handy, OpenWhispr, SuperWhisper — облачные и локальные, платные и open source. Модели : Whisper Large v3, Turbo, GigaAM v3 от Сбера, Canary 1B v2 от NVIDIA, Parakeet V3. Внутри: — Замена облачного WisprFlow на бесплатный open source без потери качества. — Один текстовый промпт, починивший пропадающую пунктуацию в 99% случаев — без LLM-постпроцессоров и задержек. — Мой бенчмарк Whisper Turbo vs Large v3 на RTX 5070 Ti (Vulkan на Blackwell внезапно быстрее CUDA на 50%). — GigaAM v3 и Canary 1B v2 — где конкурируют с Whisper, а где ломают английские слова в кириллицу («Gemini» → «Jemni»). — Первый в моей жизни принятый в main pull request в open source. Актуально на апрель 2026.
https://habr.com/ru/articles/1024634/
#whisper #голосовой_ввод #транскрибация #gigaam #распознавание_речи #openwhispr #cuda #vulkan #superwhisper #нейросети
-
Испанский в кармане: Архитектура Telegram-бота с локальным Whisper.cpp, AI-диалогами и оценкой произношения
Привет, Хабр! Меня зовут Vlad, я начинающий Python‑разработчик и энтузиаст изучения языков. Недавно я столкнулся с классической проблемой полиглота‑самоучки: учебники дают теорию, аудиокурсы — пассивное восприятие, но нет главного — обратной связи по произношению. Репетиторы дороги, а разговорные клубы требуют уровня, которого у меня еще не было. Я решил закрыть эту боль кодом. Моя цель была амбициозной: создать Telegram‑бота, который: 1. Слушает голосовые сообщения и распознает речь без дорогих облачных API. 2. Оценивает точность произношения в процентах, сравнивая с эталоном. 3. Поддерживает живой диалог через LLM, исправляя ошибки на лету. 4. Работает быстро и экономно на слабом VPS. В этой статье я подробно разберу архитектуру проекта, покажу, как интегрировать бинарный whisper.cpp в асинхронный aiogram 3.x, реализую алгоритм оценки речи и расскажу про управление состояниями (FSM). Под капотом — Python, нейросети и немного магии.
https://habr.com/ru/articles/1014888/
#Python #Telegram_Bot #Aiogram #Whisper #Speech_Recognition #Machine_Learning #NLP #Artificial_Intelligence #Асинхронность #Испанский_язык
-
Испанский в кармане: Архитектура Telegram-бота с локальным Whisper.cpp, AI-диалогами и оценкой произношения
Привет, Хабр! Меня зовут Vlad, я начинающий Python‑разработчик и энтузиаст изучения языков. Недавно я столкнулся с классической проблемой полиглота‑самоучки: учебники дают теорию, аудиокурсы — пассивное восприятие, но нет главного — обратной связи по произношению. Репетиторы дороги, а разговорные клубы требуют уровня, которого у меня еще не было. Я решил закрыть эту боль кодом. Моя цель была амбициозной: создать Telegram‑бота, который: 1. Слушает голосовые сообщения и распознает речь без дорогих облачных API. 2. Оценивает точность произношения в процентах, сравнивая с эталоном. 3. Поддерживает живой диалог через LLM, исправляя ошибки на лету. 4. Работает быстро и экономно на слабом VPS. В этой статье я подробно разберу архитектуру проекта, покажу, как интегрировать бинарный whisper.cpp в асинхронный aiogram 3.x, реализую алгоритм оценки речи и расскажу про управление состояниями (FSM). Под капотом — Python, нейросети и немного магии.
https://habr.com/ru/articles/1014888/
#Python #Telegram_Bot #Aiogram #Whisper #Speech_Recognition #Machine_Learning #NLP #Artificial_Intelligence #Асинхронность #Испанский_язык
-
Испанский в кармане: Архитектура Telegram-бота с локальным Whisper.cpp, AI-диалогами и оценкой произношения
Привет, Хабр! Меня зовут Vlad, я начинающий Python‑разработчик и энтузиаст изучения языков. Недавно я столкнулся с классической проблемой полиглота‑самоучки: учебники дают теорию, аудиокурсы — пассивное восприятие, но нет главного — обратной связи по произношению. Репетиторы дороги, а разговорные клубы требуют уровня, которого у меня еще не было. Я решил закрыть эту боль кодом. Моя цель была амбициозной: создать Telegram‑бота, который: 1. Слушает голосовые сообщения и распознает речь без дорогих облачных API. 2. Оценивает точность произношения в процентах, сравнивая с эталоном. 3. Поддерживает живой диалог через LLM, исправляя ошибки на лету. 4. Работает быстро и экономно на слабом VPS. В этой статье я подробно разберу архитектуру проекта, покажу, как интегрировать бинарный whisper.cpp в асинхронный aiogram 3.x, реализую алгоритм оценки речи и расскажу про управление состояниями (FSM). Под капотом — Python, нейросети и немного магии.
https://habr.com/ru/articles/1014888/
#Python #Telegram_Bot #Aiogram #Whisper #Speech_Recognition #Machine_Learning #NLP #Artificial_Intelligence #Асинхронность #Испанский_язык
-
Умная колонка своими руками
В этой статье я расскажу, как сделать своими руками две умные колонки, полностью поддерживающие русский язык: 1) На микроконтроллере esp32s3, используя XiaoZhi 2) На Raspberry Pi автономную голосовую колонку с камерой, которая будет работать и распознавать всё, что не только слышит, но и видит перед собой, даже при отсутствии Интернета! С локально запущенными моделями ИИ, связка Ollama+Gemma3:1b+Moondream+OpenWakeWord+Whisper.cpp+Silero TTS А также расскажу, как подключить обе эти колонки к Home Assistant для управления устройствами умного дома.
https://habr.com/ru/articles/1005272/
#xiaozhi #esp32s3 #голосовой_ассистент #whisper #silero #ollama #raspberrypi
-
Умная колонка своими руками
В этой статье я расскажу, как сделать своими руками две умные колонки, полностью поддерживающие русский язык: 1) На микроконтроллере esp32s3, используя XiaoZhi 2) На Raspberry Pi автономную голосовую колонку с камерой, которая будет работать и распознавать всё, что не только слышит, но и видит перед собой, даже при отсутствии Интернета! С локально запущенными моделями ИИ, связка Ollama+Gemma3:1b+Moondream+OpenWakeWord+Whisper.cpp+Silero TTS А также расскажу, как подключить обе эти колонки к Home Assistant для управления устройствами умного дома.
https://habr.com/ru/articles/1005272/
#xiaozhi #esp32s3 #голосовой_ассистент #whisper #silero #ollama #raspberrypi
-
Умная колонка своими руками
В этой статье я расскажу, как сделать своими руками две умные колонки, полностью поддерживающие русский язык: 1) На микроконтроллере esp32s3, используя XiaoZhi 2) На Raspberry Pi автономную голосовую колонку с камерой, которая будет работать и распознавать всё, что не только слышит, но и видит перед собой, даже при отсутствии Интернета! С локально запущенными моделями ИИ, связка Ollama+Gemma3:1b+Moondream+OpenWakeWord+Whisper.cpp+Silero TTS А также расскажу, как подключить обе эти колонки к Home Assistant для управления устройствами умного дома.
https://habr.com/ru/articles/1005272/
#xiaozhi #esp32s3 #голосовой_ассистент #whisper #silero #ollama #raspberrypi
-
Как я снизил WER с 33% до 3.3% для русской речи на CPU: сравнение GigaAM, Whisper и Vosk
За два месяца я перепробовал три ASR-движка, шесть моделей Whisper, адаптивное чанкование, T5-коррекцию и ансамблевое голосование — и большая часть идей оказалась тупиком. В статье — подробный разбор шести тупиков и одной находки: почему GigaAM от Сбера на обычном CPU показывает 3.3% WER на русском, обходя Whisper large-v3-turbo на RTX 4090 (7.9%) в 2.4 раза. С бенчмарками, кодом и честными оговорками.
https://habr.com/ru/articles/1002260/
#speechtotext #gigaam #whisper #vosk #onnx #распознавание_речи #WER #голосовой_ввод #ASR #python
-
Как я снизил WER с 33% до 3.3% для русской речи на CPU: сравнение GigaAM, Whisper и Vosk
За два месяца я перепробовал три ASR-движка, шесть моделей Whisper, адаптивное чанкование, T5-коррекцию и ансамблевое голосование — и большая часть идей оказалась тупиком. В статье — подробный разбор шести тупиков и одной находки: почему GigaAM от Сбера на обычном CPU показывает 3.3% WER на русском, обходя Whisper large-v3-turbo на RTX 4090 (7.9%) в 2.4 раза. С бенчмарками, кодом и честными оговорками.
https://habr.com/ru/articles/1002260/
#speechtotext #gigaam #whisper #vosk #onnx #распознавание_речи #WER #голосовой_ввод #ASR #python
-
Как я снизил WER с 33% до 3.3% для русской речи на CPU: сравнение GigaAM, Whisper и Vosk
За два месяца я перепробовал три ASR-движка, шесть моделей Whisper, адаптивное чанкование, T5-коррекцию и ансамблевое голосование — и большая часть идей оказалась тупиком. В статье — подробный разбор шести тупиков и одной находки: почему GigaAM от Сбера на обычном CPU показывает 3.3% WER на русском, обходя Whisper large-v3-turbo на RTX 4090 (7.9%) в 2.4 раза. С бенчмарками, кодом и честными оговорками.
https://habr.com/ru/articles/1002260/
#speechtotext #gigaam #whisper #vosk #onnx #распознавание_речи #WER #голосовой_ввод #ASR #python
-
@techsimplified yes, accuracy issues indeed. The current state is good enough for the initial development tests, but the accuracy STT mistakes makes the rest of the pipeline mediocre, no matter how good it is. The input is the key.
#Vosk has been great but I feel I bump to the limits. I am testing #Whisper and should deliver punctuation and better accuracy, that translates to better interaction with the Chatbot, which brings improved user experience.
I will take a look at your suggestion, but I do focus on Voice to Text rather than Voice to action, as I aim for conversational experience more than simply executing tasks.
Thanx!
-
@techsimplified yes, accuracy issues indeed. The current state is good enough for the initial development tests, but the accuracy STT mistakes makes the rest of the pipeline mediocre, no matter how good it is. The input is the key.
#Vosk has been great but I feel I bump to the limits. I am testing #Whisper and should deliver punctuation and better accuracy, that translates to better interaction with the Chatbot, which brings improved user experience.
I will take a look at your suggestion, but I do focus on Voice to Text rather than Voice to action, as I aim for conversational experience more than simply executing tasks.
Thanx!
-
Marededéusinyó, 4 dies per fer que els ventiladors de la caixa del #Pitxu funcionin a diferents velocitats segons la temperatura, i en silenci.
He après molt aquesta dies. A nivell més de vida, aquest típic soroll d'aparell elèctric (el típic que ens fa canviar-lo per vell) és degut a que emet una freqüència audible, moltes vegades per error, com era el meu cas
Primer he conectat els ventiladors. Funcionen al 100%.
Després el pin de control. Tirar de llibreria GPIO per encendre'ls i apagar-los a certa temperatura.
Després aprendre d'Hysteresis, que és això de que ventili fins mes abaix del llindar per què no s'estigui encenent i apagant cada 5 segons.
Després convertir-lo a PWM, que permet variar la velocitat per que faci menys soroll.
Descobrir com funciona, i que a freqüències baixes el "zumbit" toca els ous. Massa.
Aprendre que s'ha d'usar una freqüència no-audible (~25kHz), i que la llibreria que uso explota a més de 10kHz, i el soroll no mola.
Resulta que totes les llibreries Python fan PWM per software, cal fer-ho per hardware.
La mare que va parir el Kernel de Linux, els overlays, i sa puta mare.M'he fet un overlay jo mateix, ja tinc els canals que necessito, i ja puc moure els ventiladors a la freqüència que vull.
El #Pitxu ja respira en silenci, i prèn grans bocanades d'aire quan ho necessita.
Entre la millora del micro, el que estic cohent per canviar de #Vosk a #Whisper, i que el hardware aguanti com toca tota la infra, ja començo a tenir ganes de posar-me amb els models altra cop.
-
Marededéusinyó, 4 dies per fer que els ventiladors de la caixa del #Pitxu funcionin a diferents velocitats segons la temperatura, i en silenci.
He après molt aquesta dies. A nivell més de vida, aquest típic soroll d'aparell elèctric (el típic que ens fa canviar-lo per vell) és degut a que emet una freqüència audible, moltes vegades per error, com era el meu cas
Primer he conectat els ventiladors. Funcionen al 100%.
Després el pin de control. Tirar de llibreria GPIO per encendre'ls i apagar-los a certa temperatura.
Després aprendre d'Hysteresis, que és això de que ventili fins mes abaix del llindar per què no s'estigui encenent i apagant cada 5 segons.
Després convertir-lo a PWM, que permet variar la velocitat per que faci menys soroll.
Descobrir com funciona, i que a freqüències baixes el "zumbit" toca els ous. Massa.
Aprendre que s'ha d'usar una freqüència no-audible (~25kHz), i que la llibreria que uso explota a més de 10kHz, i el soroll no mola.
Resulta que totes les llibreries Python fan PWM per software, cal fer-ho per hardware.
La mare que va parir el Kernel de Linux, els overlays, i sa puta mare.M'he fet un overlay jo mateix, ja tinc els canals que necessito, i ja puc moure els ventiladors a la freqüència que vull.
El #Pitxu ja respira en silenci, i prèn grans bocanades d'aire quan ho necessita.
Entre la millora del micro, el que estic cohent per canviar de #Vosk a #Whisper, i que el hardware aguanti com toca tota la infra, ja començo a tenir ganes de posar-me amb els models altra cop.
-
Marededéusinyó, 4 dies per fer que els ventiladors de la caixa del #Pitxu funcionin a diferents velocitats segons la temperatura, i en silenci.
He après molt aquesta dies. A nivell més de vida, aquest típic soroll d'aparell elèctric (el típic que ens fa canviar-lo per vell) és degut a que emet una freqüència audible, moltes vegades per error, com era el meu cas
Primer he conectat els ventiladors. Funcionen al 100%.
Després el pin de control. Tirar de llibreria GPIO per encendre'ls i apagar-los a certa temperatura.
Després aprendre d'Hysteresis, que és això de que ventili fins mes abaix del llindar per què no s'estigui encenent i apagant cada 5 segons.
Després convertir-lo a PWM, que permet variar la velocitat per que faci menys soroll.
Descobrir com funciona, i que a freqüències baixes el "zumbit" toca els ous. Massa.
Aprendre que s'ha d'usar una freqüència no-audible (~25kHz), i que la llibreria que uso explota a més de 10kHz, i el soroll no mola.
Resulta que totes les llibreries Python fan PWM per software, cal fer-ho per hardware.
La mare que va parir el Kernel de Linux, els overlays, i sa puta mare.M'he fet un overlay jo mateix, ja tinc els canals que necessito, i ja puc moure els ventiladors a la freqüència que vull.
El #Pitxu ja respira en silenci, i prèn grans bocanades d'aire quan ho necessita.
Entre la millora del micro, el que estic cohent per canviar de #Vosk a #Whisper, i que el hardware aguanti com toca tota la infra, ja començo a tenir ganes de posar-me amb els models altra cop.
-
@techsimplified it is, completely! I find that having my hands free to do actions (and queries) is indeed a game changer. I'm just bumping my head to make the STT to work smooth.
This project in the pic is a satellite device from my main #Pitxu ongoing built, chaining STT > Chatbot > TTS. As a satellite, it just captures sound, sends it to the "server" and plays the answer. It is a #RaspberryPiZero2 so it can't really hold all the engines needed.
As per tooling, the whole pack uses:
- #Vosk (now tinkering with #Whisper)
- #Gemini (now tinkering with #Ollama offline)
- #PiperBut a big chunk of my brain goes to the UX hardware:
- screen for a more human interaction
- soundcard I/O (gosh RPi is not yet polished here)
- GPIO buttons, UPS, PWM fan cases,... -
@techsimplified it is, completely! I find that having my hands free to do actions (and queries) is indeed a game changer. I'm just bumping my head to make the STT to work smooth.
This project in the pic is a satellite device from my main #Pitxu ongoing built, chaining STT > Chatbot > TTS. As a satellite, it just captures sound, sends it to the "server" and plays the answer. It is a #RaspberryPiZero2 so it can't really hold all the engines needed.
As per tooling, the whole pack uses:
- #Vosk (now tinkering with #Whisper)
- #Gemini (now tinkering with #Ollama offline)
- #PiperBut a big chunk of my brain goes to the UX hardware:
- screen for a more human interaction
- soundcard I/O (gosh RPi is not yet polished here)
- GPIO buttons, UPS, PWM fan cases,... -
@techsimplified it is, completely! I find that having my hands free to do actions (and queries) is indeed a game changer. I'm just bumping my head to make the STT to work smooth.
This project in the pic is a satellite device from my main #Pitxu ongoing built, chaining STT > Chatbot > TTS. As a satellite, it just captures sound, sends it to the "server" and plays the answer. It is a #RaspberryPiZero2 so it can't really hold all the engines needed.
As per tooling, the whole pack uses:
- #Vosk (now tinkering with #Whisper)
- #Gemini (now tinkering with #Ollama offline)
- #PiperBut a big chunk of my brain goes to the UX hardware:
- screen for a more human interaction
- soundcard I/O (gosh RPi is not yet polished here)
- GPIO buttons, UPS, PWM fan cases,... -
Как я написал ASR-движок на Rust: от разочарования в одной модели до мульти-модельной архитектуры
Привет, Хабр! В предыдущей статье я рассказывал, как портировал модель синтеза речи Qwen3-TTS на Rust. Тот проект ( RustTTS ) получился достаточно успешным — один бинарник, мгновенный старт, никаких Python-зависимостей. Естественным продолжением стала обратная задача — распознавание речи (ASR, Automatic Speech Recognition). Логика казалась простой: у Qwen есть и TTS и ASR, архитектуры похожи, опыт с Candle уже есть, значит справимся за пару недель. Ну... не совсем.
https://habr.com/ru/articles/995416/
#rust #asr #speechtotext #speech_recognition #whisper #candle #machine_learning #inference
-
Как я написал ASR-движок на Rust: от разочарования в одной модели до мульти-модельной архитектуры
Привет, Хабр! В предыдущей статье я рассказывал, как портировал модель синтеза речи Qwen3-TTS на Rust. Тот проект ( RustTTS ) получился достаточно успешным — один бинарник, мгновенный старт, никаких Python-зависимостей. Естественным продолжением стала обратная задача — распознавание речи (ASR, Automatic Speech Recognition). Логика казалась простой: у Qwen есть и TTS и ASR, архитектуры похожи, опыт с Candle уже есть, значит справимся за пару недель. Ну... не совсем.
https://habr.com/ru/articles/995416/
#rust #asr #speechtotext #speech_recognition #whisper #candle #machine_learning #inference