#fasterwhisper — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #fasterwhisper, aggregated by home.social.
-
Голосовой ввод в любое окно Windows за секунду. Офлайн, на CPU, без единого гигабайта torch
Голосовой ввод для Windows за ~1 секунду | Полностью локально • CPU • Open Source Как заставить Whisper распознавать речь почти в 4 раза быстрее на обычном CPU без GPU и без облака. Разбираю архитектуру WhisperType, сужение окна энкодера, потоковую обработку аудио, оптимизацию faster-whisper и подводные камни WinAPI.
https://habr.com/ru/articles/1068154/
#Whisper #WhisperType #fasterwhisper #CTranslate2 #SpeechtoText #распознавание_речи #Windows #Python #CPU #Open_Source
-
Я печатаю медленнее, чем думаю: локальная диктовка на Whisper для Windows, телефона и Telegram
Я диктую постоянно: сообщения, заметки, постановку задач — говорить в разы быстрее, чем печатать, а мысль не успевает остыть. Проблема в том, что удобной диктовки, которая не гонит звук в чужое облако, я не нашёл. Так появился PasteTalk: локальная диктовка для Windows по горячей клавише, а вокруг неё — собственный сервер, приложение для телефона и Telegram-бот. Отдельным требованием стала мама: из-за слабого зрения печатать на телефоне она почти не может, и телефонная часть проектировалась под самый жёсткий случай — одна кнопка на весь экран, крупный шрифт, ошибки словами. Забегая вперёд: правки «для мамы» сделали приложение удобнее и для всех остальных. Под катом — архитектура, цифры и четыре бага, каждый из которых молча съедал наговорённый текст. Как это устроено →
https://habr.com/ru/articles/1068152/
#whisper #диктовка #распознавание_речи #speechtotext #selfhosted #telegramбот #локальные_нейросети #fasterwhisper
-
Claude Code в Telegram голосом: свой мост, когда официальный канал выключен
MCP-сервер отвечает Connected. Инструменты работают: бот сам присылает мне сообщения. Мои сообщения до бота доходят, я вижу их в очереди Telegram. А в сессию Claude Code они не попадают. Ни ошибки, ни предупреждения. Полтора часа я искал не там. Меня зовут Сол ГудКод, и обычно я вытаскиваю людей из ситуаций, в которые они сами себя загнали, но на этот раз клиентом оказался я сам: мне нужен был бот, которому можно наговорить задачу голосом из дороги, чтобы он сделал её на моей машине и в моих проектах. У Anthropic такое есть официально, и именно поэтому история вышла длиннее, чем я рассчитывал. Внутри: как отличить эту тишину от своей ошибки за минуту и чем я заменил официальный канал. Плюс восемь мест, где я наступил на грабли Windows. В том числе на те, куда уже наступал в этом же проекте. И на ту, где Claude вежливо попросил меня договорить мысль.
https://habr.com/ru/articles/1063578/
#claude_code #телеграмбот #anthropic #ииагенты #llm #whisper #fasterwhisper #powershell #голосовое_управление #mcp
-
Робот, который звонит в WhatsApp: как я автоматизировал то, что автоматизировать не предполагалось
Задача формулировалась в одно предложение: робот должен сам звонить людям в WhatsApp, проигрывать голосовое приветствие, записывать ответ и присылать оператору расшифровку с вердиктом «да / нет / надо посмотреть руками». Проблема в том, что официально это невозможно. У WhatsApp нет API для голосовых роботов: Business API умеет шаблонные сообщения, провайдеры на рынке умеют текстовые рассылки, голосовые звонки закрыты наглухо. Готового решения не существует ни за деньги, ни за большие деньги. Зато существует официальное десктопное приложение, которое звонить умеет. И его можно водить за руку. Это рассказ о том, что из этого вышло: с чего начиналось, какие подходы умерли по дороге, четыре слоя автоматизации — от CDP до виртуальных аудиокабелей — и один урок про производительность, который перечеркнул половину архитектуры уже на живых звонках. Сразу оговорюсь: по отношению к правилам платформы это серая зона, и я не предлагаю это повторять. Мне здесь интересна чистая инженерия — как автоматизируется то, что автоматизировать не предполагалось. Ограничения и риски честно разберу в конце. Кода будет много. Всё интересное в этом проекте живёт именно в деталях.
https://habr.com/ru/articles/1062882/
#whatsapp #playwright #ui_automation #pywinauto #webview2 #cdp #fasterwhisper #windows #автоматизация #виртуальные_аудиоустройства
-
Как быстро собрать полезный инструмент: транскрибатор видео с помощью вайб‑кодинга
После рабочих встреч часто остаются записи. В моем случае это записи Яндекс Телемоста. Запись есть, но пользоваться ей не всегда удобно. Если нужно что‑то вспомнить, приходится открывать видео, перематывать, искать нужный кусок, переслушивать. Если нужно передать встречу другому человеку, одного видео обычно мало. У меня часто бывает такой сценарий: нужно передать программисту контекст по задаче. Можно скинуть запись встречи и написать: «посмотри, пожалуйста». Но человеку придется самому смотреть видео, искать важные места, понимать, где обсуждение, где решение, где задача. Мне хотелось получить более удобный вариант: вместе с записью отправлять текстовый итог встречи. Идея была простая: загрузить видео встречи и получить транскрипт, протокол и DOCX, который можно отправить дальше. Первую рабочую версию получилось собрать через Codex примерно за 30 минут.
https://habr.com/ru/articles/1055984/
#транскрибация #Whisper #fasterwhisper #ffmpeg #Python #GPT #Яндекс_Телемост #локальное_приложение #DOCX #OpenAI
-
Whisper или GigaAM для русского ASR в продакшене: три ловушки бенчмарка, которые перевернут ваши выводы
Полгода назад мы публиковали статью про то, как получили 3.3% WER для русского ASR с GigaAM. Замеры шли на пяти TTS-фрагментах из аудиокниг, что подтверждало тезис «специализация бьёт универсальность». С тех пор мы перемерили обе модели на реальных продакшен-записях и попали в три ловушки бенчмарка. Первый замер показал «GigaAM впереди Whisper на 7 pp». На тех же данных, после небольшой чистки, обе модели идут вровень. А на самом шумном клипе с реверберацией Whisper уходит вперёд на 19 pp. Это всё на одном подкасте, с одними и теми же скриптами, одними и теми же моделями. Детали разбираем под катом. Протестировали 10 методов «улучшения» аудио (большинство сделали хуже), измерили RTF на RTX 4090 и сформулировали финальный выбор: GPU - до обученный Whisper-turbo, CPU - GigaAM v3-e2e-rnnt. И почему именно так.
https://habr.com/ru/articles/1042574/
#распознавание_речи #ASR #Whisper #GigaAM #WER #fasterwhisper #бенчмарк #finetuning #русский_ASR #оффлайнраспознавание
-
CW: Una pequeña aventura con modelos offline voz a texto
Etaba jugando con una aplicación disponible en #flathub llamada #SpeechNote. Bajé uno de los modelos chiquitos para probar, el #FasterWhisper, y traté de hacer la transcripción de una lectura que hice en la playa del cuento #Axolotl de #JulioCortázar .
Menuda sorpresa me di viendo que el modelo tenía la capacidad transcriptora de alguien que no he leído nunca en su vida 😂 😂 :
-
@alextecplayz @cassidy #GoogleLens is one of the only features I miss since switching to #GrapheneOS. Very useful with no #FOSS alternatives on any platform afaik. I suppose this could be done with an extension for #GnomeShell, OCR, image classification models, & reverse image search.
#GoogleAssistant too, but there's already a decent stack with #FasterWhisper & #Wyoming with #HomeAssistant. I'd like to build a #GTK client to integrate with this on #Linux systems.
-
descargué un modelo para español llamado #FasterWhisper , y para el texto a voz una voz en español mexicano. Nada mal.
-
It appears that #whisperx performs better than #openai #whisper and #fasterwhisper for #ai #transcription https://amgadhasan.substack.com/p/sota-asr-tooling-long-form-transcription