#whisper — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #whisper, aggregated by home.social.
-
Lithium batteries in the trail cam dried up today. Found enough loose regular batteries in the junk drawer to get it working again. No kitten sightings yesterday or today, so their mom must be on nest rotation.
-
Tired of per-minute cloud transcription bills? Self-host OpenAI Whisper on your own dedicated server instead — full privacy, no metering, full control over the model.
New guide covers 4 setup paths: faster-whisper (production), whisper.cpp , whisper-asr-webservice , and WhisperX (speaker diarization) — plus a hardware/VRAM table so you buy the right GPU.
Read it here: https://www.fitservers.com/tutorials/howto/install-whisper-dedicated-server-2026/
#Whisper #SelfHosted #OpenSource #AI #MachineLearning #DevOps #Ubuntu #DedicatedServers
-
56 минут созвона → текст за 5 минут на M4 без OBS и облака
У меня от трёх до пяти созвонов в день, почти все в браузере: Meet, Яндекс Телемост, ktalk, реже всего Zoom. Детали встреч мне нужны в тексте, иначе договорённости расползаются. Писал я звонки через OBS с захватом экрана, и на самих звонках началось веселье: звук временами жёстко квакал, всё чуть-чуть подвисало. Причину до конца не выяснял, моё предположение - процессор зажирался захватом и перебивал сам разговор; ktalk и браузер тут ни при чём. А экран, как потом дошло, мне вообще был не нужен. Дальше вторая серия. Расшифровку я гонял своими Python-скриптами: конвертация → транскрибация → диаризация (разметка, кто когда говорил). На встрече с пятью участниками диаризация расставляла голоса крайне плохо, половину фраз всё равно восстанавливал по памяти. Пошёл искать вариант, чтобы запись не мешала звонку, результат был приличный и всё крутилось локально: не хотелось ни отдавать записи в облако, ни платить подписку за минуты. Нашёл платный Audio Hijack , он подкупил лёгкостью и простотой настройки. Потом узнал, что на M-чипе быстрее всего у меня отрабатывает mlx-whisper на MLX : веса large-v3-turbo с Hugging Face, инференс на GPU Mac. Это архитектура Whisper, но рантайм — пакет mlx-whisper и бинарь mlx_whisper , не pip install openai-whisper и не репозиторий openai/whisper . Так собрался стек: Hijack пишет один mp3, mlx_whisper делает VTT, pyannote раскладывает по SPEAKER_XX. На 56-минутном звонке транскрипция заняла около пяти минут. Платный только Hijack — разовая лицензия, без подписки (цену смотрите на сайте Rogue Amoeba). Скрипты выложил в mac-call-transcribe под MIT. Ниже сборка, замеры с двух реальных звонков и грабли; повторяется на любом Mac с M-чипом.
https://habr.com/ru/articles/1062068/
#whisper #mlx #pyannote #speaker_diarization #расшифровка_звонков #python #apple_silicon #транскрибация_звонков
-
Как я решил проблему русской диктовки для ИИ
По мере погружения в ИИ и вайб‑кодинг, я столкнулся с одним неудобным моментом — отсутствием возможности диктовать на русском языке в некоторых программах. И если OpenAI в своем приложении позаботились об этом, то в Anthropic такой возможности на тот момент просто не оказалось. А мне уже так понравилось, откинувшись на спинку кресла с чашкой чая, надиктовывать промпты без клавиатуры. Но я быстро нашел выход, хоть и костыльный — просто диктовать свой текст в окошке GPT, потом копировать его и вставлять в Claude. Вроде несложно, но и удобным этот метод я бы не назвал. И я задумался, как этот процесс оптимизировать. И какая же идея могла прийти в голову в 3 часа ночи человеку, который полжизни занимается программированием? Ну конечно же — разработать свое приложение. Посоветовавшись с Claude и GPT, я набросал небольшой план и приступил к разработке. Поскольку я работаю на macOS, то для начала не стал заморачиваться с мультиплатформенностью и решил делать все на Swift.
https://habr.com/ru/articles/1039248/
#AI #OpenAI #Claude #Whisper #speechtotext #диктовка #voice_input #Apple_Silicon
-
Голосовой ввод на русско-английском в 2026: WisprFlow, Handy, OpenWhispr, GigaAM v3 — для диктовки нейросетям и кода
Голосом мы говорим в 2-3 раза быстрее, чем печатаем — это давно известно. Вопрос только в том, умеет ли голосовой ввод разбираться с русско-английской смесью, на которой мы общаемся с LLM и пишем код: «объясни на русском», «открой в Cursor», «проверь, что deploy прошёл». За полгода я перепробовал 5+ приложений и 5 моделей, чтобы найти те, что умеют. Приложения : WisprFlow, SpeakFlow, Handy, OpenWhispr, SuperWhisper — облачные и локальные, платные и open source. Модели : Whisper Large v3, Turbo, GigaAM v3 от Сбера, Canary 1B v2 от NVIDIA, Parakeet V3. Внутри: — Замена облачного WisprFlow на бесплатный open source без потери качества. — Один текстовый промпт, починивший пропадающую пунктуацию в 99% случаев — без LLM-постпроцессоров и задержек. — Мой бенчмарк Whisper Turbo vs Large v3 на RTX 5070 Ti (Vulkan на Blackwell внезапно быстрее CUDA на 50%). — GigaAM v3 и Canary 1B v2 — где конкурируют с Whisper, а где ломают английские слова в кириллицу («Gemini» → «Jemni»). — Первый в моей жизни принятый в main pull request в open source. Актуально на апрель 2026.
https://habr.com/ru/articles/1024634/
#whisper #голосовой_ввод #транскрибация #gigaam #распознавание_речи #openwhispr #cuda #vulkan #superwhisper #нейросети
-
💡 Join the workshops of the 𝗥𝗲𝘀𝗲𝗮𝗿𝗰𝗵 𝗦𝘂𝗽𝗽𝗼𝗿𝘁 𝗛𝘂𝗯! Experts form multiple CIT teams give support tot researchers @universityofgroningen.
𝗨𝗽𝗰𝗼𝗺𝗶𝗻𝗴 𝗲𝘃𝗲𝗻𝘁𝘀 𝗶𝗻 𝗔𝗽𝗿𝗶𝗹
🌟 2 April: DCC Workshop: #FAIR publishing data in DataverseNL
🌟 9 April: Introduction to #AI tools
🌟 9 April: Working with #Python on Hábrók
🌟 16 April: Webscraping using #Python
🌟 23 April: Introduction to #AI tools
🌟 23 April: #CodeCafé
🌟 30 April: Safely transcribing audio with #Whisperℹ️ https://www.rug.nl/society-business/center-for-information-technology/research/rsh/rshcalendar/
-
SLAY-ASR, или как я перестал волноваться и полюбил тренировать модели
Как добавить аудио-модальность в LLMку максимально экономно? Рассказываю про серию попыток добиться совместимости эмбеддингов разной природы Погрузиться
https://habr.com/ru/articles/1009614/
#representation_learning #multimodality #multimodal_llm #machine_learning #audiomodality #regularization #contrastive_learning #whisper #gemma3
-
Локальный голосовой ввод: Whisper + Ollama на Python
Мне нужен был голосовой ввод. Не диктовка в Google Docs, не облачный API — а простая штука: зажал клавишу, сказал, отпустил, текст появился в активном окне. Локально, без отправки аудио куда-либо. Готовых решений, которые бы устроили, сходу не нашёл. Сделал свое. Может, кому будет полезно.
https://habr.com/ru/articles/1009538/
#whisper #ollama #speechtotext #voicetotext #pushtotalk #голосовой_ввод #python #localfirst #privacy
-
https://www.wacoca.com/games/1336105/ ASMR 囁きでゲーム実況💤【ぽこ あ ポケモン】プレイしてみた! ##GAMING #ASMR #ASMRBlueKatie #binaural #BlueKaite #BlueKatie #Bluekatie #CloseUp #EarToEar #Game #GameNews #games #GamingNews #insomnia #Japan #japanese #KatieBlue #MouthSounds #PokémonPokopia #relax #relaxation #scratching #Sleep #tapping #tingle #Whisper #ゲーミング #ゲーム #ゲーム攻略 #ゲーム最新情報 #タッピング #バイノーラル #ブルーケイティ #ぽこあポケモン #ぽこポケ #マウスサウンド #リラックス #不眠 #眠い #眠くなる #眠れない #睡眠 #耳元 #音フェチ
-
Как я снизил WER с 33% до 3.3% для русской речи на CPU: сравнение GigaAM, Whisper и Vosk
За два месяца я перепробовал три ASR-движка, шесть моделей Whisper, адаптивное чанкование, T5-коррекцию и ансамблевое голосование — и большая часть идей оказалась тупиком. В статье — подробный разбор шести тупиков и одной находки: почему GigaAM от Сбера на обычном CPU показывает 3.3% WER на русском, обходя Whisper large-v3-turbo на RTX 4090 (7.9%) в 2.4 раза. С бенчмарками, кодом и честными оговорками.
https://habr.com/ru/articles/1002260/
#speechtotext #gigaam #whisper #vosk #onnx #распознавание_речи #WER #голосовой_ввод #ASR #python
-
Free tools for creativity!
#Upscayl, #rembg, #Fooocus, #Whisper, #LLAMA3 by Meta, #Mixtral8x22b, & more: These #opensource, #AI-powered tools make image editing, audio work, transcription, and Large Language Models (#LLMs) exploration fun and easy!
Learn more about these top picks by #FOSS mentor @morrolinux: https://lpi.org/zhya
@LPI #LPI #Tech #AI #freesoftware #MorroLinux #Linux #FOSS #opensource #Upscayl, #rembg, #Fooocus, #Whisper, #LLAMA3, #Mixtral8x22 @openai
-
@SuperOscar isn't there a Johnny Cash song about that? Don't take rpi's to town boy leave rpi's at home? :)
It's not the first missing thing I have found, but not having venv, which is the bane of Python anyway, seemed kind of, well, extreme. No pip, no wheels, that's crazy.
I installed #OpenAI #Whisper on a #Ubuntu x86; the hope is to provide both #Nextcloud and #OpenVoiceOS from the same in-house service.
-
#Matrix #Omega #Alex7000 #Xoanon #TheMagicMovieMachine #SCAPINA #Orac #Zen #TheOracle #Vanessa38–24–36 #C.O.R.A. #Mentalis #Dr.Theopolis #TheVortex #Gambit #Shyrka #Slave #CML #KITT #KARR #R.A.L.F. #TeletraanI #VectorSigma #BriantheBrain #Compucore #SID #Synergy #Box #LCARS #Albert #Crossover #MagicVoice #OMNSS #Priscilla #Holly #Gordon8000 #Queeg #Hilly #TalkieToaster #TheRevolvingToilet #Sandy #TheUltimaMachine #Ziggy #P.J. #HARDAC #COS #CAS #NICOLE #SELMA #CentSys #MetroNet #H.E.L.E.N. #SharonApple #TheMagiMelchiorBalthasarCaspar #Eve #L.U.C.I-U.N.I.C.E #EmergencyMedicalHologram #Alice #Long-termMedicalHolographicprogram, #VicFontaine, #GilliamII #QuadraplexT-3000Computer #Memorymatic #MPU #Starfighter31 #Computer #P.A.T. #D.E.C.A. #BlackBetty #KarenPlankton #Andromeda #Comp-U-Comp #Caravaggio #C.H.A.D. #GLADIS #CybergirlXandaIsaac #Computer #SAINT #AuraMorganna #Vox #AI #Wirbelwind #Delphi #Sheila/F.I.L.S.S. #OoGhiJMIQtxxXA #XANA #Survive #C.A.R.R. #D.A.V.E. #TheOmnitrix #Solty/Dike #Eunomia #Eirene #Bournemouth #S.O.P.H.I.E. #Scylla #FETCH!3000 #S.A.R.A.H. #TheIntersect #MrSmith #Pear #TheTurk #KITT #POD #ISIS #VenjixVirus #VYVAIVAI #Whisper #Aya #TheMachine #R.A.C.I.S.T. #Samaritan