#whisper — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #whisper, aggregated by home.social.
-
I have several old Maxwell Nvidia GPUs with 12 GB VRAM. They only support Cuda 11.8 with the driver-version 580.X so they are not supported by the most recent versions of faster-whisper or Debian.
So i build a Dockerfile, which makes it possible to use the gpu with that. The response time are almost instant for short sentences.
-
We at @parchlinux have started building something we've wanted for a long time: a full accessibility layer baked into the distro itself, not bolted on as an afterthought. Persian voice support, offline speech recognition, and a design that treats every desktop environment the same way. 🧵👇
https://blog.parchlinux.com/a-linux-distribution-that-leaves-no-one-behind/
#Linux #Accessibility #OpenSource #FOSS #a11y #ParchLinux #Persian #ScreenReader #Whisper #Privacy
-
We at @parchlinux have started building something we've wanted for a long time: a full accessibility layer baked into the distro itself, not bolted on as an afterthought. Persian voice support, offline speech recognition, and a design that treats every desktop environment the same way. 🧵👇
https://blog.parchlinux.com/a-linux-distribution-that-leaves-no-one-behind/
#Linux #Accessibility #OpenSource #FOSS #a11y #ParchLinux #Persian #ScreenReader #Whisper #Privacy
-
Голосовой ввод в любое окно Windows за секунду. Офлайн, на CPU, без единого гигабайта torch
Голосовой ввод для Windows за ~1 секунду | Полностью локально • CPU • Open Source Как заставить Whisper распознавать речь почти в 4 раза быстрее на обычном CPU без GPU и без облака. Разбираю архитектуру WhisperType, сужение окна энкодера, потоковую обработку аудио, оптимизацию faster-whisper и подводные камни WinAPI.
https://habr.com/ru/articles/1068154/
#Whisper #WhisperType #fasterwhisper #CTranslate2 #SpeechtoText #распознавание_речи #Windows #Python #CPU #Open_Source
-
Я печатаю медленнее, чем думаю: локальная диктовка на Whisper для Windows, телефона и Telegram
Я диктую постоянно: сообщения, заметки, постановку задач — говорить в разы быстрее, чем печатать, а мысль не успевает остыть. Проблема в том, что удобной диктовки, которая не гонит звук в чужое облако, я не нашёл. Так появился PasteTalk: локальная диктовка для Windows по горячей клавише, а вокруг неё — собственный сервер, приложение для телефона и Telegram-бот. Отдельным требованием стала мама: из-за слабого зрения печатать на телефоне она почти не может, и телефонная часть проектировалась под самый жёсткий случай — одна кнопка на весь экран, крупный шрифт, ошибки словами. Забегая вперёд: правки «для мамы» сделали приложение удобнее и для всех остальных. Под катом — архитектура, цифры и четыре бага, каждый из которых молча съедал наговорённый текст. Как это устроено →
https://habr.com/ru/articles/1068152/
#whisper #диктовка #распознавание_речи #speechtotext #selfhosted #telegramбот #локальные_нейросети #fasterwhisper
-
Whisper transcribes 70-year-olds more accurately than 20-year-olds
https://github.com/Kayvan-Zahiri/asr-age-gap
Comments: https://news.ycombinator.com/item?id=49204388
#HackerNews #Whisper #ASR #age #gap #transcription #accuracy #technology #70s #vs #20s
-
Whisper transcribes 70-year-olds more accurately than 20-year-olds
https://github.com/Kayvan-Zahiri/asr-age-gap
Comments: https://news.ycombinator.com/item?id=49204388
#HackerNews #Whisper #ASR #age #gap #transcription #accuracy #technology #70s #vs #20s
-
Как сжать 300+ часов D&D сериала в пересказ для актеров
Я давно играю в ДнД и почти с самого начала смотрю «Грядут приключения» - ребята снимают настольные ролевые игры как сериалы: живая партия актеров за столом, постоянный каст, сквозной сюжет, серии по пять-шесть часов. Нравится у них всё, но больше всего - «Архипелаг» и «Эндемия». В какой-то момент несравненный Мастер Гоша Воронин кинул в своём канале клич: проекту нужна помощь с пересказом сериала. Нужен был текст, по которому актёры смогут прочитать всё случившееся за 55 серий. Обычно такие вещи делают руками. Энтузиасты берут источник, сами его пересматривают, сами расписывают сценарий, сами переводят всё в текст. Работа адская даже когда в источнике пара часов записи, а тут триста. Я решил попробовать по-новому и написал в комментах, что могу помочь: работаю с ИИ и большими данными, сделаю это в разы быстрее, чем руками, и никому не придётся месяцами сидеть над расшифровками. Так я и взялся разобрать все 55 серий в базу знаний и написать по ней текст видеопересказа для актеров на 30-60 минут.
https://habr.com/ru/articles/1065794/
#GigaAM #Whisper #ASR #распознавание_речи #диаризация #Claude #Opus #LLM #база_знаний #транскрибация
-
Keine Angst vor Spracherkennung. Auf einem aktuellen MacBook transkribiert #Whisper superschnell und vollständig lokal. Eine Stunde Besprechung ist in wenigen Minuten verschriftlicht, ohne Netzwerkverbindung. https://www.mrak.at/transkription-ohne-umweg-was-whisper-fur-datenschutz-und-digitale-souveranitat-leisten-kann/
-
Keine Angst vor Spracherkennung. Auf einem aktuellen MacBook transkribiert #Whisper superschnell und vollständig lokal. Eine Stunde Besprechung ist in wenigen Minuten verschriftlicht, ohne Netzwerkverbindung. https://www.mrak.at/transkription-ohne-umweg-was-whisper-fur-datenschutz-und-digitale-souveranitat-leisten-kann/
-
Я ошибался: бенчмарк 23 ASR-нейросетей для русской айтишной диктовки
В марте я советовал Whisper Large v3 для голосовой диктовки и ошибался дважды: в методе (выбирал модель «на ощупь») и в самой модели. Пересобрал всё по-научному: 23 ASR-модели в 60+ конфигурациях, больше 100 000 прогонов на русско-английском IT-корпусе, 120+ часов инференса на одной RTX 5070 Ti. Мерил не только WER, но и сохранение английских терминов латиницей и пунктуацию. Внутри — полный лидерборд, разбор каждого сюрприза, вклад тюнинга и промптов, cloud-против-open по деньгам и инструкция, как поставить победителя за 10 минут.
https://habr.com/ru/articles/1066528/
#whisper #breezeasr #распознавание_речи #ASR #voicetotext #whisper_large_v3 #whisper_turbo #gigaam_v3 #faster_whisper #codeswitching
-
Tired of per-minute cloud transcription bills? Self-host OpenAI Whisper on your own dedicated server instead — full privacy, no metering, full control over the model.
New guide covers 4 setup paths: faster-whisper (production), whisper.cpp , whisper-asr-webservice , and WhisperX (speaker diarization) — plus a hardware/VRAM table so you buy the right GPU.
Read it here: https://www.fitservers.com/tutorials/howto/install-whisper-dedicated-server-2026/
#Whisper #SelfHosted #OpenSource #AI #MachineLearning #DevOps #Ubuntu #DedicatedServers
-
I made this #YouTube video for work using #OpenSource. #Audacity with #OpenVINO to clean up the #Audio #Inkscape for the lower thirds and #Kdenlive to edit everything. Oh, and #Whisper to automatically create the #subtitles, which is did an amazing job, better than Audacity and OpenVINO did. Only would have been better if I did it on my home #kubuntu desktop but open source #software is the best and all ran on my Windows workstation.
-
Claude Code в Telegram голосом: свой мост, когда официальный канал выключен
MCP-сервер отвечает Connected. Инструменты работают: бот сам присылает мне сообщения. Мои сообщения до бота доходят, я вижу их в очереди Telegram. А в сессию Claude Code они не попадают. Ни ошибки, ни предупреждения. Полтора часа я искал не там. Меня зовут Сол ГудКод, и обычно я вытаскиваю людей из ситуаций, в которые они сами себя загнали, но на этот раз клиентом оказался я сам: мне нужен был бот, которому можно наговорить задачу голосом из дороги, чтобы он сделал её на моей машине и в моих проектах. У Anthropic такое есть официально, и именно поэтому история вышла длиннее, чем я рассчитывал. Внутри: как отличить эту тишину от своей ошибки за минуту и чем я заменил официальный канал. Плюс восемь мест, где я наступил на грабли Windows. В том числе на те, куда уже наступал в этом же проекте. И на ту, где Claude вежливо попросил меня договорить мысль.
https://habr.com/ru/articles/1063578/
#claude_code #телеграмбот #anthropic #ииагенты #llm #whisper #fasterwhisper #powershell #голосовое_управление #mcp
-
Azul, bonjour ☕
Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.
Ce modèle est une adaptation de whisper-large-v3.
Plus d'info sur : https://huggingface.co/Sunbird/asr-whisper-51-african-languages
-
Azul, bonjour ☕
Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.
Ce modèle est une adaptation de whisper-large-v3.
Plus d'info sur : https://huggingface.co/Sunbird/asr-whisper-51-african-languages
-
56 минут созвона → текст за 5 минут на M4 без OBS и облака
У меня от трёх до пяти созвонов в день, почти все в браузере: Meet, Яндекс Телемост, ktalk, реже всего Zoom. Детали встреч мне нужны в тексте, иначе договорённости расползаются. Писал я звонки через OBS с захватом экрана, и на самих звонках началось веселье: звук временами жёстко квакал, всё чуть-чуть подвисало. Причину до конца не выяснял, моё предположение - процессор зажирался захватом и перебивал сам разговор; ktalk и браузер тут ни при чём. А экран, как потом дошло, мне вообще был не нужен. Дальше вторая серия. Расшифровку я гонял своими Python-скриптами: конвертация → транскрибация → диаризация (разметка, кто когда говорил). На встрече с пятью участниками диаризация расставляла голоса крайне плохо, половину фраз всё равно восстанавливал по памяти. Пошёл искать вариант, чтобы запись не мешала звонку, результат был приличный и всё крутилось локально: не хотелось ни отдавать записи в облако, ни платить подписку за минуты. Нашёл платный Audio Hijack , он подкупил лёгкостью и простотой настройки. Потом узнал, что на M-чипе быстрее всего у меня отрабатывает mlx-whisper на MLX : веса large-v3-turbo с Hugging Face, инференс на GPU Mac. Это архитектура Whisper, но рантайм — пакет mlx-whisper и бинарь mlx_whisper , не pip install openai-whisper и не репозиторий openai/whisper . Так собрался стек: Hijack пишет один mp3, mlx_whisper делает VTT, pyannote раскладывает по SPEAKER_XX. На 56-минутном звонке транскрипция заняла около пяти минут. Платный только Hijack — разовая лицензия, без подписки (цену смотрите на сайте Rogue Amoeba). Скрипты выложил в mac-call-transcribe под MIT. Ниже сборка, замеры с двух реальных звонков и грабли; повторяется на любом Mac с M-чипом.
https://habr.com/ru/articles/1062068/
#whisper #mlx #pyannote #speaker_diarization #расшифровка_звонков #python #apple_silicon #транскрибация_звонков
-
Scrib | F-Droid - Free and Open Source Android App Repository
https://f-droid.org/packages/org.scrib.transcriber/
> On-device voice transcription. Your audio never leaves your phone.
Распознавание речи на устройстве. Ваше аудио не покидает телефон.
Аудио распознаётся полностью на вашем телефоне. Ничего не загружается — приложение выходит в сеть только чтобы скачать модель.
Два способа использовать Scrib
• Распознать своё аудио. Выберите любой аудиофайл на телефоне и получите текст — прямо здесь, полностью офлайн.
• Движок распознавания для других приложений. Scrib работает в фоне. Приложения, которые это поддерживают — например Forkgram — могут превращать голосовые в текст через Scrib, на вашем устройстве. В настройках того приложения выберите Scrib как офлайн-распознаватель.
Модели
Scrib распознаёт открытыми моделями Whisper. Скачайте модель на главном экране или выберите язык — Scrib подберёт подходящую. Крупнее = точнее; можно и несколько моделей.
-
La dettatura vocale arriva su Linux con un progetto open source che punta tutto su privacy, velocità e semplicità d'uso. Scopri come funziona Vocalinux e perché potrebbe diventare uno strumento indispensabile. #Linux #OpenSource #VoiceTyping #Privacy #Wayland #Whisper
-
La dettatura vocale arriva su Linux con un progetto open source che punta tutto su privacy, velocità e semplicità d'uso. Scopri come funziona Vocalinux e perché potrebbe diventare uno strumento indispensabile. #Linux #OpenSource #VoiceTyping #Privacy #Wayland #Whisper
-
After tracking down the reflecting pool vandals (a cabal of communist squirrels), Detective Whisper turned her attention to the Case of the Torn Curtain Panel.
-
After tracking down the reflecting pool vandals (a cabal of communist squirrels), Detective Whisper turned her attention to the Case of the Torn Curtain Panel.
-
Vocalinux is an open-source voice dictation app for Linux that works entirely offline.
It supports Whisper.cpp, OpenAI Whisper, and VOSK, letting you dictate into almost any application without sending your audio to the cloud. It also includes GPU acceleration, customizable hotkeys, and Wayland/X11 support.
More details: https://digitalescapetools.com/tools/tool.html?id=vocalinux
#OpenSource #Linux #Privacy #SpeechToText #Whisper #Productivity
-
Vocalinux is an open-source voice dictation app for Linux that works entirely offline.
It supports Whisper.cpp, OpenAI Whisper, and VOSK, letting you dictate into almost any application without sending your audio to the cloud. It also includes GPU acceleration, customizable hotkeys, and Wayland/X11 support.
More details: https://digitalescapetools.com/tools/tool.html?id=vocalinux
#OpenSource #Linux #Privacy #SpeechToText #Whisper #Productivity
-
SpeechAnalyzer : un benchmark confirme que la transcription d’Apple bat le Whisper d'OpenAI http://dlvr.it/TTX1p1 #Apple #Whisper
-
SpeechAnalyzer : un benchmark confirme que la transcription d’Apple bat le Whisper d'OpenAI http://dlvr.it/TTX1p1 #Apple #Whisper
-
New article on my website: Transcribing voice memos locally in 2026 (on Windows)
https://www.tomfichtner.com/article/transcription-of-voice-memos/
A practical guide to turning voice recordings into text without uploading them to the cloud. Written for beginners, I focus on ease-of-use and reliability. Also covers a bit of technical background and what else may lie ahead in human-machine voice interaction.
Also available in German: https://www.tomfichtner.com/article/de/transkription-von-sprachmemos/
-
New article on my website: Transcribing voice memos locally in 2026 (on Windows)
https://www.tomfichtner.com/article/transcription-of-voice-memos/
A practical guide to turning voice recordings into text without uploading them to the cloud. Written for beginners, I focus on ease-of-use and reliability. Also covers a bit of technical background and what else may lie ahead in human-machine voice interaction.
Also available in German: https://www.tomfichtner.com/article/de/transkription-von-sprachmemos/
-
Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor
https://get-inscribe.com/blog/apple-speech-api-benchmark.html
Comments: https://news.ycombinator.com/item?id=48894752
#HackerNews #Apple #SpeechAnalyzer #API #Whisper #Benchmark #Technology #Innovation
-
Apple's new SpeechAnalyzer API, benchmarked against Whisper and its predecessor
https://get-inscribe.com/blog/apple-speech-api-benchmark.html
Comments: https://news.ycombinator.com/item?id=48894752
#HackerNews #Apple #SpeechAnalyzer #API #Whisper #Benchmark #Technology #Innovation
-
📌 Sottotitolare un video in locale oggi è possibile, anche con la traduzione.
Subtitle Edit integra Whisper e Ollama. 👇
https://gomoot.com/subtitle-edit-whisper-sottotitoli-automatici-per-qualsiasi-video/ -
📌 Sottotitolare un video in locale oggi è possibile, anche con la traduzione.
Subtitle Edit integra Whisper e Ollama. 👇
https://gomoot.com/subtitle-edit-whisper-sottotitoli-automatici-per-qualsiasi-video/ -
That’s Whisper. She fights for the users.
-
That’s Whisper. She fights for the users.
-
⚡ Dettatura ovunque sul desktop, offline, senza account e senza canone mensile.
Handy ci riesce con il modello AI che scegli tu. 👇
https://gomoot.com/handy-detta-al-pc-in-qualsiasi-app-senza-cloud-e-senza-abbonamenti/ -
⚡ Dettatura ovunque sul desktop, offline, senza account e senza canone mensile.
Handy ci riesce con il modello AI che scegli tu. 👇
https://gomoot.com/handy-detta-al-pc-in-qualsiasi-app-senza-cloud-e-senza-abbonamenti/ -
Как быстро собрать полезный инструмент: транскрибатор видео с помощью вайб‑кодинга
После рабочих встреч часто остаются записи. В моем случае это записи Яндекс Телемоста. Запись есть, но пользоваться ей не всегда удобно. Если нужно что‑то вспомнить, приходится открывать видео, перематывать, искать нужный кусок, переслушивать. Если нужно передать встречу другому человеку, одного видео обычно мало. У меня часто бывает такой сценарий: нужно передать программисту контекст по задаче. Можно скинуть запись встречи и написать: «посмотри, пожалуйста». Но человеку придется самому смотреть видео, искать важные места, понимать, где обсуждение, где решение, где задача. Мне хотелось получить более удобный вариант: вместе с записью отправлять текстовый итог встречи. Идея была простая: загрузить видео встречи и получить транскрипт, протокол и DOCX, который можно отправить дальше. Первую рабочую версию получилось собрать через Codex примерно за 30 минут.
https://habr.com/ru/articles/1055984/
#транскрибация #Whisper #fasterwhisper #ffmpeg #Python #GPT #Яндекс_Телемост #локальное_приложение #DOCX #OpenAI
-
Tester Nasjonalbibliotekets Whisper språkmodell til automatisk teksting i PeerTube. Det fungerer bedre enn standardmodellen til Whisper... helt til det ikke gjør det.
-
Tester Nasjonalbibliotekets Whisper språkmodell til automatisk teksting i PeerTube. Det fungerer bedre enn standardmodellen til Whisper... helt til det ikke gjør det.
-
Почему сейчас писать это тупо?
А точно ли в наши дни обязательно уметь писать? Какую пользу это несет? Сократ считал, что запись ухудшает память, знаем мы это, впрочем, лишь потому что его ученик Платон его записал. Оставим этот вопрос ученым, мы практики - если что-то можно автоматизировать, значит нужно! Сначала написал свой сервер Whisper для транскрибаци, по стандарту OpenAI v1 transcriptions API , умеет streaming, таймкоды, авто выбор модели, очередь, и lazy+ttl. Таких куча: 1 , 2 . Моя клиентская lib-а дополнительно с авто fallback на локальную транскрипцию(лишние зависимости, + надежности). Потом туда добавился CUDA-брокер . Потому что PC много проектов на gpu, распознавание речи и распознавание картинок, теперь они могут договариваться между собой — кому сейчас грузиться, кому подождать, у кого выше приоритет.
-
If any of my followers knows anyone on the #OpenAI #Whisper team, can you please have them look at an issue I just opened today? I found an issue with #MPS on Whisper with #Apple Silicon and created a one-line fix for it which I reported in a "Discussion". I'd like the rest of the users to be able to benefit from it too...but the #GitHub doesn't seem very highly trafficked lately. So any help to get eyes on it would be appreciated.
Thanks!
Jann
-
If any of my followers knows anyone on the #OpenAI #Whisper team, can you please have them look at an issue I just opened today? I found an issue with #MPS on Whisper with #Apple Silicon and created a one-line fix for it which I reported in a "Discussion". I'd like the rest of the users to be able to benefit from it too...but the #GitHub doesn't seem very highly trafficked lately. So any help to get eyes on it would be appreciated.
Thanks!
Jann
-
Whisper is unreasonably beautiful.
-
Whisper is unreasonably beautiful.
-
‘Monster Maker’ Doc To Profile Legendary Stan Winston, Special Effects Master Behind ‘Alien,’ ‘Predator,’ ‘Terminator,’ ‘Jurassic Park’ & More
#Documentary #News #BarneyDouglas #Dogwoof #HavilandDigital #MonsterMaker #StanWinston #StrangeBird #TheKennedyMarshallCompany #Whisper -
Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.
Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:
- не успеваю записывать и одновременно воспринимать полноценно то, что на экране
- потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM
А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.
Теперь у меня есть скриптик, который делает слудующее:
- получает от меня имя файла с записью занятия (которую я делаю в OBS)
- с
ffmpegвынимает аудио - с
ffmpegделает скриншоты картинки раз в 15 секунд - скармливает аудио занятия
whisper.cpp:main-vulkan(предварительно скачав с HuggingFace нужную модельку если её нет) - упаковывает субтитры, аудио и скриншоты в тарбол
- я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
- Markdown (Obsidian)
- EPUB (e-Ink читалка)
- PDF (десктоп)
Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.
P.S. В появлении этого поста вините @rayslava
#LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language
-
>ping<
>ping<
SCANNING FOR LYNX POINT STUPIDHEAD
>ping<
>ping< -
Heute gelernt: Niederbayerisch ist eine natürliche Firewall gegen KI. Hab eine Mixl-Rede durch die Transkriptions-KI gejagt – Ergebnis: „Schmerzensbrei", „die Leiterorganen sind bei mir", „krachtig spielen". Wenn nicht mal die Maschine mitkommt… 🤷