home.social

#whisper — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #whisper, aggregated by home.social.

  1. Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText linuxeasy.org/openwhispr-porta

  2. Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText linuxeasy.org/openwhispr-porta

  3. Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText linuxeasy.org/openwhispr-porta

  4. Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText linuxeasy.org/openwhispr-porta

  5. Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText linuxeasy.org/openwhispr-porta

  6. 56 минут созвона → текст за 5 минут на M4 без OBS и облака

    У меня от трёх до пяти созвонов в день, почти все в браузере: Meet, Яндекс Телемост, ktalk, реже всего Zoom. Детали встреч мне нужны в тексте, иначе договорённости расползаются. Писал я звонки через OBS с захватом экрана, и на самих звонках началось веселье: звук временами жёстко квакал, всё чуть-чуть подвисало. Причину до конца не выяснял, моё предположение - процессор зажирался захватом и перебивал сам разговор; ktalk и браузер тут ни при чём. А экран, как потом дошло, мне вообще был не нужен. Дальше вторая серия. Расшифровку я гонял своими Python-скриптами: конвертация → транскрибация → диаризация (разметка, кто когда говорил). На встрече с пятью участниками диаризация расставляла голоса крайне плохо, половину фраз всё равно восстанавливал по памяти. Пошёл искать вариант, чтобы запись не мешала звонку, результат был приличный и всё крутилось локально: не хотелось ни отдавать записи в облако, ни платить подписку за минуты. Нашёл платный Audio Hijack , он подкупил лёгкостью и простотой настройки. Потом узнал, что на M-чипе быстрее всего у меня отрабатывает mlx-whisper на MLX : веса large-v3-turbo с Hugging Face, инференс на GPU Mac. Это архитектура Whisper, но рантайм — пакет mlx-whisper и бинарь mlx_whisper , не pip install openai-whisper и не репозиторий openai/whisper . Так собрался стек: Hijack пишет один mp3, mlx_whisper делает VTT, pyannote раскладывает по SPEAKER_XX. На 56-минутном звонке транскрипция заняла около пяти минут. Платный только Hijack — разовая лицензия, без подписки (цену смотрите на сайте Rogue Amoeba). Скрипты выложил в mac-call-transcribe под MIT. Ниже сборка, замеры с двух реальных звонков и грабли; повторяется на любом Mac с M-чипом.

    habr.com/ru/articles/1062068/

    #whisper #mlx #pyannote #speaker_diarization #расшифровка_звонков #python #apple_silicon #транскрибация_звонков

  7. Fairly valid use of #AI, near realtime voice to text #estonian -> English translation tool. I have spent about 2 hours gluing together OpenAI #whisper and Google Gemma 4 e2b and WebRTC VAD (voice activity detection) in Python. Both whisper and Gemma are running on GPU together utilizing about 50% of my Radeon.

  8. Как я решил проблему русской диктовки для ИИ

    По мере погружения в ИИ и вайб‑кодинг, я столкнулся с одним неудобным моментом — отсутствием возможности диктовать на русском языке в некоторых программах. И если OpenAI в своем приложении позаботились об этом, то в Anthropic такой возможности на тот момент просто не оказалось. А мне уже так понравилось, откинувшись на спинку кресла с чашкой чая, надиктовывать промпты без клавиатуры. Но я быстро нашел выход, хоть и костыльный — просто диктовать свой текст в окошке GPT, потом копировать его и вставлять в Claude. Вроде несложно, но и удобным этот метод я бы не назвал. И я задумался, как этот процесс оптимизировать. И какая же идея могла прийти в голову в 3 часа ночи человеку, который полжизни занимается программированием? Ну конечно же — разработать свое приложение. Посоветовавшись с Claude и GPT, я набросал небольшой план и приступил к разработке. Поскольку я работаю на macOS, то для начала не стал заморачиваться с мультиплатформенностью и решил делать все на Swift.

    habr.com/ru/articles/1039248/

    #AI #OpenAI #Claude #Whisper #speechtotext #диктовка #voice_input #Apple_Silicon

  9. AI для умного дома: что уже работает сегодня (часть 1)

    В статье — не просто список инструментов, а как они сочетаются , какие подводные камни ждут при развёртывании, какие цифры можно ожидать по производительности и как обойти ограничения Llama 8B без облачных кредитов.

    habr.com/ru/articles/1014246/

    #умный_дом #Home_Assistant #Ollama #OpenClaw #MCP #LLM #локальный_AI #Whisper #n8n #голосовое_управление

  10. Free tools for creativity!

    , , , , by Meta, , & more: These , -powered tools make image editing, audio work, transcription, and Large Language Models (#LLMs) exploration fun and easy!

    Learn more about these top picks by mentor @morrolinux: lpi.org/zhya

    @LPI , , , , , @openai

  11. #DailyBloggingChallenge (365/365)

    The only caveat of the #Whisper project is that it only works on 16-bit #WAV files.

    There is a #FFMPEG script on how to do it via the #terminal

    ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav

  12. #DailyBloggingChallenge (363/365)

    Instead opted in to using #Whisper which also works with #KdenLive.

    Although Whisper is originally written in #Python there is a #CPP project that makes transcribing very fast. It took less than 2min to transcribe the 26 min audio clip.

    github.com/ggerganov/whisper.c