home.social

#whisper — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #whisper, aggregated by home.social.

  1. Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText linuxeasy.org/openwhispr-porta

  2. Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText linuxeasy.org/openwhispr-porta

  3. Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText linuxeasy.org/openwhispr-porta

  4. Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText linuxeasy.org/openwhispr-porta

  5. Trasforma la voce in testo, note e comandi direttamente dal desktop con OpenWhispr, un progetto open source attento alla privacy e disponibile anche per Linux. #Linux #OpenSource #OpenWhispr #AI #Whisper #VoiceToText linuxeasy.org/openwhispr-porta

  6. Étude du consortium ARIANE sur la transcription via IA générative avec le LLM Whisper : « Whisper : transcription automatique de sources sonores » hal.science/hal-05706209 #Whisper #LLM #ESR

  7. Étude du consortium ARIANE sur la transcription via IA générative avec le LLM Whisper : « Whisper : transcription automatique de sources sonores » hal.science/hal-05706209 #Whisper #LLM #ESR

  8. Étude du consortium ARIANE sur la transcription via IA générative avec le LLM Whisper : « Whisper : transcription automatique de sources sonores » hal.science/hal-05706209 #Whisper #LLM #ESR

  9. Étude du consortium ARIANE sur la transcription via IA générative avec le LLM Whisper : « Whisper : transcription automatique de sources sonores » hal.science/hal-05706209 #Whisper #LLM #ESR

  10. Étude du consortium ARIANE sur la transcription via IA générative avec le LLM Whisper : « Whisper : transcription automatique de sources sonores » hal.science/hal-05706209 #Whisper #LLM #ESR

  11. LLM 改变了很多,比如 Agent 概念上半年爆火后,大厂们都争前恐后推出 CLI 产品,知乎,微信,网易云等等,这在几年前是完全无法想象的,那时想让 Linux 用上微信都很难,需要折腾一大堆 Wine 的组件,有时还会面临封号的风险。反观现在拥抱全平台的吃相,让人忍俊不禁。

    但真正改变的,其实很有限,因为爆火的原因不是厂商良心,拥抱开源,而是发现这个市场有的赚,本质还是逐利的,Agent 让厂商发现开放生态有的赚。工具功能很全,很方便,但我却更加担心了,工具会一直免费下去吗?我猜不会,等到官方的生态建立起来,我想就是回血的时候了。

    值得高兴的是,这些工具还很烂,如果真的要用,还太早,比如 npmjs.com/package/@music163/nc

    我无法相信官方的 TUI 居然吹能播放一半不到的歌,真是充满恶意的设计

    #whisper #netease #cli #llm

  12. LLM 改变了很多,比如 Agent 概念上半年爆火后,大厂们都争前恐后推出 CLI 产品,知乎,微信,网易云等等,这在几年前是完全无法想象的,那时想让 Linux 用上微信都很难,需要折腾一大堆 Wine 的组件,有时还会面临封号的风险。反观现在拥抱全平台的吃相,让人忍俊不禁。

    但真正改变的,其实很有限,因为爆火的原因不是厂商良心,拥抱开源,而是发现这个市场有的赚,本质还是逐利的,Agent 让厂商发现开放生态有的赚。工具功能很全,很方便,但我却更加担心了,工具会一直免费下去吗?我猜不会,等到官方的生态建立起来,我想就是回血的时候了。

    值得高兴的是,这些工具还很烂,如果真的要用,还太早,比如 npmjs.com/package/@music163/nc

    我无法相信官方的 TUI 居然吹能播放一半不到的歌,真是充满恶意的设计

    #whisper #netease #cli #llm

  13. LLM 改变了很多,比如 Agent 概念上半年爆火后,大厂们都争前恐后推出 CLI 产品,知乎,微信,网易云等等,这在几年前是完全无法想象的,那时想让 Linux 用上微信都很难,需要折腾一大堆 Wine 的组件,有时还会面临封号的风险。反观现在拥抱全平台的吃相,让人忍俊不禁。

    但真正改变的,其实很有限,因为爆火的原因不是厂商良心,拥抱开源,而是发现这个市场有的赚,本质还是逐利的,Agent 让厂商发现开放生态有的赚。工具功能很全,很方便,但我却更加担心了,工具会一直免费下去吗?我猜不会,等到官方的生态建立起来,我想就是回血的时候了。

    值得高兴的是,这些工具还很烂,如果真的要用,还太早,比如 npmjs.com/package/@music163/nc

    我无法相信官方的 TUI 居然吹能播放一半不到的歌,真是充满恶意的设计

    #whisper #netease #cli #llm

  14. LLM 改变了很多,比如 Agent 概念上半年爆火后,大厂们都争前恐后推出 CLI 产品,知乎,微信,网易云等等,这在几年前是完全无法想象的,那时想让 Linux 用上微信都很难,需要折腾一大堆 Wine 的组件,有时还会面临封号的风险。反观现在拥抱全平台的吃相,让人忍俊不禁。

    但真正改变的,其实很有限,因为爆火的原因不是厂商良心,拥抱开源,而是发现这个市场有的赚,本质还是逐利的,Agent 让厂商发现开放生态有的赚。工具功能很全,很方便,但我却更加担心了,工具会一直免费下去吗?我猜不会,等到官方的生态建立起来,我想就是回血的时候了。

    值得高兴的是,这些工具还很烂,如果真的要用,还太早,比如 npmjs.com/package/@music163/nc

    我无法相信官方的 TUI 居然吹能播放一半不到的歌,真是充满恶意的设计

    #whisper #netease #cli #llm

  15. LLM 改变了很多,比如 Agent 概念上半年爆火后,大厂们都争前恐后推出 CLI 产品,知乎,微信,网易云等等,这在几年前是完全无法想象的,那时想让 Linux 用上微信都很难,需要折腾一大堆 Wine 的组件,有时还会面临封号的风险。反观现在拥抱全平台的吃相,让人忍俊不禁。

    但真正改变的,其实很有限,因为爆火的原因不是厂商良心,拥抱开源,而是发现这个市场有的赚,本质还是逐利的,Agent 让厂商发现开放生态有的赚。工具功能很全,很方便,但我却更加担心了,工具会一直免费下去吗?我猜不会,等到官方的生态建立起来,我想就是回血的时候了。

    值得高兴的是,这些工具还很烂,如果真的要用,还太早,比如 npmjs.com/package/@music163/nc

    我无法相信官方的 TUI 居然吹能播放一半不到的歌,真是充满恶意的设计

    #whisper #netease #cli #llm

  16. 56 минут созвона → текст за 5 минут на M4 без OBS и облака

    У меня от трёх до пяти созвонов в день, почти все в браузере: Meet, Яндекс Телемост, ktalk, реже всего Zoom. Детали встреч мне нужны в тексте, иначе договорённости расползаются. Писал я звонки через OBS с захватом экрана, и на самих звонках началось веселье: звук временами жёстко квакал, всё чуть-чуть подвисало. Причину до конца не выяснял, моё предположение - процессор зажирался захватом и перебивал сам разговор; ktalk и браузер тут ни при чём. А экран, как потом дошло, мне вообще был не нужен. Дальше вторая серия. Расшифровку я гонял своими Python-скриптами: конвертация → транскрибация → диаризация (разметка, кто когда говорил). На встрече с пятью участниками диаризация расставляла голоса крайне плохо, половину фраз всё равно восстанавливал по памяти. Пошёл искать вариант, чтобы запись не мешала звонку, результат был приличный и всё крутилось локально: не хотелось ни отдавать записи в облако, ни платить подписку за минуты. Нашёл платный Audio Hijack , он подкупил лёгкостью и простотой настройки. Потом узнал, что на M-чипе быстрее всего у меня отрабатывает mlx-whisper на MLX : веса large-v3-turbo с Hugging Face, инференс на GPU Mac. Это архитектура Whisper, но рантайм — пакет mlx-whisper и бинарь mlx_whisper , не pip install openai-whisper и не репозиторий openai/whisper . Так собрался стек: Hijack пишет один mp3, mlx_whisper делает VTT, pyannote раскладывает по SPEAKER_XX. На 56-минутном звонке транскрипция заняла около пяти минут. Платный только Hijack — разовая лицензия, без подписки (цену смотрите на сайте Rogue Amoeba). Скрипты выложил в mac-call-transcribe под MIT. Ниже сборка, замеры с двух реальных звонков и грабли; повторяется на любом Mac с M-чипом.

    habr.com/ru/articles/1062068/

    #whisper #mlx #pyannote #speaker_diarization #расшифровка_звонков #python #apple_silicon #транскрибация_звонков

  17. La dettatura vocale arriva su Linux con un progetto open source che punta tutto su privacy, velocità e semplicità d'uso. Scopri come funziona Vocalinux e perché potrebbe diventare uno strumento indispensabile. #Linux #OpenSource #VoiceTyping #Privacy #Wayland #Whisper

    linuxeasy.org/vocalinux-porta-

  18. Как я решил проблему русской диктовки для ИИ

    По мере погружения в ИИ и вайб‑кодинг, я столкнулся с одним неудобным моментом — отсутствием возможности диктовать на русском языке в некоторых программах. И если OpenAI в своем приложении позаботились об этом, то в Anthropic такой возможности на тот момент просто не оказалось. А мне уже так понравилось, откинувшись на спинку кресла с чашкой чая, надиктовывать промпты без клавиатуры. Но я быстро нашел выход, хоть и костыльный — просто диктовать свой текст в окошке GPT, потом копировать его и вставлять в Claude. Вроде несложно, но и удобным этот метод я бы не назвал. И я задумался, как этот процесс оптимизировать. И какая же идея могла прийти в голову в 3 часа ночи человеку, который полжизни занимается программированием? Ну конечно же — разработать свое приложение. Посоветовавшись с Claude и GPT, я набросал небольшой план и приступил к разработке. Поскольку я работаю на macOS, то для начала не стал заморачиваться с мультиплатформенностью и решил делать все на Swift.

    habr.com/ru/articles/1039248/

    #AI #OpenAI #Claude #Whisper #speechtotext #диктовка #voice_input #Apple_Silicon

  19. Топ локальных нейросетей ︎◍ 2026: подборка ИИ для запуска из дома

    Сознаюсь: когда я впервые попытался запустить большую языковую модель на своём ноутбуке, всё закончилось вертушкой кулера, жутким лагом и системным сообщением “Недостаточно памяти”. Казалось, что домашний ИИ – удел владельцев космических станций с жидким азотом. Но прошло совсем немного времени, и ситуация изменилась до неузнаваемости. Теперь достаточно обычной RTX 3060 и получаса свободного вечера, чтобы завести себе персонального ассистента, который работает на даче без интернета и умеет шутить (или хотя бы пытается). Я расскажу обо всём по порядку – без воды и фанатизма. Что вообще запускать, на чём запускать, какие подводные камни ждут и почему “самая новая модель” дома – далеко не всегда лучший выбор. Поехали! Готовьте отвёртку и VRAM – мы начинаем!

    habr.com/ru/companies/bothub/a

    #gemma_4 #qwen36 #qwen35 #gptoss30b #mistral_7b #phi4 #deepseek_v32 #whisper #nemotron_cascade_2

  20. 🗣️🎤📝 :linux: Speech to Text and Text to Speech on GNU/Linux :disability_flag: 📝🔊💻

    Why This Matters to Me (and Maybe You Too)

    If you’re anything like me—a Linux user who counts on voice typing and TTS because of visual impairment—you know that accessibility is not a luxury, it’s a necessity. Speaking from experience as someone who depends on voice typing (and TTS) , the quest for a seamless, local, FLOSS speech-to-text (STT) setup on Linux can be frustrating.
    Here’s how you can succeed with modern tools using Linux. FLOSS means freedom and privacy; working locally means real control.
    Let’s dive in! I’ll tell you what I’ve learned and what I use—and hope you’ll share your favorite tools or tips!

    System-Wide Voice Keyboard: Speak Directly in Any App

    Want to speak and have your words typed wherever your cursor is—be it a terminal, browser, chat, or IDE? Here’s what actually works and how it feels day-to-day:

    - Speak to AI (Offline, Whisper-based, global hotkeys)
    This tool is my current go-to. It uses Whisper locally, lets you use global hotkeys (configurable) to type into any focused window, and doesn’t need internet. Runs smoothly on X11 and Wayland; just takes a bit of setup (AppImage available!).
    GitHub Repo github.com/AshBuk/speak-to-ai) | Dev.to Post dev.to/ashbuk/i-built-an-offli)

    - DIY: RealtimeSTT + PyAutoGUI
    For the true tinkerers, RealtimeSTT plus a Python script lets you simulate keystrokes. You control every step, can lower latency with your tweaks, but you’ll need to be comfortable with scripting.
    RealtimeSTT Guide github.com/KoljaB/RealtimeSTT#)

    - Handy (Free/Libre, offline, Whisper-based, acts as a keyboard)
    I’ve read lots of positive feedback on Handy—even though I haven’t tried it myself. The workflow is simple: press a hotkey, speak, and Handy pastes your text in the active app. It’s fully offline, works on X11 and Wayland, and gets strong accuracy thanks to Whisper.
    Heads up: Handy lets you pick your own shortcut key, but it actually overrides the keyboard shortcut for start/stop recording. That means it can clash with other tools that depend on major shortcut combos—including Orca’s custom keybindings if you use a screen reader. If your workflow relies on certain shortcuts, this might need adjustment or careful planning before you commit.
    GitHub Repo github.com/cjpais/Handy) | Demo handy.computer)

    Real-Time Transcription in a Window (Copy/Paste Workflow)

    If you’re okay with speaking into a dedicated app, then copying, these options offer great GUIs and power features:

    - Speech Note by @mkiol mastodon.social/@mkiol
    FLOSS, offline, multi-language GUI app—perfect for quick notes and batch transcription. Not a system-wide keyboard, but super easy to use and works on both desktops and Linux phones.
    Flathub flathub.org/apps/net.mkiol.Spe | LinuxPhoneApps linuxphoneapps.org/apps/net.mk)

    - WhisperLive (by Collabora)
    Real-time transcription in a terminal or window—great for meetings, lectures, and captions. Manual copy/paste required to get the text to other apps.
    GitHub Repo github.com/collabora/WhisperLi)

    More Tools for Tinkerers

    If you like building your own or want extra control, check out:
    - Vosk: Lightweight, lots of language support. GitHub alphacephei.com/vosk/)
    - Kaldi: Powerful, best for custom setups. Website kaldi-asr.org/)
    - Simon: Voice control automation. Website simon-listens.org/)
    - voice2json: Phrase-level and command recognition. GitHub github.com/synesthesiam/voice2)

    Pro Tips

    - Desktop Environment: X11 vs. Wayland affects how keyboard hooks and app focus actually operate.
    - Ready-Made vs. DIY: If you want plug-and-play, try Speech Note or Handy first. Into automation or customization? RealtimeSTT is perfect.
    - Follow the Community: @thorstenvoice offers tons of open-source voice tech insights.

    Screen Reader Integration

    Looking for robust screen reader support? Linux has you covered:

    - Orca (GNOME/MATE): The most customizable GUI screen reader out there. The default voice (eSpeak) is robotic, but you can swap it for something better and fine-tune verbosity so it reads only what matters.
    - Speakup: Console-based, ideal for terminal.
    - Emacspeak: The solution for Emacs fans.

    💡 Orca is part of my daily toolkit. It took time to get the settings just right (especially verbosity!) but it’s absolutely worth it. If you use a screen reader—what setup makes it bearable or even enjoyable for you?

    Final Thoughts

    If you’re starting from scratch, try Handy for direct typing (just watch those shortcuts if you use a screen reader!) or Speech Note for GUI-based transcription. Both are privacy-friendly, local, and accessible—ideal for everyday Linux use.

    Is there a FLOSS gem missing here?
    Sharing what works (and what doesn’t!) helps the entire community.

    Resources:
    Speech Note on Flathub flathub.org/apps/net.mkiol.Spe
    Handy GitHub github.com/cjpais/Handy
    Speak to AI Guide dev.to/ashbuk/i-built-an-offli
    RealtimeSTT github.com/KoljaB/RealtimeSTT

    #Linux #SpeechToText #FLOSS #Accessibility #VoiceKeyboard #ScreenReader #Whisper #Handy #SpeechNote #OpenSource #Community #voicetyping #LocalSTT #TTStools #SpeechRecognition #A11y #Linuxtools #Voicekeyboard #Whisper #Handy #speech-to-text #SpeechNote #review #ScreenReaders #ORCA #FOSS