home.social

#vosk — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #vosk, aggregated by home.social.

  1. Schwerpunkt 1
    Lokales Speech to Text in Linux Mint einrichten: Auf Knopfdruck (beliebiger Shortkey) das Diktat starten & beenden, in jeder beliebigen Anwendung. Keine Cloud, kein mithörender Datenkrake, nur 4-6 GB im RAM.

    Schwerpunkt 2
    Wie mir KI (GPT) geholfen hat, das alles hinzubekommen, inkl. kompletter Projektdokumentation.

    blog.derbrumme.de/lokales-spee

    #Linux #OpenSource #SpeechToText #STT #Vosk #Privacy #SelfHosting #KI #AI #NerdDictation

  2. Schwerpunkt 1
    Lokales Speech to Text in Linux Mint einrichten: Auf Knopfdruck (beliebiger Shortkey) das Diktat starten & beenden, in jeder beliebigen Anwendung. Keine Cloud, kein mithörender Datenkrake, nur 4-6 GB im RAM.

    Schwerpunkt 2
    Wie mir KI (GPT) geholfen hat, das alles hinzubekommen, inkl. kompletter Projektdokumentation.

    blog.derbrumme.de/lokales-spee

    #Linux #OpenSource #SpeechToText #STT #Vosk #Privacy #SelfHosting #KI #AI #NerdDictation

  3. Schwerpunkt 1
    Lokales Speech to Text in Linux Mint einrichten: Auf Knopfdruck (beliebiger Shortkey) das Diktat starten & beenden, in jeder beliebigen Anwendung. Keine Cloud, kein mithörender Datenkrake, nur 4-6 GB im RAM.

    Schwerpunkt 2
    Wie mir KI (GPT) geholfen hat, das alles hinzubekommen, inkl. kompletter Projektdokumentation.

    blog.derbrumme.de/lokales-spee

    #Linux #OpenSource #SpeechToText #STT #Vosk #Privacy #SelfHosting #KI #AI #NerdDictation

  4. Schwerpunkt 1
    Lokales Speech to Text in Linux Mint einrichten: Auf Knopfdruck (beliebiger Shortkey) das Diktat starten & beenden, in jeder beliebigen Anwendung. Keine Cloud, kein mithörender Datenkrake, nur 4-6 GB im RAM.

    Schwerpunkt 2
    Wie mir KI (GPT) geholfen hat, das alles hinzubekommen, inkl. kompletter Projektdokumentation.

    blog.derbrumme.de/lokales-spee

    #Linux #OpenSource #SpeechToText #STT #Vosk #Privacy #SelfHosting #KI #AI #NerdDictation

  5. Schwerpunkt 1
    Lokales Speech to Text in Linux Mint einrichten: Auf Knopfdruck (beliebiger Shortkey) das Diktat starten & beenden, in jeder beliebigen Anwendung. Keine Cloud, kein mithörender Datenkrake, nur 4-6 GB im RAM.

    Schwerpunkt 2
    Wie mir KI (GPT) geholfen hat, das alles hinzubekommen, inkl. kompletter Projektdokumentation.

    blog.derbrumme.de/lokales-spee

    #Linux #OpenSource #SpeechToText #STT #Vosk #Privacy #SelfHosting #KI #AI #NerdDictation

  6. I've been working in #Pitxu these days.

    - I left behind the Infinite-loop approach to a Callback-based one triggered by VAD, reducing about a 40% of the load and imilar battery life improvement.

    - Added a Long Term Memory system, so that I can reduce the amount of context in use per session relaying on an external support, making it faster and cheaper.

    - I've switched #Vosk for #Whisper in the Speech-To-Text step, that brings an incredible improvement on the transcription, which at its turn improves the overall user experience.

    - I switched from Gemini 2.5 Flash to Gemini 3.1 Flash-Lite, which improves quality but also penalizes reaction speed.

    - I delegated some background work into a new Support process that takes it out from the main (user experience) thread.

    - I corrected numerous visualization bugs that improves the user-Pitxu interaction.

    All in all, I just had a long conversation with Pitxu, and has been by far the best demo I ever had in year and a half.

    This is a self-tap-on-the-shoulder post, thank you for your attention 🙂

  7. I've been working in #Pitxu these days.

    - I left behind the Infinite-loop approach to a Callback-based one triggered by VAD, reducing about a 40% of the load and imilar battery life improvement.

    - Added a Long Term Memory system, so that I can reduce the amount of context in use per session relaying on an external support, making it faster and cheaper.

    - I've switched #Vosk for #Whisper in the Speech-To-Text step, that brings an incredible improvement on the transcription, which at its turn improves the overall user experience.

    - I switched from Gemini 2.5 Flash to Gemini 3.1 Flash-Lite, which improves quality but also penalizes reaction speed.

    - I delegated some background work into a new Support process that takes it out from the main (user experience) thread.

    - I corrected numerous visualization bugs that improves the user-Pitxu interaction.

    All in all, I just had a long conversation with Pitxu, and has been by far the best demo I ever had in year and a half.

    This is a self-tap-on-the-shoulder post, thank you for your attention 🙂

  8. I've been working in #Pitxu these days.

    - I left behind the Infinite-loop approach to a Callback-based one triggered by VAD, reducing about a 40% of the load and imilar battery life improvement.

    - Added a Long Term Memory system, so that I can reduce the amount of context in use per session relaying on an external support, making it faster and cheaper.

    - I've switched #Vosk for #Whisper in the Speech-To-Text step, that brings an incredible improvement on the transcription, which at its turn improves the overall user experience.

    - I switched from Gemini 2.5 Flash to Gemini 3.1 Flash-Lite, which improves quality but also penalizes reaction speed.

    - I delegated some background work into a new Support process that takes it out from the main (user experience) thread.

    - I corrected numerous visualization bugs that improves the user-Pitxu interaction.

    All in all, I just had a long conversation with Pitxu, and has been by far the best demo I ever had in year and a half.

    This is a self-tap-on-the-shoulder post, thank you for your attention 🙂

  9. Веселимся со Spring: pet-проект по распознаванию речи

    Не писал на Spring уже лет 8 и решил по фану написать мини пет проект с api и распознаванием речи. Звучит круто, лет 8-10 назад это заняло бы … вечность, тогда и llm, достаточно качественно распознающих русскую речь, да еще на скромном домашнем пк не было. В общем решил в выходной повеселиться. Погнали веселиться

    habr.com/ru/articles/1033338/

    #Java #Spring_Framework #Vosk #speech_recognition #распознавание_речи #REST_API #WAV #Java_Sound_API #pet_project #веселье

  10. Веселимся со Spring: pet-проект по распознаванию речи

    Не писал на Spring уже лет 8 и решил по фану написать мини пет проект с api и распознаванием речи. Звучит круто, лет 8-10 назад это заняло бы … вечность, тогда и llm, достаточно качественно распознающих русскую речь, да еще на скромном домашнем пк не было. В общем решил в выходной повеселиться. Погнали веселиться

    habr.com/ru/articles/1033338/

    #Java #Spring_Framework #Vosk #speech_recognition #распознавание_речи #REST_API #WAV #Java_Sound_API #pet_project #веселье

  11. Веселимся со Spring: pet-проект по распознаванию речи

    Не писал на Spring уже лет 8 и решил по фану написать мини пет проект с api и распознаванием речи. Звучит круто, лет 8-10 назад это заняло бы … вечность, тогда и llm, достаточно качественно распознающих русскую речь, да еще на скромном домашнем пк не было. В общем решил в выходной повеселиться. Погнали веселиться

    habr.com/ru/articles/1033338/

    #Java #Spring_Framework #Vosk #speech_recognition #распознавание_речи #REST_API #WAV #Java_Sound_API #pet_project #веселье

  12. Как устроена транскрипция в Jitsi Meet: Jigasi, SIP и путь до EMR

    Когда мы проектировали пайплайн автоматического заполнения EMR по итогам видеоконсультаций, исходная гипотеза была простой: Jitsi Meet — open source, документация есть, значит, подключить бота и получить транскрипт — задача на пару дней. На практике именно этот слой занял непропорционально много времени относительно своей "очевидности". В этой статье разберу, как устроена транскрипция в Jitsi Meet под капотом, почему это не "просто включить кнопку", с какими конфигурационными нюансами пришлось столкнуться и как в итоге был выстроен пайплайн от видеозвонка до структурированного текста.

    habr.com/ru/articles/1021992/

    #jitsi_meet #jigasi #sip #xmpp #vosk #transcription #emr #fhir #llm #spring_boot

  13. Как устроена транскрипция в Jitsi Meet: Jigasi, SIP и путь до EMR

    Когда мы проектировали пайплайн автоматического заполнения EMR по итогам видеоконсультаций, исходная гипотеза была простой: Jitsi Meet — open source, документация есть, значит, подключить бота и получить транскрипт — задача на пару дней. На практике именно этот слой занял непропорционально много времени относительно своей "очевидности". В этой статье разберу, как устроена транскрипция в Jitsi Meet под капотом, почему это не "просто включить кнопку", с какими конфигурационными нюансами пришлось столкнуться и как в итоге был выстроен пайплайн от видеозвонка до структурированного текста.

    habr.com/ru/articles/1021992/

    #jitsi_meet #jigasi #sip #xmpp #vosk #transcription #emr #fhir #llm #spring_boot

  14. Как устроена транскрипция в Jitsi Meet: Jigasi, SIP и путь до EMR

    Когда мы проектировали пайплайн автоматического заполнения EMR по итогам видеоконсультаций, исходная гипотеза была простой: Jitsi Meet — open source, документация есть, значит, подключить бота и получить транскрипт — задача на пару дней. На практике именно этот слой занял непропорционально много времени относительно своей "очевидности". В этой статье разберу, как устроена транскрипция в Jitsi Meet под капотом, почему это не "просто включить кнопку", с какими конфигурационными нюансами пришлось столкнуться и как в итоге был выстроен пайплайн от видеозвонка до структурированного текста.

    habr.com/ru/articles/1021992/

    #jitsi_meet #jigasi #sip #xmpp #vosk #transcription #emr #fhir #llm #spring_boot

  15. I'm trying to set up voice control for Home Assistant.... in Esperanto! There's only, as far as I know, one local option for an Esperanto STT model able to run on a Raspberry Pi: vosk. And let me tell you, the set up (especially with dockerized home assistant) is, uh, a labor of love, let's say.
    Mi sukcesos !
    #homeAssistant #esperanto #vosk #stt #docker #languages

  16. I'm trying to set up voice control for Home Assistant.... in Esperanto! There's only, as far as I know, one local option for an Esperanto STT model able to run on a Raspberry Pi: vosk. And let me tell you, the set up (especially with dockerized home assistant) is, uh, a labor of love, let's say.
    Mi sukcesos !
    #homeAssistant #esperanto #vosk #stt #docker #languages

  17. Trying the speech to text engine (vosk) in Kdenlive to add subtitles to some videos I'm working on..

    It is mostly right, but sometimes...

    #vosk #kdenlive

  18. Trying the speech to text engine (vosk) in Kdenlive to add subtitles to some videos I'm working on..

    It is mostly right, but sometimes...

    #vosk #kdenlive

  19. Как я снизил WER с 33% до 3.3% для русской речи на CPU: сравнение GigaAM, Whisper и Vosk

    За два месяца я перепробовал три ASR-движка, шесть моделей Whisper, адаптивное чанкование, T5-коррекцию и ансамблевое голосование — и большая часть идей оказалась тупиком. В статье — подробный разбор шести тупиков и одной находки: почему GigaAM от Сбера на обычном CPU показывает 3.3% WER на русском, обходя Whisper large-v3-turbo на RTX 4090 (7.9%) в 2.4 раза. С бенчмарками, кодом и честными оговорками.

    habr.com/ru/articles/1002260/

    #speechtotext #gigaam #whisper #vosk #onnx #распознавание_речи #WER #голосовой_ввод #ASR #python

  20. Как я снизил WER с 33% до 3.3% для русской речи на CPU: сравнение GigaAM, Whisper и Vosk

    За два месяца я перепробовал три ASR-движка, шесть моделей Whisper, адаптивное чанкование, T5-коррекцию и ансамблевое голосование — и большая часть идей оказалась тупиком. В статье — подробный разбор шести тупиков и одной находки: почему GigaAM от Сбера на обычном CPU показывает 3.3% WER на русском, обходя Whisper large-v3-turbo на RTX 4090 (7.9%) в 2.4 раза. С бенчмарками, кодом и честными оговорками.

    habr.com/ru/articles/1002260/

    #speechtotext #gigaam #whisper #vosk #onnx #распознавание_речи #WER #голосовой_ввод #ASR #python

  21. @techsimplified yes, accuracy issues indeed. The current state is good enough for the initial development tests, but the accuracy STT mistakes makes the rest of the pipeline mediocre, no matter how good it is. The input is the key.

    #Vosk has been great but I feel I bump to the limits. I am testing #Whisper and should deliver punctuation and better accuracy, that translates to better interaction with the Chatbot, which brings improved user experience.

    I will take a look at your suggestion, but I do focus on Voice to Text rather than Voice to action, as I aim for conversational experience more than simply executing tasks.

    Thanx!

  22. Marededéusinyó, 4 dies per fer que els ventiladors de la caixa del #Pitxu funcionin a diferents velocitats segons la temperatura, i en silenci.

    He après molt aquesta dies. A nivell més de vida, aquest típic soroll d'aparell elèctric (el típic que ens fa canviar-lo per vell) és degut a que emet una freqüència audible, moltes vegades per error, com era el meu cas

    Primer he conectat els ventiladors. Funcionen al 100%.
    Després el pin de control. Tirar de llibreria GPIO per encendre'ls i apagar-los a certa temperatura.
    Després aprendre d'Hysteresis, que és això de que ventili fins mes abaix del llindar per què no s'estigui encenent i apagant cada 5 segons.
    Després convertir-lo a PWM, que permet variar la velocitat per que faci menys soroll.
    Descobrir com funciona, i que a freqüències baixes el "zumbit" toca els ous. Massa.
    Aprendre que s'ha d'usar una freqüència no-audible (~25kHz), i que la llibreria que uso explota a més de 10kHz, i el soroll no mola.
    Resulta que totes les llibreries Python fan PWM per software, cal fer-ho per hardware.
    La mare que va parir el Kernel de Linux, els overlays, i sa puta mare.

    M'he fet un overlay jo mateix, ja tinc els canals que necessito, i ja puc moure els ventiladors a la freqüència que vull.

    El #Pitxu ja respira en silenci, i prèn grans bocanades d'aire quan ho necessita.

    Entre la millora del micro, el que estic cohent per canviar de #Vosk a #Whisper, i que el hardware aguanti com toca tota la infra, ja començo a tenir ganes de posar-me amb els models altra cop.

  23. Marededéusinyó, 4 dies per fer que els ventiladors de la caixa del #Pitxu funcionin a diferents velocitats segons la temperatura, i en silenci.

    He après molt aquesta dies. A nivell més de vida, aquest típic soroll d'aparell elèctric (el típic que ens fa canviar-lo per vell) és degut a que emet una freqüència audible, moltes vegades per error, com era el meu cas

    Primer he conectat els ventiladors. Funcionen al 100%.
    Després el pin de control. Tirar de llibreria GPIO per encendre'ls i apagar-los a certa temperatura.
    Després aprendre d'Hysteresis, que és això de que ventili fins mes abaix del llindar per què no s'estigui encenent i apagant cada 5 segons.
    Després convertir-lo a PWM, que permet variar la velocitat per que faci menys soroll.
    Descobrir com funciona, i que a freqüències baixes el "zumbit" toca els ous. Massa.
    Aprendre que s'ha d'usar una freqüència no-audible (~25kHz), i que la llibreria que uso explota a més de 10kHz, i el soroll no mola.
    Resulta que totes les llibreries Python fan PWM per software, cal fer-ho per hardware.
    La mare que va parir el Kernel de Linux, els overlays, i sa puta mare.

    M'he fet un overlay jo mateix, ja tinc els canals que necessito, i ja puc moure els ventiladors a la freqüència que vull.

    El #Pitxu ja respira en silenci, i prèn grans bocanades d'aire quan ho necessita.

    Entre la millora del micro, el que estic cohent per canviar de #Vosk a #Whisper, i que el hardware aguanti com toca tota la infra, ja començo a tenir ganes de posar-me amb els models altra cop.

  24. Marededéusinyó, 4 dies per fer que els ventiladors de la caixa del #Pitxu funcionin a diferents velocitats segons la temperatura, i en silenci.

    He après molt aquesta dies. A nivell més de vida, aquest típic soroll d'aparell elèctric (el típic que ens fa canviar-lo per vell) és degut a que emet una freqüència audible, moltes vegades per error, com era el meu cas

    Primer he conectat els ventiladors. Funcionen al 100%.
    Després el pin de control. Tirar de llibreria GPIO per encendre'ls i apagar-los a certa temperatura.
    Després aprendre d'Hysteresis, que és això de que ventili fins mes abaix del llindar per què no s'estigui encenent i apagant cada 5 segons.
    Després convertir-lo a PWM, que permet variar la velocitat per que faci menys soroll.
    Descobrir com funciona, i que a freqüències baixes el "zumbit" toca els ous. Massa.
    Aprendre que s'ha d'usar una freqüència no-audible (~25kHz), i que la llibreria que uso explota a més de 10kHz, i el soroll no mola.
    Resulta que totes les llibreries Python fan PWM per software, cal fer-ho per hardware.
    La mare que va parir el Kernel de Linux, els overlays, i sa puta mare.

    M'he fet un overlay jo mateix, ja tinc els canals que necessito, i ja puc moure els ventiladors a la freqüència que vull.

    El #Pitxu ja respira en silenci, i prèn grans bocanades d'aire quan ho necessita.

    Entre la millora del micro, el que estic cohent per canviar de #Vosk a #Whisper, i que el hardware aguanti com toca tota la infra, ja començo a tenir ganes de posar-me amb els models altra cop.

  25. @techsimplified it is, completely! I find that having my hands free to do actions (and queries) is indeed a game changer. I'm just bumping my head to make the STT to work smooth.

    This project in the pic is a satellite device from my main #Pitxu ongoing built, chaining STT > Chatbot > TTS. As a satellite, it just captures sound, sends it to the "server" and plays the answer. It is a #RaspberryPiZero2 so it can't really hold all the engines needed.

    As per tooling, the whole pack uses:
    - #Vosk (now tinkering with #Whisper)
    - #Gemini (now tinkering with #Ollama offline)
    - #Piper

    But a big chunk of my brain goes to the UX hardware:
    - screen for a more human interaction
    - soundcard I/O (gosh RPi is not yet polished here)
    - GPIO buttons, UPS, PWM fan cases,...

  26. @techsimplified it is, completely! I find that having my hands free to do actions (and queries) is indeed a game changer. I'm just bumping my head to make the STT to work smooth.

    This project in the pic is a satellite device from my main #Pitxu ongoing built, chaining STT > Chatbot > TTS. As a satellite, it just captures sound, sends it to the "server" and plays the answer. It is a #RaspberryPiZero2 so it can't really hold all the engines needed.

    As per tooling, the whole pack uses:
    - #Vosk (now tinkering with #Whisper)
    - #Gemini (now tinkering with #Ollama offline)
    - #Piper

    But a big chunk of my brain goes to the UX hardware:
    - screen for a more human interaction
    - soundcard I/O (gosh RPi is not yet polished here)
    - GPIO buttons, UPS, PWM fan cases,...

  27. @techsimplified it is, completely! I find that having my hands free to do actions (and queries) is indeed a game changer. I'm just bumping my head to make the STT to work smooth.

    This project in the pic is a satellite device from my main #Pitxu ongoing built, chaining STT > Chatbot > TTS. As a satellite, it just captures sound, sends it to the "server" and plays the answer. It is a #RaspberryPiZero2 so it can't really hold all the engines needed.

    As per tooling, the whole pack uses:
    - #Vosk (now tinkering with #Whisper)
    - #Gemini (now tinkering with #Ollama offline)
    - #Piper

    But a big chunk of my brain goes to the UX hardware:
    - screen for a more human interaction
    - soundcard I/O (gosh RPi is not yet polished here)
    - GPIO buttons, UPS, PWM fan cases,...

  28. console.log('Before createModel');
    setTimeout(() => {
    console.error('Vosk init still running after 60s → it is hung');
    }, 60000);
    VM360:1 Before createModel
    882


    fine. we will use a #webworker * today.

    Curse you #Vosk js ! :blobcatnotlike:


    *the last time(s) I had to use a web / #serviceworker were:
    * PMX from zip loader
    * Website from zip loader

    I'm not especially ecstatic that this silly billy here is made so poorly.....

    #repost •acws #acws
  29. console.log('Before createModel');
    setTimeout(() => {
    console.error('Vosk init still running after 60s → it is hung');
    }, 60000);
    VM360:1 Before createModel
    882


    fine. we will use a #webworker * today.

    Curse you #Vosk js ! :blobcatnotlike:


    *the last time(s) I had to use a web / #serviceworker were:
    * PMX from zip loader
    * Website from zip loader

    I'm not especially ecstatic that this silly billy here is made so poorly.....

    #repost •acws #acws
  30. @linuxiac

    > Removing PulseAudio..continuing the shift to PipeWire

    My robot just shuddered in fear of becoming deaf and mute.

    -ng

  31. Голосовой ввод для Windows через Vosk своими руками

    Я пытался найти в Windows похожий встроенный инструмент или готовое решение, но все они либо брали на себя слишком много неактуального для меня функционала, так как задумывались для людей с ограниченными возможностями, либо были платными, либо были недоступны для русского языка. Лучшим выходом из моей ситуации было создать свое минималистичное решение, и вот как это было:

    habr.com/ru/articles/969360/

    #vosk #распознавание_речи #speechtotext #python #голосовые_интерфейсы #winapi

  32. Без интернета и шпионов: как мы собрали локального голосового ассистента

    Облачные ассистенты вроде Алисы , Google Assistant и Siri давно стали привычными. Но у всех у них одни и те же слабые места: зависимость от быстрого интернета и риск утечки данных. И речь не только о персональной информации — дома нередко обсуждают темы, которые можно отнести к коммерческой или даже военной тайне. Неудивительно, что многим некомфортно говорить в присутствии микрофона, который каждое слово отправляет куда-то «в облако» (один из наших заказчиков прямо сказал: «никаких Алис в доме не будет») . На Хабре уже появлялись статьи про попытки заменить Алису на полностью локальные решения. Но почти всегда все сводилось к стандартной схеме: ESP32-микрофон → Home Assistant → intent recognition . Такая связка работает, но до действительно «умного» ассистента ей далеко. Мы пошли дальше и собрали свой голосовой ассистент, о котором расскажем в статье.

    habr.com/ru/companies/wirenboa

    #Wiren_Board #BARY #Алиса #голосовой_ассистент #распознавание_речи #vosk #Piper #Embedding #Wake_Word #умный_дом

  33. Без интернета и шпионов: как мы собрали локального голосового ассистента

    Облачные ассистенты вроде Алисы , Google Assistant и Siri давно стали привычными. Но у всех у них одни и те же слабые места: зависимость от быстрого интернета и риск утечки данных. И речь не только о персональной информации — дома нередко обсуждают темы, которые можно отнести к коммерческой или даже военной тайне. Неудивительно, что многим некомфортно говорить в присутствии микрофона, который каждое слово отправляет куда-то «в облако» (один из наших заказчиков прямо сказал: «никаких Алис в доме не будет») . На Хабре уже появлялись статьи про попытки заменить Алису на полностью локальные решения. Но почти всегда все сводилось к стандартной схеме: ESP32-микрофон → Home Assistant → intent recognition . Такая связка работает, но до действительно «умного» ассистента ей далеко. Мы пошли дальше и собрали свой голосовой ассистент, о котором расскажем в статье.

    habr.com/ru/companies/wirenboa

    #Wiren_Board #BARY #Алиса #голосовой_ассистент #распознавание_речи #vosk #Piper #Embedding #Wake_Word #умный_дом

  34. Scribe: Управляем ПК голосом. Бесплатно, оффлайн и с открытым кодом

    Всем привет! Многие знают, что в Windows есть встроенная функция «Распознавание речи», а в новых версиях — «Голосовой ввод» (Win + H). Это неплохие инструменты, но меня в них всегда смущали несколько моментов: непрозрачность в вопросах приватности, ограниченная кастомизация и глубокая интеграция в систему, которую не всегда удобно настраивать. Хотелось чего-то простого, гарантированно оффлайнового и с открытым исходным кодом, чтобы точно знать, как оно работает. Так родилась идея создать Scribe — полностью автономного и максимально гибкого голосового ассистента. В основе — приватность, автономность и гибкость. Я постарался реализовать функции, которых мне не хватало в других программах.

    habr.com/ru/articles/933968/

    #распознавание_речи #голосовое_управление #vosk #pyqt5 #windows #open_source

  35. Scribe: Управляем ПК голосом. Бесплатно, оффлайн и с открытым кодом

    Всем привет! Многие знают, что в Windows есть встроенная функция «Распознавание речи», а в новых версиях — «Голосовой ввод» (Win + H). Это неплохие инструменты, но меня в них всегда смущали несколько моментов: непрозрачность в вопросах приватности, ограниченная кастомизация и глубокая интеграция в систему, которую не всегда удобно настраивать. Хотелось чего-то простого, гарантированно оффлайнового и с открытым исходным кодом, чтобы точно знать, как оно работает. Так родилась идея создать Scribe — полностью автономного и максимально гибкого голосового ассистента. В основе — приватность, автономность и гибкость. Я постарался реализовать функции, которых мне не хватало в других программах.

    habr.com/ru/articles/933968/

    #распознавание_речи #голосовое_управление #vosk #pyqt5 #windows #open_source

  36. Scribe: Управляем ПК голосом. Бесплатно, оффлайн и с открытым кодом

    Всем привет! Многие знают, что в Windows есть встроенная функция «Распознавание речи», а в новых версиях — «Голосовой ввод» (Win + H). Это неплохие инструменты, но меня в них всегда смущали несколько моментов: непрозрачность в вопросах приватности, ограниченная кастомизация и глубокая интеграция в систему, которую не всегда удобно настраивать. Хотелось чего-то простого, гарантированно оффлайнового и с открытым исходным кодом, чтобы точно знать, как оно работает. Так родилась идея создать Scribe — полностью автономного и максимально гибкого голосового ассистента. В основе — приватность, автономность и гибкость. Я постарался реализовать функции, которых мне не хватало в других программах.

    habr.com/ru/articles/933968/

    #распознавание_речи #голосовое_управление #vosk #pyqt5 #windows #open_source

  37. Добавление слов в языковую модель Vosk

    Краткий гайд как дополнить vosk модель распознавания речи своими словами. Для дальнейшего использования в своих проектах. Все подводные камни в использовании инструмента kaldi в 2025 году Принять испытание

    habr.com/ru/articles/909788/

    #vosk #kaldi #адаптация_модели_vosk #распознавание_речи

  38. Un anaouder mouezh emgefre, graet gant ar meziantoù Anaouder -version 1.0.0, Kaldi ha Vosk

    Fait avec les logiciels open source Anaouder, Kaldi et Vosk.

    Istitlañ un video - Sous-titrer une vidéo en breton.

    Lien : abp.bzh/anaouder/istitlan.php

    #Breton #BZH #VOSK #Kaldi #Bretagne

  39. Un anaouder mouezh emgefre, graet gant ar meziantoù Anaouder -version 1.0.0, Kaldi ha Vosk

    Fait avec les logiciels open source Anaouder, Kaldi et Vosk.

    Istitlañ un video - Sous-titrer une vidéo en breton.

    Lien : abp.bzh/anaouder/istitlan.php

    #Breton #BZH #VOSK #Kaldi #Bretagne

  40. ibus-speech-to-text will provide voice dictation capabilities to any application supporting IBus input methods in #Fedora Linux 42, using VOSK for local voice recognition.

    🔗 fedoraproject.org/wiki/Changes

    #ibus #STT #SpeechToText #VOSK

  41. ibus-speech-to-text will provide voice dictation capabilities to any application supporting IBus input methods in #Fedora Linux 42, using VOSK for local voice recognition.

    🔗 fedoraproject.org/wiki/Changes

    #ibus #STT #SpeechToText #VOSK

  42. Свой Google в локалке. Ищем иголку в стоге сена

    В статье мы разработаем свой собственный Google, который можно будет запустить в любой локальной сети как атакующим, что ищут пароли, так и защитникам, которым небезразлична безопасность их родной локалки. И что примечательно, наш Google будет состоять на 99% из готовых компонентов, практически без дополнительного программирования. А внедрение такой системы потребует ввода всего пары команд.

    habr.com/ru/companies/ussc/art

    #active_directory #google #smb #tesseract #vosk #csv #gnu #ftp #краулинг #dcap

  43. Свой Google в локалке. Ищем иголку в стоге сена

    В статье мы разработаем свой собственный Google, который можно будет запустить в любой локальной сети как атакующим, что ищут пароли, так и защитникам, которым небезразлична безопасность их родной локалки. И что примечательно, наш Google будет состоять на 99% из готовых компонентов, практически без дополнительного программирования. А внедрение такой системы потребует ввода всего пары команд.

    habr.com/ru/companies/ussc/art

    #active_directory #google #smb #tesseract #vosk #csv #gnu #ftp #краулинг #dcap

  44. Свой Google в локалке. Ищем иголку в стоге сена

    В статье мы разработаем свой собственный Google, который можно будет запустить в любой локальной сети как атакующим, что ищут пароли, так и защитникам, которым небезразлична безопасность их родной локалки. И что примечательно, наш Google будет состоять на 99% из готовых компонентов, практически без дополнительного программирования. А внедрение такой системы потребует ввода всего пары команд.

    habr.com/ru/companies/ussc/art

    #active_directory #google #smb #tesseract #vosk #csv #gnu #ftp #краулинг #dcap

  45. qui qui veut de la transcription de vidéo ou de fichier audio faite avec du logiciel libre ?
    Scribe - Ceméa

    scribe.cemea.org

    vous pouvez aussi l'auto héberger, et ça fonctionne sans enrichir de milliardaire facho.

    #vosk #scribe #cemea #logicielLibre

  46. qui qui veut de la transcription de vidéo ou de fichier audio faite avec du logiciel libre ?
    Scribe - Ceméa

    scribe.cemea.org

    vous pouvez aussi l'auto héberger, et ça fonctionne sans enrichir de milliardaire facho.

    #vosk #scribe #cemea #logicielLibre

  47. I am really impressed by both the speed and accuracy of #vosk speech-to-text on a Raspberry Pi 5. This is really usable. #Whisper was either far too inaccurate (at least for german) or unusable slow with larger, more accurate models.

    Did you try any of these? What are your experiences?

    #HomeAssistant