home.social

#speechtotext — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #speechtotext, aggregated by home.social.

fetched live
  1. Написал локального ИИ-ассистента для зумов: диаризация, граф знаний и ноль облаков

    Собрал ассистента встреч, который работает целиком на моём маке: локальный STT, живая диаризация голосов, мгновенные ответы на вопросы собеседника и самообновляемый граф знаний в Obsidian. Внутри — грабли: ловушка обращений при расстановке имён, 23 «голоса» из-за осколков кластеризации, num_ctx и бюджет RAM в Ollama. Код открыт, Apache 2.0.

    habr.com/ru/articles/1061864/

    #локальные_llm #ollama #диаризация #speechtotext #граф_знаний #ассистент_встреч #zoom

  2. @JoAnn

    #debian #speechtotext #speech2text #dictée

    je viens d'essayer le premier (SpeechNote) de la liste et il fonctionne très correctement.

    Il y a des options que je n'ai pas cochées, mais c'est tout bon.

  3. Vocalinux is an open-source voice dictation app for Linux that works entirely offline.

    It supports Whisper.cpp, OpenAI Whisper, and VOSK, letting you dictate into almost any application without sending your audio to the cloud. It also includes GPU acceleration, customizable hotkeys, and Wayland/X11 support.

    More details: digitalescapetools.com/tools/t

    #OpenSource #Linux #Privacy #SpeechToText #Whisper #Productivity

  4. Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS

    Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.

    habr.com/ru/articles/1054566/

    #iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS

  5. Voicebox is a free and open-source AI voice studio that runs entirely on your computer.

    It lets you clone voices, generate speech, transcribe audio with Whisper, and use voice dictation without sending recordings to the cloud. It also supports multiple TTS engines and MCP integration for AI assistants.

    More details: digitalescapetools.com/tools/t

    #OpenSource #AI #Privacy #SelfHosted #Linux #Windows #macOS #SpeechToText #TextToSpeech

  6. If you spend hours writing emails, documents, code, or notes, typing everything can quickly become exhausting. FluidVoice makes dictation feel much more natural by turning your voice into text with fast, accurate speech recognition and optional on-device AI enhancements.

    Its built with a local-first approach. Most speech models run directly on your Mac

    #macos #AI #opensource #speechtotext #software #developers

    firethering.com/fluidvoice-ai-

  7. A really nice tool—especially if you like to have English and Chinese voice transcription. I need to wait for the downloads to finish to get a real impression, but the first impression is good. #speechRecognition #STT #SpeechToText #voicetyping

    GitHub - wealotwang/voice-inpu...

    RE: https://bsky.app/profile/did:plc:daexpe52ebb4bwh3ybzyvmkz/post/3mofaimbuqv2k


    RE: https://bsky.app/profile/did:plc:daexpe52ebb4bwh3ybzyvmkz/post/3mofaimbuqv2k
  8. On the nights I can't get to sleep it is usually because a thought gets in my head and won't shut up.
    Tonight I turned my browser back on to check the expected future cataract operation.

    Having been told within 18 months, I was thinking about plans to cope for next year. But having moved to noai duckduckgo I just found some real research based on several studies.
    It could be 3 months, and about 50% get cataracts that need surgery with 6 months.
    I need to go from thinking about planning to doing it, especially finding apps that actually work for dictation.

    I've tried a few in the past, but too many are built for American male voices. The last one refused to type 'that' for me even though I have a standard English accent.

    My first experience with voice activated cameras for video meeting was a good example. The camera moved to focus on the last man who spoke and completely ignored every woman in the room. And while Dragon worked OK, they no longer do personal licences.

    #SpeechToText

  9. Как мы превращаем звонок риэлтора в карточку лида за 15 секунд: ИИ-автолид изнутри

    Риэлтор за рулём. Звонит собственник трёшки на Соколе: “Видел ваше объявление, хочу обсудить продажу”. Двадцать минут живого разговора - район, перепланировка, срочность, вилка по цене. Разговор кончается, риэлтор едет на показ, к вечеру у него ещё пять звонков. Утром он помнит, что “был кто-то по трёшке”, но не помнит ни имени, ни цены, ни телефона. Лид потерян не потому, что плохо отработали, а потому, что между звонком и CRM стоит человек с памятью и руками, которые в этот момент держат руль.

    habr.com/ru/articles/1044520/

    #распознавание_речи #deepgram #llm #speechtotext #crm #автоматизация #пайплайн #недвижимость

  10. Ich: "Welches E-Mailprogramm hast Du denn?"

    Schwager: "Fandabööd."

    #Original
    #IT-Profession
    #SpeechToText

  11. Как я решил проблему русской диктовки для ИИ

    По мере погружения в ИИ и вайб‑кодинг, я столкнулся с одним неудобным моментом — отсутствием возможности диктовать на русском языке в некоторых программах. И если OpenAI в своем приложении позаботились об этом, то в Anthropic такой возможности на тот момент просто не оказалось. А мне уже так понравилось, откинувшись на спинку кресла с чашкой чая, надиктовывать промпты без клавиатуры. Но я быстро нашел выход, хоть и костыльный — просто диктовать свой текст в окошке GPT, потом копировать его и вставлять в Claude. Вроде несложно, но и удобным этот метод я бы не назвал. И я задумался, как этот процесс оптимизировать. И какая же идея могла прийти в голову в 3 часа ночи человеку, который полжизни занимается программированием? Ну конечно же — разработать свое приложение. Посоветовавшись с Claude и GPT, я набросал небольшой план и приступил к разработке. Поскольку я работаю на macOS, то для начала не стал заморачиваться с мультиплатформенностью и решил делать все на Swift.

    habr.com/ru/articles/1039248/

    #AI #OpenAI #Claude #Whisper #speechtotext #диктовка #voice_input #Apple_Silicon

  12. Schwerpunkt 1
    Lokales Speech to Text in Linux Mint einrichten: Auf Knopfdruck (beliebiger Shortkey) das Diktat starten & beenden, in jeder beliebigen Anwendung. Keine Cloud, kein mithörender Datenkrake, nur 4-6 GB im RAM.

    Schwerpunkt 2
    Wie mir KI (GPT) geholfen hat, das alles hinzubekommen, inkl. kompletter Projektdokumentation.

    blog.derbrumme.de/lokales-spee

    #Linux #OpenSource #SpeechToText #STT #Vosk #Privacy #SelfHosting #KI #AI #NerdDictation