home.social

#pyannote — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #pyannote, aggregated by home.social.

fetched live
  1. 56 минут созвона → текст за 5 минут на M4 без OBS и облака

    У меня от трёх до пяти созвонов в день, почти все в браузере: Meet, Яндекс Телемост, ktalk, реже всего Zoom. Детали встреч мне нужны в тексте, иначе договорённости расползаются. Писал я звонки через OBS с захватом экрана, и на самих звонках началось веселье: звук временами жёстко квакал, всё чуть-чуть подвисало. Причину до конца не выяснял, моё предположение - процессор зажирался захватом и перебивал сам разговор; ktalk и браузер тут ни при чём. А экран, как потом дошло, мне вообще был не нужен. Дальше вторая серия. Расшифровку я гонял своими Python-скриптами: конвертация → транскрибация → диаризация (разметка, кто когда говорил). На встрече с пятью участниками диаризация расставляла голоса крайне плохо, половину фраз всё равно восстанавливал по памяти. Пошёл искать вариант, чтобы запись не мешала звонку, результат был приличный и всё крутилось локально: не хотелось ни отдавать записи в облако, ни платить подписку за минуты. Нашёл платный Audio Hijack , он подкупил лёгкостью и простотой настройки. Потом узнал, что на M-чипе быстрее всего у меня отрабатывает mlx-whisper на MLX : веса large-v3-turbo с Hugging Face, инференс на GPU Mac. Это архитектура Whisper, но рантайм — пакет mlx-whisper и бинарь mlx_whisper , не pip install openai-whisper и не репозиторий openai/whisper . Так собрался стек: Hijack пишет один mp3, mlx_whisper делает VTT, pyannote раскладывает по SPEAKER_XX. На 56-минутном звонке транскрипция заняла около пяти минут. Платный только Hijack — разовая лицензия, без подписки (цену смотрите на сайте Rogue Amoeba). Скрипты выложил в mac-call-transcribe под MIT. Ниже сборка, замеры с двух реальных звонков и грабли; повторяется на любом Mac с M-чипом.

    habr.com/ru/articles/1062068/

    #whisper #mlx #pyannote #speaker_diarization #расшифровка_звонков #python #apple_silicon #транскрибация_звонков

  2. Телефонный звонок → структурированный JSON: строим STT + LLM пайплайн на Python

    Каждый день в российском бизнесе происходят миллионы телефонных звонков. Колл-центры, клиники, юридические конторы, отделы продаж - везде, где есть телефон, есть поток неструктурированных данных, который никто не обрабатывает. Менеджер повесил трубку, записал в CRM “клиент интересовался” - и 80% информации из разговора потерялось.

    habr.com/ru/articles/1020632/

    #stt #speechtotext #llm #NLP #whisper #pyannote #диаризация #python #prompt_engineering

  3. 🚀 Whisper & Pyannote: The Ultimate Combo for Speech Transcription! 🎙️

    Combining Whisper (ASR) and Pyannote (diarization) enables accurate and speaker-segmented transcriptions, even locally. 🔥

    💡 Applications: meetings, podcasts, sentiment analysis, subtitles...

    📖 Read the article: scalastic.io/whisper-pyannote-

    Have you tried these tools? Share your thoughts! 👇

    #AI #ASR #Whisper #Pyannote #Transcription #Diarization

  4. 🚀 Whisper & Pyannote : la combinaison ultime pour la transcription vocale ! 🎙️

    Associer Whisper (ASR) et Pyannote (diarisation) permet d’obtenir des transcriptions précises et segmentées par interlocuteur, même en local. 🔥

    💡 Applications : réunions, podcasts, analyse des sentiments, sous-titres...

    📖 Découvrez l’article : scalastic.io/whisper-pyannote-

    Avez-vous testé ces outils ? Partagez votre avis ! 👇

    #AI #ASR #Whisper #Pyannote #Transcription #Diarization