#pyannote — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #pyannote, aggregated by home.social.
-
56 минут созвона → текст за 5 минут на M4 без OBS и облака
У меня от трёх до пяти созвонов в день, почти все в браузере: Meet, Яндекс Телемост, ktalk, реже всего Zoom. Детали встреч мне нужны в тексте, иначе договорённости расползаются. Писал я звонки через OBS с захватом экрана, и на самих звонках началось веселье: звук временами жёстко квакал, всё чуть-чуть подвисало. Причину до конца не выяснял, моё предположение - процессор зажирался захватом и перебивал сам разговор; ktalk и браузер тут ни при чём. А экран, как потом дошло, мне вообще был не нужен. Дальше вторая серия. Расшифровку я гонял своими Python-скриптами: конвертация → транскрибация → диаризация (разметка, кто когда говорил). На встрече с пятью участниками диаризация расставляла голоса крайне плохо, половину фраз всё равно восстанавливал по памяти. Пошёл искать вариант, чтобы запись не мешала звонку, результат был приличный и всё крутилось локально: не хотелось ни отдавать записи в облако, ни платить подписку за минуты. Нашёл платный Audio Hijack , он подкупил лёгкостью и простотой настройки. Потом узнал, что на M-чипе быстрее всего у меня отрабатывает mlx-whisper на MLX : веса large-v3-turbo с Hugging Face, инференс на GPU Mac. Это архитектура Whisper, но рантайм — пакет mlx-whisper и бинарь mlx_whisper , не pip install openai-whisper и не репозиторий openai/whisper . Так собрался стек: Hijack пишет один mp3, mlx_whisper делает VTT, pyannote раскладывает по SPEAKER_XX. На 56-минутном звонке транскрипция заняла около пяти минут. Платный только Hijack — разовая лицензия, без подписки (цену смотрите на сайте Rogue Amoeba). Скрипты выложил в mac-call-transcribe под MIT. Ниже сборка, замеры с двух реальных звонков и грабли; повторяется на любом Mac с M-чипом.
https://habr.com/ru/articles/1062068/
#whisper #mlx #pyannote #speaker_diarization #расшифровка_звонков #python #apple_silicon #транскрибация_звонков
-
Телефонный звонок → структурированный JSON: строим STT + LLM пайплайн на Python
Каждый день в российском бизнесе происходят миллионы телефонных звонков. Колл-центры, клиники, юридические конторы, отделы продаж - везде, где есть телефон, есть поток неструктурированных данных, который никто не обрабатывает. Менеджер повесил трубку, записал в CRM “клиент интересовался” - и 80% информации из разговора потерялось.
https://habr.com/ru/articles/1020632/
#stt #speechtotext #llm #NLP #whisper #pyannote #диаризация #python #prompt_engineering
-
🚀 Whisper & Pyannote: The Ultimate Combo for Speech Transcription! 🎙️
Combining Whisper (ASR) and Pyannote (diarization) enables accurate and speaker-segmented transcriptions, even locally. 🔥
💡 Applications: meetings, podcasts, sentiment analysis, subtitles...
📖 Read the article: https://scalastic.io/whisper-pyannote-ultimate-speech-transcription/
Have you tried these tools? Share your thoughts! 👇
-
🚀 Whisper & Pyannote : la combinaison ultime pour la transcription vocale ! 🎙️
Associer Whisper (ASR) et Pyannote (diarisation) permet d’obtenir des transcriptions précises et segmentées par interlocuteur, même en local. 🔥
💡 Applications : réunions, podcasts, analyse des sentiments, sous-titres...
📖 Découvrez l’article : https://scalastic.io/whisper-pyannote-ultimate-speech-transcription/
Avez-vous testé ces outils ? Partagez votre avis ! 👇