home.social

#asr — Public Fediverse posts

Live and recent posts from across the Fediverse tagged #asr, aggregated by home.social.

  1. Azul, bonjour ☕

    Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.

    Ce modèle est une adaptation de whisper-large-v3.

    Plus d'info sur : huggingface.co/Sunbird/asr-whi

    #whisper #taqbaylit #asr #STT #Africa

  2. Azul, bonjour ☕

    Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.

    Ce modèle est une adaptation de whisper-large-v3.

    Plus d'info sur : huggingface.co/Sunbird/asr-whi

    #whisper #taqbaylit #asr #STT #Africa

  3. Azul, bonjour ☕

    Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.

    Ce modèle est une adaptation de whisper-large-v3.

    Plus d'info sur : huggingface.co/Sunbird/asr-whi

    #whisper #taqbaylit #asr #STT #Africa

  4. Azul, bonjour ☕

    Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.

    Ce modèle est une adaptation de whisper-large-v3.

    Plus d'info sur : huggingface.co/Sunbird/asr-whi

    #whisper #taqbaylit #asr #STT #Africa

  5. Azul, bonjour ☕

    Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.

    Ce modèle est une adaptation de whisper-large-v3.

    Plus d'info sur : huggingface.co/Sunbird/asr-whi

    #whisper #taqbaylit #asr #STT #Africa

  6. I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.

    I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.

    codeberg.org/cryptomilk/crane-

    #homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust

  7. I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.

    I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.

    codeberg.org/cryptomilk/crane-

    #homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust

  8. I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.

    I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.

    codeberg.org/cryptomilk/crane-

    #homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust

  9. I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.

    I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.

    codeberg.org/cryptomilk/crane-

    #homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust

  10. I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.

    I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.

    codeberg.org/cryptomilk/crane-

    #homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust

  11. Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов

    Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.

    habr.com/ru/articles/1058944/

    #ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл

  12. Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов

    Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.

    habr.com/ru/articles/1058944/

    #ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл

  13. Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов

    Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.

    habr.com/ru/articles/1058944/

    #ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл

  14. Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS

    Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.

    habr.com/ru/articles/1054566/

    #iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS

  15. Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS

    Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.

    habr.com/ru/articles/1054566/

    #iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS

  16. Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS

    Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.

    habr.com/ru/articles/1054566/

    #iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS

  17. audiogear: как разметить миллионы аудиозаписей для TTS

    Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт.

    habr.com/ru/articles/1053986/

    #asr #tts #data #data_science #data_mining

  18. audiogear: как разметить миллионы аудиозаписей для TTS

    Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт.

    habr.com/ru/articles/1053986/

    #asr #tts #data #data_science #data_mining

  19. audiogear: как разметить миллионы аудиозаписей для TTS

    Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт.

    habr.com/ru/articles/1053986/

    #asr #tts #data #data_science #data_mining

  20. Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте

    Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...

    habr.com/ru/articles/1051580/

    #Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source

  21. Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте

    Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...

    habr.com/ru/articles/1051580/

    #Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source

  22. Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте

    Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...

    habr.com/ru/articles/1051580/

    #Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source

  23. Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ

    Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранном и записывать все руками, но в потоке задач это неудобно. Гораздо проще надиктовать мысли голосом или записать разговор, а расшифровку доверить сервису. Сегодня ASR-системы нового поколения способны учитывать контекст беседы и выдавать осмысленный текст. Однако у любой медали есть обратная сторона — архитектурные ограничения. Чтобы понять, готовы ли эти модели к жизненным сценариям, мы устроили им бенчмарк на Hugging Face. Ниже — разбор того, ломается ли контекстное окно алгоритмов на длинных видеозаписях и как фоновый шум влияет на итоговое качество транскрибации.

    habr.com/ru/companies/selectel

    #selectel #распознавание_речи #whisper #qwen #asr #транскрибация_речи #автоматическое_распознавание_речи #искусственный_интеллект #тестирование_моделей

  24. Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ

    Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранном и записывать все руками, но в потоке задач это неудобно. Гораздо проще надиктовать мысли голосом или записать разговор, а расшифровку доверить сервису. Сегодня ASR-системы нового поколения способны учитывать контекст беседы и выдавать осмысленный текст. Однако у любой медали есть обратная сторона — архитектурные ограничения. Чтобы понять, готовы ли эти модели к жизненным сценариям, мы устроили им бенчмарк на Hugging Face. Ниже — разбор того, ломается ли контекстное окно алгоритмов на длинных видеозаписях и как фоновый шум влияет на итоговое качество транскрибации.

    habr.com/ru/companies/selectel

    #selectel #распознавание_речи #whisper #qwen #asr #транскрибация_речи #автоматическое_распознавание_речи #искусственный_интеллект #тестирование_моделей

  25. Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ

    Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранном и записывать все руками, но в потоке задач это неудобно. Гораздо проще надиктовать мысли голосом или записать разговор, а расшифровку доверить сервису. Сегодня ASR-системы нового поколения способны учитывать контекст беседы и выдавать осмысленный текст. Однако у любой медали есть обратная сторона — архитектурные ограничения. Чтобы понять, готовы ли эти модели к жизненным сценариям, мы устроили им бенчмарк на Hugging Face. Ниже — разбор того, ломается ли контекстное окно алгоритмов на длинных видеозаписях и как фоновый шум влияет на итоговое качество транскрибации.

    habr.com/ru/companies/selectel

    #selectel #распознавание_речи #whisper #qwen #asr #транскрибация_речи #автоматическое_распознавание_речи #искусственный_интеллект #тестирование_моделей

  26. Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли

    «ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.

    habr.com/ru/articles/1050336/

    #ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup

  27. Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли

    «ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.

    habr.com/ru/articles/1050336/

    #ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup

  28. Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли

    «ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.

    habr.com/ru/articles/1050336/

    #ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup

  29. Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.

    Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:

    • не успеваю записывать и одновременно воспринимать полноценно то, что на экране
    • потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM

    А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.

    Теперь у меня есть скриптик, который делает слудующее:

    • получает от меня имя файла с записью занятия (которую я делаю в OBS)
    • с ffmpeg вынимает аудио
    • с ffmpeg делает скриншоты картинки раз в 15 секунд
    • скармливает аудио занятия whisper.cpp:main-vulkan (предварительно скачав с HuggingFace нужную модельку если её нет)
    • упаковывает субтитры, аудио и скриншоты в тарбол
    • я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
      • Markdown (Obsidian)
      • EPUB (e-Ink читалка)
      • PDF (десктоп)

    Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.

    P.S. В появлении этого поста вините @rayslava

    #LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language

  30. Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.

    Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:

    • не успеваю записывать и одновременно воспринимать полноценно то, что на экране
    • потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM

    А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.

    Теперь у меня есть скриптик, который делает слудующее:

    • получает от меня имя файла с записью занятия (которую я делаю в OBS)
    • с ffmpeg вынимает аудио
    • с ffmpeg делает скриншоты картинки раз в 15 секунд
    • скармливает аудио занятия whisper.cpp:main-vulkan (предварительно скачав с HuggingFace нужную модельку если её нет)
    • упаковывает субтитры, аудио и скриншоты в тарбол
    • я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
      • Markdown (Obsidian)
      • EPUB (e-Ink читалка)
      • PDF (десктоп)

    Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.

    P.S. В появлении этого поста вините @rayslava

    #LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language

  31. Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.

    Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:

    • не успеваю записывать и одновременно воспринимать полноценно то, что на экране
    • потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM

    А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.

    Теперь у меня есть скриптик, который делает слудующее:

    • получает от меня имя файла с записью занятия (которую я делаю в OBS)
    • с ffmpeg вынимает аудио
    • с ffmpeg делает скриншоты картинки раз в 15 секунд
    • скармливает аудио занятия whisper.cpp:main-vulkan (предварительно скачав с HuggingFace нужную модельку если её нет)
    • упаковывает субтитры, аудио и скриншоты в тарбол
    • я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
      • Markdown (Obsidian)
      • EPUB (e-Ink читалка)
      • PDF (десктоп)

    Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.

    P.S. В появлении этого поста вините @rayslava

    #LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language

  32. Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.

    Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:

    • не успеваю записывать и одновременно воспринимать полноценно то, что на экране
    • потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM

    А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.

    Теперь у меня есть скриптик, который делает слудующее:

    • получает от меня имя файла с записью занятия (которую я делаю в OBS)
    • с ffmpeg вынимает аудио
    • с ffmpeg делает скриншоты картинки раз в 15 секунд
    • скармливает аудио занятия whisper.cpp:main-vulkan (предварительно скачав с HuggingFace нужную модельку если её нет)
    • упаковывает субтитры, аудио и скриншоты в тарбол
    • я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
      • Markdown (Obsidian)
      • EPUB (e-Ink читалка)
      • PDF (десктоп)

    Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.

    P.S. В появлении этого поста вините @rayslava

    #LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language

  33. Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.

    Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:

    • не успеваю записывать и одновременно воспринимать полноценно то, что на экране
    • потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM

    А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.

    Теперь у меня есть скриптик, который делает слудующее:

    • получает от меня имя файла с записью занятия (которую я делаю в OBS)
    • с ffmpeg вынимает аудио
    • с ffmpeg делает скриншоты картинки раз в 15 секунд
    • скармливает аудио занятия whisper.cpp:main-vulkan (предварительно скачав с HuggingFace нужную модельку если её нет)
    • упаковывает субтитры, аудио и скриншоты в тарбол
    • я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
      • Markdown (Obsidian)
      • EPUB (e-Ink читалка)
      • PDF (десктоп)

    Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.

    P.S. В появлении этого поста вините @rayslava

    #LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language

  34. Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса

    Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и было ли приветствие вообще, если клиент коротко ответил "ага" на фоне работающего холодильника. Дано: сеть АЗС, ручной аудит покрывает несколько процентов смен. Всё остальное — "слепая зона". Заказчик хотел её закрыть с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования, только то, что уже есть на точках. Ограничение, которое определило всю архитектуру: кассир у микрофона говорит громко и развёрнутыми фразами. Клиент отвечает коротко, тихо и иногда вообще кивает. Стандартный ASR-пайплайн из этой пары слышит только одну сторону. Видео первично: без стабильного ID клиента и временных границ сессии аудиоаналитика работает вхолостую. Начали с трекинга.

    habr.com/ru/articles/1044914/

    #ASR #распознавание_речи #компьютерное_зрение #vad #object_tracking #видеоаналитика #speech_recognition #computer_vision