#asr — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #asr, aggregated by home.social.
-
Azul, bonjour ☕
Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.
Ce modèle est une adaptation de whisper-large-v3.
Plus d'info sur : https://huggingface.co/Sunbird/asr-whisper-51-african-languages
-
Azul, bonjour ☕
Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.
Ce modèle est une adaptation de whisper-large-v3.
Plus d'info sur : https://huggingface.co/Sunbird/asr-whisper-51-african-languages
-
Azul, bonjour ☕
Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.
Ce modèle est une adaptation de whisper-large-v3.
Plus d'info sur : https://huggingface.co/Sunbird/asr-whisper-51-african-languages
-
Azul, bonjour ☕
Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.
Ce modèle est une adaptation de whisper-large-v3.
Plus d'info sur : https://huggingface.co/Sunbird/asr-whisper-51-african-languages
-
Azul, bonjour ☕
Sunbird a publié le 04 juillet un modèle nommé "Whisper large for 51 African languages" qui prend en charge le #kabyle.
Ce modèle est une adaptation de whisper-large-v3.
Plus d'info sur : https://huggingface.co/Sunbird/asr-whisper-51-african-languages
-
📰 CALCIOMERCATO | Koné, si muove l’Al-Ahli: contatti avviati con la Roma
#️⃣ #Calciomercato #asroma #ASR #asromanews #dajeroma #thelabsocial @altbot
🔗 https://www.giallorossi.net/calciomercato-kone-si-muove-lal-ahli-contatti-avviati-con-la-roma/
-
I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.
I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.
https://codeberg.org/cryptomilk/crane-wyoming
#homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust
-
I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.
I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.
https://codeberg.org/cryptomilk/crane-wyoming
#homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust
-
I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.
I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.
https://codeberg.org/cryptomilk/crane-wyoming
#homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust
-
I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.
I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.
https://codeberg.org/cryptomilk/crane-wyoming
#homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust
-
I'm using Text-To-Speech (TTS) on my Desktop (Calender Events, Firefox Read Aloud) and with Home Assistant. However the quality isn't the best and I wanted a better option.
I've started a new project for this called crane-wyoming which is in alpha/beta stage as it is not feature complete but works well for TTS.
https://codeberg.org/cryptomilk/crane-wyoming
#homeassistant #speech #speechd #speechdispatcher #tts #inference #llm #voice #asr #qwen #voxtral #ai #rust
-
Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов
Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.
https://habr.com/ru/articles/1058944/
#ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл
-
Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов
Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.
https://habr.com/ru/articles/1058944/
#ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл
-
Тихий клиент на АЗС: как собрать сессию обслуживания из архивных записей штатных камер и микрофонов
Дано: сеть из нескольких сотен АЗС. Визуальный аудит качества обслуживания и сервиса (проверяется соблюдение скриптов, стимулирование дополнительных продаж и установок приложения) покрывает несколько процентов смен, остальное не просматривается. Наш клиент хотел увидеть, что происходит в те моменты, которые упущены из виду. Важно: система должна работать на действующих камерах и микрофонах без всякой доукомплектации. Задача: брать архивные записи, автоматически выделять сессии обслуживания и проверять их по чек-листу. Кассир у микрофона говорит громко и развернутыми фразами. Клиент отвечает коротко, тихо, иногда просто кивает. Стандартный ASR-пайплайн сталкивается с суровой реальностью: в транскрипции остаётся монолог кассира с пропусками там, где отвечал клиент. Начали с видео.
https://habr.com/ru/articles/1058944/
#ASR #распознавание_речи #ReID #машинное+обучение #видеоаналитика #аудиоаналитика #ритейл
-
自動車由来廃プラからケミカルリサイクル油を生産 循環型社会目指す出光興産グループ
https://www.kyodo.co.jp/sponsored/2026-07-02_4020321/#kyodo #SPONSORED #ASR #CRJ #CR油 #カーボンニュートラル #ケミカルリサイクル_ジャパン #ケミカルリサイクル油 #サーマルリサイクル #プラスチック #マテリアルリサイクル #出光興産 #出光興産グループ #岡村仁彦 #廃プラ
-
Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS
Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.
https://habr.com/ru/articles/1054566/
#iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS
-
Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS
Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.
https://habr.com/ru/articles/1054566/
#iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS
-
Аналог Plaud на iPhone: эксперименты с локальной транскрибацией ASR на iOS
Мы делаем приложение Memo: есть куча гаджетов и сервисов вроде Plaud — это когда ты платишь за отдельную «умную» коробочку-диктофон, которая записывает встречу и сама делает из неё протокол. Зачем покупать отдельную железку, если в кармане уже есть iPhone? Давайте соберём такой же «умный протоколщик» прямо на телефоне.
https://habr.com/ru/articles/1054566/
#iOS #распознавание_речи #ASR #speechtotext #ondevice_ML #локальные_модели #транскрибация #SpeechAnalyzer #Apple_Neural_Engine #разработка_под_iOS
-
audiogear: как разметить миллионы аудиозаписей для TTS
Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт.
-
audiogear: как разметить миллионы аудиозаписей для TTS
Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт.
-
audiogear: как разметить миллионы аудиозаписей для TTS
Конвейер на Python + Hydra, который превращает папку с аудио в богато размеченный датасет: качество речи, просодия, разборчивость, спикер, транскрипция — по колонке на запись. От одной видеокарты до кластера, карты под нагрузкой, и он не падает на «длинном хвосте» записей, на которых обычно рассыпается наивный скрипт.
-
Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте
Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...
https://habr.com/ru/articles/1051580/
#Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source
-
Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте
Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...
https://habr.com/ru/articles/1051580/
#Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source
-
Как утки с СДВГ довели меня до опенсорса: зачем я собрал утилиту для перевода коротких видео на домашней видеокарте
Всем привет! Листал ленту тиктока и попался американский ролик про СДВГ, где всё объясняют на утках. Понравилось. И я подумал: классно было бы сделать такой же тикток, только на русском. Но я ленивый. Снимать, писать сценарии, делать всё с нуля - это скучно. А вот взять готовый ролик и перевести-переозвучить его на русский - вот это уже интересно, подумал я, а потом задумался, о том, как это автоматизировать. Это оказалось интересной инженерной задачей, которая увлекла меня на неделю времени, и привела к созданию ИИ утилиты с открытым исходным кодом. А тикток с утками я так и не создал...
https://habr.com/ru/articles/1051580/
#Dub_Studio #дубляж_видео #перевод_видео #локальные_нейросети #TTS #клонирование_голоса #ASR #Gemma #Qwen3TTS #open_source
-
Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ
Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранном и записывать все руками, но в потоке задач это неудобно. Гораздо проще надиктовать мысли голосом или записать разговор, а расшифровку доверить сервису. Сегодня ASR-системы нового поколения способны учитывать контекст беседы и выдавать осмысленный текст. Однако у любой медали есть обратная сторона — архитектурные ограничения. Чтобы понять, готовы ли эти модели к жизненным сценариям, мы устроили им бенчмарк на Hugging Face. Ниже — разбор того, ломается ли контекстное окно алгоритмов на длинных видеозаписях и как фоновый шум влияет на итоговое качество транскрибации.
https://habr.com/ru/companies/selectel/articles/1050826/
#selectel #распознавание_речи #whisper #qwen #asr #транскрибация_речи #автоматическое_распознавание_речи #искусственный_интеллект #тестирование_моделей
-
Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ
Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранном и записывать все руками, но в потоке задач это неудобно. Гораздо проще надиктовать мысли голосом или записать разговор, а расшифровку доверить сервису. Сегодня ASR-системы нового поколения способны учитывать контекст беседы и выдавать осмысленный текст. Однако у любой медали есть обратная сторона — архитектурные ограничения. Чтобы понять, готовы ли эти модели к жизненным сценариям, мы устроили им бенчмарк на Hugging Face. Ниже — разбор того, ломается ли контекстное окно алгоритмов на длинных видеозаписях и как фоновый шум влияет на итоговое качество транскрибации.
https://habr.com/ru/companies/selectel/articles/1050826/
#selectel #распознавание_речи #whisper #qwen #asr #транскрибация_речи #автоматическое_распознавание_речи #искусственный_интеллект #тестирование_моделей
-
Погружаем модели в сказки русские, да рассказы древние – тестируем возможности Qwen и Whisper на дореволюционномъ
Хотите не забывать детали диалога или то, что вас просили купить в магазине? Конечно, можно по старинке открывать блокнот в телефоне или чат в избранном и записывать все руками, но в потоке задач это неудобно. Гораздо проще надиктовать мысли голосом или записать разговор, а расшифровку доверить сервису. Сегодня ASR-системы нового поколения способны учитывать контекст беседы и выдавать осмысленный текст. Однако у любой медали есть обратная сторона — архитектурные ограничения. Чтобы понять, готовы ли эти модели к жизненным сценариям, мы устроили им бенчмарк на Hugging Face. Ниже — разбор того, ломается ли контекстное окно алгоритмов на длинных видеозаписях и как фоновый шум влияет на итоговое качество транскрибации.
https://habr.com/ru/companies/selectel/articles/1050826/
#selectel #распознавание_речи #whisper #qwen #asr #транскрибация_речи #автоматическое_распознавание_речи #искусственный_интеллект #тестирование_моделей
-
Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли
«ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.
https://habr.com/ru/articles/1050336/
#ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup
-
Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли
«ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.
https://habr.com/ru/articles/1050336/
#ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup
-
Что под капотом у ИИ-агента для отдела продаж: архитектура, код и грабли
«ИИ-агент для продаж» на демо выглядит как одна кнопка: подключил, и он сам слушает звонок и ставит задачу в CRM. В проде между этими двумя точками десяток слоёв, и в каждом всё тихо ломается. Разбираем пайплайн целиком: распознавание и диаризация на телефонном звуке 8 кГц, извлечение фактов с проверкой каждого вывода против расшифровки, запись в CRM без дублей и потерь, действия наружу через MCP вместо хрупкого браузера, контроль качества на сотне размеченных звонков. Везде код, реальные цифры и грабли из боевого режима.
https://habr.com/ru/articles/1050336/
#ииагенты #llm #asr #диаризация #whisper #amocrm #очереди #followup
-
Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.
Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:
- не успеваю записывать и одновременно воспринимать полноценно то, что на экране
- потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM
А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.
Теперь у меня есть скриптик, который делает слудующее:
- получает от меня имя файла с записью занятия (которую я делаю в OBS)
- с
ffmpegвынимает аудио - с
ffmpegделает скриншоты картинки раз в 15 секунд - скармливает аудио занятия
whisper.cpp:main-vulkan(предварительно скачав с HuggingFace нужную модельку если её нет) - упаковывает субтитры, аудио и скриншоты в тарбол
- я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
- Markdown (Obsidian)
- EPUB (e-Ink читалка)
- PDF (десктоп)
Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.
P.S. В появлении этого поста вините @rayslava
#LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language
-
Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.
Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:
- не успеваю записывать и одновременно воспринимать полноценно то, что на экране
- потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM
А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.
Теперь у меня есть скриптик, который делает слудующее:
- получает от меня имя файла с записью занятия (которую я делаю в OBS)
- с
ffmpegвынимает аудио - с
ffmpegделает скриншоты картинки раз в 15 секунд - скармливает аудио занятия
whisper.cpp:main-vulkan(предварительно скачав с HuggingFace нужную модельку если её нет) - упаковывает субтитры, аудио и скриншоты в тарбол
- я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
- Markdown (Obsidian)
- EPUB (e-Ink читалка)
- PDF (десктоп)
Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.
P.S. В появлении этого поста вините @rayslava
#LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language
-
Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.
Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:
- не успеваю записывать и одновременно воспринимать полноценно то, что на экране
- потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM
А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.
Теперь у меня есть скриптик, который делает слудующее:
- получает от меня имя файла с записью занятия (которую я делаю в OBS)
- с
ffmpegвынимает аудио - с
ffmpegделает скриншоты картинки раз в 15 секунд - скармливает аудио занятия
whisper.cpp:main-vulkan(предварительно скачав с HuggingFace нужную модельку если её нет) - упаковывает субтитры, аудио и скриншоты в тарбол
- я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
- Markdown (Obsidian)
- EPUB (e-Ink читалка)
- PDF (десктоп)
Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.
P.S. В появлении этого поста вините @rayslava
#LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language
-
Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.
Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:
- не успеваю записывать и одновременно воспринимать полноценно то, что на экране
- потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM
А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.
Теперь у меня есть скриптик, который делает слудующее:
- получает от меня имя файла с записью занятия (которую я делаю в OBS)
- с
ffmpegвынимает аудио - с
ffmpegделает скриншоты картинки раз в 15 секунд - скармливает аудио занятия
whisper.cpp:main-vulkan(предварительно скачав с HuggingFace нужную модельку если её нет) - упаковывает субтитры, аудио и скриншоты в тарбол
- я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
- Markdown (Obsidian)
- EPUB (e-Ink читалка)
- PDF (десктоп)
Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.
P.S. В появлении этого поста вините @rayslava
#LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language
-
Мы тут уже больше года с @rayslava ходим на уроки японского. Вы это уже, конечно, знаете если слушали наш подкаст и читали нас.
Первые пару месяцев я вёл конспекты в тетрадочке, но в итоге перестал потому что:
- не успеваю записывать и одновременно воспринимать полноценно то, что на экране
- потом искать по тетрадочке с её разрастанием становится мягко говоря неудобно - была несколько раз ситуация когда я хотел найти нужное слово или форму, но на её поиск требовалось больше времени чем поиск в интернете или обращение к LLM
А недавно я всё-таки решил вернуться к конспектам, но уже по-новому.
Теперь у меня есть скриптик, который делает слудующее:
- получает от меня имя файла с записью занятия (которую я делаю в OBS)
- с
ffmpegвынимает аудио - с
ffmpegделает скриншоты картинки раз в 15 секунд - скармливает аудио занятия
whisper.cpp:main-vulkan(предварительно скачав с HuggingFace нужную модельку если её нет) - упаковывает субтитры, аудио и скриншоты в тарбол
- я отдаю тарбол ChatGPT с заранее написанным промптом и получаю на выходе:
- Markdown (Obsidian)
- EPUB (e-Ink читалка)
- PDF (десктоп)
Несмотря на дикие лулзы, которые творит Whisper на смешанной речи записанной из удалённого урока, работает на удивление годно и уже помогало мне готовиться к урокам и при выполнении домашнего задания.
P.S. В появлении этого поста вините @rayslava
#LLM #ML #AI #study #Japanese #log #workflow #automation #thoughts #pic #whisper #FFMPEG #ChatGPT #STT #ASR #pipeline #language
-
🗓️Vi ricordate il motivo?
#ASRoma #Petrachi #dajeRoma #Rome #forzaRoma #ASR #Roma #vocegiallorossa #dajeromadaje -
🗓️Vi ricordate il motivo?
#ASRoma #Petrachi #dajeRoma #Rome #forzaRoma #ASR #Roma #vocegiallorossa #dajeromadaje -
🗓️Vi ricordate il motivo?
#ASRoma #Petrachi #dajeRoma #Rome #forzaRoma #ASR #Roma #vocegiallorossa #dajeromadaje -
🗓️Vi ricordate il motivo?
#ASRoma #Petrachi #dajeRoma #Rome #forzaRoma #ASR #Roma #vocegiallorossa #dajeromadaje -
-
-
-
-
-
Как мы учили систему слышать тихого клиента на АЗС: двухмодальная аналитика для контроля сервиса
Распознать "здравствуйте" в записи — задача, которая уже решена. Труднее понять, кому это "здравствуйте" сказано, кто стоит у кассы в этот момент, и было ли приветствие вообще, если клиент коротко ответил "ага" на фоне работающего холодильника. Дано: сеть АЗС, ручной аудит покрывает несколько процентов смен. Всё остальное — "слепая зона". Заказчик хотел её закрыть с помощью существующих камер и микрофонов: взять архивные записи, автоматически выделить сессии обслуживания, проверить по чек-листу. Никакого нового оборудования, только то, что уже есть на точках. Ограничение, которое определило всю архитектуру: кассир у микрофона говорит громко и развёрнутыми фразами. Клиент отвечает коротко, тихо и иногда вообще кивает. Стандартный ASR-пайплайн из этой пары слышит только одну сторону. Видео первично: без стабильного ID клиента и временных границ сессии аудиоаналитика работает вхолостую. Начали с трекинга.
https://habr.com/ru/articles/1044914/
#ASR #распознавание_речи #компьютерное_зрение #vad #object_tracking #видеоаналитика #speech_recognition #computer_vision