#voice_ai — Public Fediverse posts
Live and recent posts from across the Fediverse tagged #voice_ai, aggregated by home.social.
-
----------------
🛠️ Tool
===================OpenClaw Voice Call — Realtime Edition is a plugin that gives AI assistants the ability to place and receive real phone calls and hold full-duplex voice conversations. It bridges Twilio Media Streams with the OpenAI Realtime API (GA protocol), achieving sub-second turnaround with natural barge-in support when the other party interrupts.
Architecture: The plugin runs a webhook server handling Twilio callbacks, bridging audio streams bidirectionally between the phone network and OpenAI's speech-to-speech model. The voice AI operates with in-call tools it invokes autonomously during the conversation.
In-call tools:
• press_phone_keys: generates synthesized DTMF touch-tones for navigating IVR menus
• report_call_outcome: captures a structured result with status and every fact gathered during the call (times, prices, confirmation numbers)
• end_call: graceful hangup. The AI speaks a closing line, then waits for the Twilio mark echo to confirm the audio actually played on the line before disconnecting. No clipped goodbyes, no dead air.Post-call output: Every call produces a Markdown transcript with an AI-generated summary and the reported outcome, retrievable via get_transcript.
Call management:
• Handles Google Call Screen and voicemail gatekeepers with a configurable identity phrase
• Goal-directed calls using talking_points and call_party parameters
• Optional inbound calls with allowlist-gated access and configurable greeting
• Device profiles for per-caller policies: response length, forbidden actions, extra instructionsSecurity hardening (default):
• Twilio webhook signature verification
• Per-call stream authentication tokens
• Pre-auth connection throttling
• SSRF-guarded provider API calls
• Call-duration safety caps
• Stale-call reaping for zombie sessionsProviders: Twilio (recommended, full realtime conversation mode), Telnyx, Plivo, and a mock provider for the legacy TTS+STT pipeline.
The practical gap this fills is clear. Most AI agents handle email and messaging well, but the real world still runs on phone calls. This plugin gives the agent a phone number, a voice, ears, a keypad, and the judgment to end the call when the task is complete.
Note: haven't tested personally.
🔹 tool #openclaw #twilio #voice_ai #phone_automation
🔗 Source: https://github.com/TristanBrotherton/openclaw-voice-call-realtime
-
Запустил AI-репетитор английского месяц назад: технические грабли соло-дева
Я соло-делаю Speakwithai — AI-репетитор английского для русскоязычной аудитории. Месяц назад выкатил публично, за этот месяц получил 50 регистраций, 3 платящих и набор технических граблей, которые честнее разобрать, пока они свежие, а не через год по сглаженной памяти. Это не история успеха — продукт ещё ничего не доказал. Это разбор конкретных инженерных решений, которые я бы хотел увидеть в чужом посте перед стартом.
https://habr.com/ru/articles/1033992/
#AI #capacitor #rustore #ios #voice_ai #стартап #английский_язык #английский_онлайн
-
Запустил AI-репетитор английского месяц назад: технические грабли соло-дева
Я соло-делаю Speakwithai — AI-репетитор английского для русскоязычной аудитории. Месяц назад выкатил публично, за этот месяц получил 50 регистраций, 3 платящих и набор технических граблей, которые честнее разобрать, пока они свежие, а не через год по сглаженной памяти. Это не история успеха — продукт ещё ничего не доказал. Это разбор конкретных инженерных решений, которые я бы хотел увидеть в чужом посте перед стартом.
https://habr.com/ru/articles/1033992/
#AI #capacitor #rustore #ios #voice_ai #стартап #английский_язык #английский_онлайн
-
Запустил AI-репетитор английского месяц назад: технические грабли соло-дева
Я соло-делаю Speakwithai — AI-репетитор английского для русскоязычной аудитории. Месяц назад выкатил публично, за этот месяц получил 50 регистраций, 3 платящих и набор технических граблей, которые честнее разобрать, пока они свежие, а не через год по сглаженной памяти. Это не история успеха — продукт ещё ничего не доказал. Это разбор конкретных инженерных решений, которые я бы хотел увидеть в чужом посте перед стартом.
https://habr.com/ru/articles/1033992/
#AI #capacitor #rustore #ios #voice_ai #стартап #английский_язык #английский_онлайн
-
Все переводчики речи в реальном времени — херня. Я написал свой. Тоже херня, но бесплатная
Перепробовал всё что есть на рынке, потратил на подписки больше чем на кофе, и в итоге сел писать с нуля. Вот что вышло AI Open Source Voice AI Real-time перевод Deepgram Groq Piper TTS STT TTS LLM Google Meet Zoom Личный опыт Elixir Rust macOS Apple Silicon Speech-to-Text Text-to-Speech Сижу на рабочем созвоне. Обсуждаем архитектуру нового сервиса. Технически я всё понимаю - документацию на английском читаю без словаря, код ревьюю, в Slack переписываюсь нормально. А вот когда надо открыть рот и сказать что-то сложнее "I agree" - начинается цирк. Пауза. Подбираю слова. Коллега уже ответил за меня. Знакомо? Мне - до зубного скрежета. Я CTO, последние годы плотно работаю с AI-интеграциями. Могу собрать систему автоматического обзвона клиентов с клонированием голосов, поднять флот ботов для скана Телеги, собрать архитектуру которая выдержит тысячи пользователей за копейки. А сам на созвоне звучу как иностранец с разговорником. Ирония уровня бог. И вот в голове простая картинка: я говорю по-русски, собеседник слышит английский. Он отвечает по-английски, я слышу русский. В реальном времени. Без пауз на 10 секунд. Без субтитров - именно голосом. С любым приложением: Meet, Zoom, Slack, Discord. Пошёл искать. И тут началось.
https://habr.com/ru/articles/1019458/
#realtime_communications #translations #speechtotext #texttospeech #deepgram #groq #elixir #rust #open_source #voice_ai
-
Все переводчики речи в реальном времени — херня. Я написал свой. Тоже херня, но бесплатная
Перепробовал всё что есть на рынке, потратил на подписки больше чем на кофе, и в итоге сел писать с нуля. Вот что вышло AI Open Source Voice AI Real-time перевод Deepgram Groq Piper TTS STT TTS LLM Google Meet Zoom Личный опыт Elixir Rust macOS Apple Silicon Speech-to-Text Text-to-Speech Сижу на рабочем созвоне. Обсуждаем архитектуру нового сервиса. Технически я всё понимаю - документацию на английском читаю без словаря, код ревьюю, в Slack переписываюсь нормально. А вот когда надо открыть рот и сказать что-то сложнее "I agree" - начинается цирк. Пауза. Подбираю слова. Коллега уже ответил за меня. Знакомо? Мне - до зубного скрежета. Я CTO, последние годы плотно работаю с AI-интеграциями. Могу собрать систему автоматического обзвона клиентов с клонированием голосов, поднять флот ботов для скана Телеги, собрать архитектуру которая выдержит тысячи пользователей за копейки. А сам на созвоне звучу как иностранец с разговорником. Ирония уровня бог. И вот в голове простая картинка: я говорю по-русски, собеседник слышит английский. Он отвечает по-английски, я слышу русский. В реальном времени. Без пауз на 10 секунд. Без субтитров - именно голосом. С любым приложением: Meet, Zoom, Slack, Discord. Пошёл искать. И тут началось.
https://habr.com/ru/articles/1019458/
#realtime_communications #translations #speechtotext #texttospeech #deepgram #groq #elixir #rust #open_source #voice_ai
-
Все переводчики речи в реальном времени — херня. Я написал свой. Тоже херня, но бесплатная
Перепробовал всё что есть на рынке, потратил на подписки больше чем на кофе, и в итоге сел писать с нуля. Вот что вышло AI Open Source Voice AI Real-time перевод Deepgram Groq Piper TTS STT TTS LLM Google Meet Zoom Личный опыт Elixir Rust macOS Apple Silicon Speech-to-Text Text-to-Speech Сижу на рабочем созвоне. Обсуждаем архитектуру нового сервиса. Технически я всё понимаю - документацию на английском читаю без словаря, код ревьюю, в Slack переписываюсь нормально. А вот когда надо открыть рот и сказать что-то сложнее "I agree" - начинается цирк. Пауза. Подбираю слова. Коллега уже ответил за меня. Знакомо? Мне - до зубного скрежета. Я CTO, последние годы плотно работаю с AI-интеграциями. Могу собрать систему автоматического обзвона клиентов с клонированием голосов, поднять флот ботов для скана Телеги, собрать архитектуру которая выдержит тысячи пользователей за копейки. А сам на созвоне звучу как иностранец с разговорником. Ирония уровня бог. И вот в голове простая картинка: я говорю по-русски, собеседник слышит английский. Он отвечает по-английски, я слышу русский. В реальном времени. Без пауз на 10 секунд. Без субтитров - именно голосом. С любым приложением: Meet, Zoom, Slack, Discord. Пошёл искать. И тут началось.
https://habr.com/ru/articles/1019458/
#realtime_communications #translations #speechtotext #texttospeech #deepgram #groq #elixir #rust #open_source #voice_ai
-
[Перевод] Что такое платформа оркестрации Voice AI
Платформа оркестрации голосового ИИ (VAIOP, Voice AI Orchestration Platform) — важнейший управляющий уровень для создания голосовых ИИ агентов и их подключения к коммуникационным системам. Такие платформы дают возможность управлять выбором больших языковых моделей (они же LLM) и систем для обработки и синтеза речи, координируют обработку реплик (VAD и turn-taking), управляют аудио потоками, обрабатывают вызовы внешних функций, обеспечивают соблюдение требований к инфраструктуре, в итоге позволяя внедрять надёжные масштабируемые решения для голосовых агентов в реальном бизнесе.
-
[Перевод] Что такое платформа оркестрации Voice AI
Платформа оркестрации голосового ИИ (VAIOP, Voice AI Orchestration Platform) — важнейший управляющий уровень для создания голосовых ИИ агентов и их подключения к коммуникационным системам. Такие платформы дают возможность управлять выбором больших языковых моделей (они же LLM) и систем для обработки и синтеза речи, координируют обработку реплик (VAD и turn-taking), управляют аудио потоками, обрабатывают вызовы внешних функций, обеспечивают соблюдение требований к инфраструктуре, в итоге позволяя внедрять надёжные масштабируемые решения для голосовых агентов в реальном бизнесе.
-
[Перевод] Что такое платформа оркестрации Voice AI
Платформа оркестрации голосового ИИ (VAIOP, Voice AI Orchestration Platform) — важнейший управляющий уровень для создания голосовых ИИ агентов и их подключения к коммуникационным системам. Такие платформы дают возможность управлять выбором больших языковых моделей (они же LLM) и систем для обработки и синтеза речи, координируют обработку реплик (VAD и turn-taking), управляют аудио потоками, обрабатывают вызовы внешних функций, обеспечивают соблюдение требований к инфраструктуре, в итоге позволяя внедрять надёжные масштабируемые решения для голосовых агентов в реальном бизнесе.
-
OpenAI says it can clone a voice from just 15 seconds of audio
https://www.engadget.com/openai-says-it-can-clone-a-voice-from-just-15-seconds-of-audio-190356431.html
#ycombinator #chatgpt #news #gear #Voice_AI #openai #voice -
OpenAI says it can clone a voice from just 15 seconds of audio
https://www.engadget.com/openai-says-it-can-clone-a-voice-from-just-15-seconds-of-audio-190356431.html
#ycombinator #chatgpt #news #gear #Voice_AI #openai #voice -
OpenAI says it can clone a voice from just 15 seconds of audio
https://www.engadget.com/openai-says-it-can-clone-a-voice-from-just-15-seconds-of-audio-190356431.html
#ycombinator #chatgpt #news #gear #Voice_AI #openai #voice -
OpenAI says it can clone a voice from just 15 seconds of audio
https://www.engadget.com/openai-says-it-can-clone-a-voice-from-just-15-seconds-of-audio-190356431.html
#ycombinator #chatgpt #news #gear #Voice_AI #openai #voice