OpenAI Realtime API: MCP, изображения и SIP-звонки — что нового
OpenAI выпустила обновлённую версию Realtime API с поддержкой MCP, изображений и SIP-звонков. Это значительный шаг вперёд для голосовых интерфейсов и реального времени. Разработчики теперь могут создавать более умные и контекстные голосовые ассистенты, интегрируя их с внешними системами и традиционн

OpenAI выпустила обновлённую версию Realtime API с поддержкой MCP, изображений и SIP-звонков. Это значительный шаг вперёд для голосовых интерфейсов и реального времени. Разработчики теперь могут создавать более умные и контекстные голосовые ассистенты, интегрируя их с внешними системами и традиционной телефонией.
Что такое Realtime API и почему это важно
Realtime API от OpenAI — это интерфейс для создания голосовых приложений с минимальной задержкой. Он позволяет передавать аудиопоток в режиме реального времени, получая от модели синтезированную речь практически мгновенно. Ранее API поддерживал только аудиовход и аудиовыход, но теперь функционал значительно расширен.
Поддержка MCP (Model Context Protocol) — это ключевое нововведение. MCP позволяет модели вызывать внешние функции, обращаться к базам данных, API и другим сервисам. Например, голосовой ассистент может проверить статус заказа, забронировать столик или получить данные из CRM — всё это без дополнительных прослоек. Это делает ассистентов не просто болталками, а полноценными инструментами для бизнеса.
Ввод изображений — ещё один важный шаг. Теперь модель может анализировать визуальную информацию в реальном времени: читать документы, распознавать лица, оценивать обстановку. Это открывает путь к сценариям вроде видео-консультаций с автоматическим анализом или помощи в навигации.
SIP-звонки — это мост к традиционной телефонии. Разработчики могут интегрировать голосовых ассистентов с существующими телефонными системами, колл-центрами и IVR. Это значит, что звонки от клиентов могут обрабатываться AI напрямую, без переключения между системами.
Как работает новая модель gpt-realtime
OpenAI представила модель gpt-realtime, которая пришла на смену предыдущим версиям. Она обучена на большем объёме данных и демонстрирует более естественную речь: лучше передаёт эмоции, интонации и паузы. Распознавание речи также улучшено — модель точнее справляется с акцентами и шумом.
Ключевые возможности новой модели: - Поддержка MCP-серверов для вызова внешних функций. Разработчик может подключить любой сервер, реализующий протокол, и модель сможет отправлять и получать данные. - Передача изображений как входных данных. Модель принимает изображения в формате base64 или URL и может анализировать их в контексте разговора. - SIP-звонки. API позволяет инициировать и принимать звонки через SIP-протокол, что интегрируется с большинством телефонных систем.
Все эти функции доступны в режиме бета-тестирования для разработчиков с доступом к OpenAI API. Для использования MCP необходимо настроить сервер и указать его в запросе. Для изображений — передавать их вместе с аудио. Для SIP — настроить SIP-клиент или использовать облачные сервисы.
Какие сценарии открываются для разработчиков
Обновление Realtime API затрагивает широкий круг специалистов и компаний. Вот несколько примеров.
Разработчики голосовых ассистентов теперь могут создавать помощников, которые не только отвечают на вопросы, но и выполняют действия: бронируют, заказывают, проверяют информацию. Например, ассистент для службы поддержки может посмотреть историю заказов клиента, предложить замену товара и оформить возврат — всё голосом.
Создатели чат-ботов получают возможность добавить голосовой канал с реальным временем. Бот может видеть экран пользователя (через изображения) и помогать с настройкой приложения или ремонтом устройства.
Компании, использующие IVR-системы и колл-центры, могут заменить многоуровневые меню на голосового ассистента, который понимает естественную речь и может обрабатывать сложные запросы. SIP-интеграция позволяет сделать это без замены инфраструктуры.
Интеграторы телефонии теперь могут предлагать клиентам решения на базе OpenAI, где AI обрабатывает звонки, а человек подключается только в сложных случаях.
Когда стоит ожидать стабильной версии и каким будет ценообразование
OpenAI пока не раскрыла подробности о ценообразовании для новых функций. Скорее всего, стоимость будет зависеть от объёма переданных данных (аудио, изображения) и количества вызовов MCP. Для SIP-звонков также может взиматься плата за минуту.
Сроки выхода из беты также не объявлены. Обычно бета-доступ длится несколько месяцев, после чего функции становятся общедоступными. Разработчикам стоит тестировать сейчас, чтобы быть готовыми к релизу.
Чего пока не хватает
Несмотря на впечатляющий апдейт, некоторые возможности остаются за кадром. Нет поддержки видео в реальном времени — только статические изображения. Нет информации о поддержке нескольких языков в рамках одного разговора. Также неясно, можно ли использовать модель для анализа видео в реальном времени (например, с камеры).
Тем не менее, текущие обновления уже делают Realtime API одним из самых мощных инструментов для голосовых интерфейсов. Разработчикам стоит обратить внимание на бета-версию и начать эксперименты.