OpenAI Realtime API: MCP, изображения и SIP-звонки — что нового

OpenAI выпустила обновлённую версию Realtime API с поддержкой MCP, изображений и SIP-звонков. Это значительный шаг вперёд для голосовых интерфейсов и реального времени. Разработчики теперь могут создавать более умные и контекстные голосовые ассистенты, интегрируя их с внешними системами и традиционн

OpenAI Realtime API: MCP, изображения и SIP-звонки — что нового

OpenAI выпустила обновлённую версию Realtime API с поддержкой MCP, изображений и SIP-звонков. Это значительный шаг вперёд для голосовых интерфейсов и реального времени. Разработчики теперь могут создавать более умные и контекстные голосовые ассистенты, интегрируя их с внешними системами и традиционной телефонией.

Что такое Realtime API и почему это важно

Realtime API от OpenAI — это интерфейс для создания голосовых приложений с минимальной задержкой. Он позволяет передавать аудиопоток в режиме реального времени, получая от модели синтезированную речь практически мгновенно. Ранее API поддерживал только аудиовход и аудиовыход, но теперь функционал значительно расширен.

Поддержка MCP (Model Context Protocol) — это ключевое нововведение. MCP позволяет модели вызывать внешние функции, обращаться к базам данных, API и другим сервисам. Например, голосовой ассистент может проверить статус заказа, забронировать столик или получить данные из CRM — всё это без дополнительных прослоек. Это делает ассистентов не просто болталками, а полноценными инструментами для бизнеса.

Ввод изображений — ещё один важный шаг. Теперь модель может анализировать визуальную информацию в реальном времени: читать документы, распознавать лица, оценивать обстановку. Это открывает путь к сценариям вроде видео-консультаций с автоматическим анализом или помощи в навигации.

SIP-звонки — это мост к традиционной телефонии. Разработчики могут интегрировать голосовых ассистентов с существующими телефонными системами, колл-центрами и IVR. Это значит, что звонки от клиентов могут обрабатываться AI напрямую, без переключения между системами.

Как работает новая модель gpt-realtime

OpenAI представила модель gpt-realtime, которая пришла на смену предыдущим версиям. Она обучена на большем объёме данных и демонстрирует более естественную речь: лучше передаёт эмоции, интонации и паузы. Распознавание речи также улучшено — модель точнее справляется с акцентами и шумом.

Ключевые возможности новой модели: - Поддержка MCP-серверов для вызова внешних функций. Разработчик может подключить любой сервер, реализующий протокол, и модель сможет отправлять и получать данные. - Передача изображений как входных данных. Модель принимает изображения в формате base64 или URL и может анализировать их в контексте разговора. - SIP-звонки. API позволяет инициировать и принимать звонки через SIP-протокол, что интегрируется с большинством телефонных систем.

Все эти функции доступны в режиме бета-тестирования для разработчиков с доступом к OpenAI API. Для использования MCP необходимо настроить сервер и указать его в запросе. Для изображений — передавать их вместе с аудио. Для SIP — настроить SIP-клиент или использовать облачные сервисы.

Какие сценарии открываются для разработчиков

Обновление Realtime API затрагивает широкий круг специалистов и компаний. Вот несколько примеров.

Разработчики голосовых ассистентов теперь могут создавать помощников, которые не только отвечают на вопросы, но и выполняют действия: бронируют, заказывают, проверяют информацию. Например, ассистент для службы поддержки может посмотреть историю заказов клиента, предложить замену товара и оформить возврат — всё голосом.

Создатели чат-ботов получают возможность добавить голосовой канал с реальным временем. Бот может видеть экран пользователя (через изображения) и помогать с настройкой приложения или ремонтом устройства.

Компании, использующие IVR-системы и колл-центры, могут заменить многоуровневые меню на голосового ассистента, который понимает естественную речь и может обрабатывать сложные запросы. SIP-интеграция позволяет сделать это без замены инфраструктуры.

Интеграторы телефонии теперь могут предлагать клиентам решения на базе OpenAI, где AI обрабатывает звонки, а человек подключается только в сложных случаях.

Когда стоит ожидать стабильной версии и каким будет ценообразование

OpenAI пока не раскрыла подробности о ценообразовании для новых функций. Скорее всего, стоимость будет зависеть от объёма переданных данных (аудио, изображения) и количества вызовов MCP. Для SIP-звонков также может взиматься плата за минуту.

Сроки выхода из беты также не объявлены. Обычно бета-доступ длится несколько месяцев, после чего функции становятся общедоступными. Разработчикам стоит тестировать сейчас, чтобы быть готовыми к релизу.

Чего пока не хватает

Несмотря на впечатляющий апдейт, некоторые возможности остаются за кадром. Нет поддержки видео в реальном времени — только статические изображения. Нет информации о поддержке нескольких языков в рамках одного разговора. Также неясно, можно ли использовать модель для анализа видео в реальном времени (например, с камеры).

Тем не менее, текущие обновления уже делают Realtime API одним из самых мощных инструментов для голосовых интерфейсов. Разработчикам стоит обратить внимание на бета-версию и начать эксперименты.