Скарлетт Йоханссон против OpenAI: как голос GPT-4o «Sky» стал скандалом
В мае 2024 года OpenAI представила новую модель GPT-4o, и одним из самых ярких впечатлений стал голосовой режим с интерактивным ассистентом. Демонстрация, где ассистент флиртует, шутит и поёт, мгновенно стала вирусной. Но внимание публики быстро переключилось с технологического прорыва на скандал: г

В мае 2024 года OpenAI представила новую модель GPT-4o, и одним из самых ярких впечатлений стал голосовой режим с интерактивным ассистентом. Демонстрация, где ассистент флиртует, шутит и поёт, мгновенно стала вирусной. Но внимание публики быстро переключилось с технологического прорыва на скандал: голос «Sky», один из пяти предложенных вариантов, оказался до жути похож на голос Скарлетт Йоханссон — той самой актрисы, что озвучила ИИ-операционную систему в фильме «Она» (Her). Сама Йоханссон заявила, что была «в шоке, гневе и неверии», когда услышала демо. OpenAI отрицала намеренное копирование, но всё же приостановила использование «Sky». Эта история вскрыла болезненную тему: где проходит грань между вдохновением и нарушением прав, и как технологии меняют наше понимание идентичности.
OpenAI убрала голос «Sky» после обвинений Скарлетт Йоханссон
Скандал разразился 20 мая 2024 года, когда OpenAI выпустила демо GPT-4o, показав возможности нового голосового интерфейса. Журналисты и пользователи сразу заметили, что голос «Sky» звучит подозрительно знакомо — многие сравнили его с голосом Скарлетт Йоханссон из фильма «Она». Через несколько дней, 22 мая, актриса опубликовала официальное заявление, в котором выразила возмущение: «Когда я услышала выпущенное демо, я была в шоке, гневе и неверии. Голос „Скай“ звучит настолько похоже на мой, что мои самые близкие друзья и СМИ не могут отличить его». В заявлении Йоханссон также раскрыла, что ещё в сентябре 2023 года получила предложение от генерального директора OpenAI Сэма Альтмана озвучить ChatGPT, но отказалась. После этого, по её словам, компания наняла актрису, чтобы имитировать её голос.
OpenAI в ответ опубликовала пост в блоге, где утверждала, что голос «Sky» принадлежит профессиональной актрисе, работающей по контракту, и не является имитацией. Однако компания признала, что «Sky» стал предметом споров, и решила временно приостановить его использование. Сэм Альтман, комментируя ситуацию, заявил, что «голос Скай не был скопирован», но добавил, что «взаимодействие с госпожой Йоханссон было неудачным». OpenAI также подчеркнула, что ведёт работу над тем, чтобы сделать голосовые опции более разнообразными и избежать подобных конфликтов в будущем.
Предыстория: как OpenAI оказалась в центре спора о правах на голос
Этот скандал не возник на пустом месте. Ещё в сентябре 2023 года, когда OpenAI активно развивала голосовые функции ChatGPT, Сэм Альтман лично связывался со Скарлетт Йоханссон, предлагая ей стать «лицом» голосового ассистента. Актриса отказалась, сославшись на занятость и, по её словам, нежелание ассоциироваться с технологией, которую она считает «жуткой». Однако идея использовать голос, напоминающий Йоханссон, очевидно, осталась в компании. В мае 2024 года, когда OpenAI представила GPT-4o, многие зрители провели прямые параллели с фильмом «Она», где герой влюбляется в ИИ с голосом Скарлетт. Сам Альтман подогрел ассоциации, опубликовав в Twitter одно слово — «she» (она), что было воспринято как отсылка к фильму.
Проблема глубже, чем просто совпадение. Технология синтеза речи достигла такого уровня, что воспроизвести чей-то голос стало возможным без согласия человека. Это порождает серьёзные этические и юридические вопросы. В США уже существуют законы о праве на голос в некоторых штатах, но они часто отстают от технологий. В случае с Йоханссон ситуация осложняется тем, что OpenAI использовала реальную актрису, но, по утверждению компании, не копировала тембр именно Йоханссон. Однако для публики и для самой актрисы разница оказалась неуловимой.
Чем голос «Sky» отличался от других вариантов и почему он вызвал такой резонанс?
OpenAI предложила пять голосов: Breeze, Cove, Ember, Juniper и Sky. Каждый из них был создан с участием профессиональных актёров, которые записали сотни часов материала для обучения модели. Голос «Sky» был задуман как «тёплый, естественный и женственный», но именно он вызвал ассоциации с голосом Йоханссон. Возможно, дело в том, что интонации, манера речи и даже смех в демо-версии напоминали её фирменный стиль. В демонстрации GPT-4o ассистент шутил, флиртовал и даже пел — всё это было очень похоже на поведение ИИ из фильма «Она». Пользователи быстро создали мемы и сравнения, что усилило давление на OpenAI.
Технически, голос «Sky» не был дипфейком в прямом смысле — это не синтез голоса конкретного человека, а результат работы генеративной модели, обученной на голосах многих актрис. Но именно эта неопределённость и стала проблемой: когда технология способна имитировать голос так, что его не отличить от реального, грань между «вдохновением» и «копированием» стирается. Для обычных людей, которые слышали демо, не было сомнений — это голос Скарлетт Йоханссон. И это поднимает вопрос: если технология может воспроизвести голос без согласия, что мешает злоумышленникам использовать её для создания дипфейков с целью мошенничества или клеветы?
Технические детали: как OpenAI создавала голоса и почему это вызвало споры
OpenAI использовала передовые модели синтеза речи, в том числе технологию, основанную на диффузии и трансформерах. Компания утверждает, что каждый голос был создан в сотрудничестве с актёрами, которые предоставили свои голоса для обучения. Однако точные параметры обучения не раскрываются. Известно, что для создания «Sky» использовались записи профессиональной актрисы, которая подписала контракт, разрешающий использование её голоса. Но OpenAI не раскрывает, была ли эта актриса похожа на Йоханссон по тембру или это случайное совпадение.
Сравнение с конкурентами: Google, Amazon и другие компании также используют синтезированные голоса, но они обычно более «роботизированные» и менее эмоциональные. GPT-4o отличается тем, что голос способен передавать эмоции, менять интонацию, смеяться и даже петь — это стало возможным благодаря новым архитектурам нейросетей. Именно эта эмоциональность сделала голос «Sky» таким убедительным и одновременно опасным. Если раньше голосовые ассистенты звучали как машины, то теперь они звучат как люди, и это создаёт новые риски.
Кого затронет этот скандал и что он меняет для индустрии
Для разработчиков и компаний, работающих с синтезом речи, этот случай станет предупреждением. Юридические риски использования голосов без явного согласия теперь очевидны. Уже сейчас в США поданы иски против компаний, использующих голоса знаменитостей без разрешения. Например, в 2023 году певица Бейонсе подала иск против одного из сервисов, который использовал её голос для генерации песен. В России также есть прецеденты, когда артисты требовали компенсации за использование их голосов в рекламе без согласия. Но главное — это доверие пользователей. Если люди поймут, что голосовой ассистент может имитировать любого человека, они станут более осторожными в общении с ИИ, а компании — более прозрачными в вопросах использования голосов.
Для обычных пользователей этот скандал означает, что в ближайшее время OpenAI и другие компании будут более осторожны в выборе голосов для своих ассистентов. Возможно, они будут предлагать более «нейтральные» голоса или вводить обязательную маркировку, что голос синтезирован. Также стоит ожидать ужесточения законодательства в области прав на голос. В Европе уже обсуждается директива об ИИ, которая может включить требования о согласии на использование голоса. В России Госдума рассматривает законопроекты о регулировании дипфейков, которые могут затронуть и синтез голоса.
Что будет дальше: перспективы развития голосовых интерфейсов
OpenAI уже объявила, что «Sky» будет возвращён после доработки, но с изменениями, чтобы избежать ассоциаций с конкретными людьми. Компания также пообещала улучшить процесс выбора голосов и сделать его более прозрачным. Однако эксперты сомневаются, что проблема решится полностью. Технологии синтеза речи развиваются быстрее, чем законодательство, и в ближайшие годы мы, скорее всего, увидим новые скандалы. Возможно, в будущем появятся стандарты, которые обяжут ИИ-компании раскрывать данные о том, на каких голосах обучались модели, и получать явное согласие от доноров голоса.
Этот случай также поднимает более широкий вопрос о том, как мы определяем идентичность в эпоху ИИ. Если голос человека может быть воспроизведён с точностью до интонаций, что остаётся уникальным? Юристы и этики уже обсуждают концепцию «права на голос» как отдельного вида интеллектуальной собственности. Возможно, в скором времени появятся специальные законы, защищающие не только внешность, но и голос, и даже стиль речи. Пока же индустрия будет учиться на ошибках OpenAI, а пользователи — внимательнее относиться к тому, с кем они разговаривают по ту сторону экрана.