Эндрю Ын: будущее ИИ — не только большие модели, но и data-centric подход

Эндрю Ын, один из пионеров современного искусственного интеллекта, считает, что следующий прорыв в этой области произойдет не за счет увеличения размеров моделей, а благодаря улучшению качества данных. В эксклюзивном интервью IEEE Spectrum сооснователь Google Brain и бывший главный ученый Baidu изло

Эндрю Ын: будущее ИИ — не только большие модели, но и data-centric подход

Эндрю Ын, один из пионеров современного искусственного интеллекта, считает, что следующий прорыв в этой области произойдет не за счет увеличения размеров моделей, а благодаря улучшению качества данных. В эксклюзивном интервью IEEE Spectrum сооснователь Google Brain и бывший главный ученый Baidu изложил свое видение data-centric AI — подхода, который меняет акцент с архитектуры нейросетей на данные, на которых они обучаются. По мнению Ына, это особенно актуально для прикладных задач, где объем размеченной информации ограничен, а требования к точности высоки.

Почему data-centric AI — следующий шаг

Эндрю Ын не отрицает значимости больших моделей. Он признает, что foundation models, такие как GPT-4, продолжают демонстрировать впечатляющие результаты в обработке естественного языка и генерации контента. Однако исследователь указывает на фундаментальную проблему: бесконечное наращивание параметров и датасетов не всегда оправдано. Во многих промышленных сценариях — от контроля качества на производстве до медицинской диагностики — собрать миллионы размеченных примеров невозможно или слишком дорого. Именно здесь data-centric подход предлагает альтернативу: вместо того чтобы гоняться за объемом, нужно сосредоточиться на качестве и структуре имеющихся данных.

Что такое data-centric AI на практике?

Data-centric AI — это методология, при которой основное внимание уделяется не архитектуре модели, а данным: их очистке, разметке, балансировке и аугментации. Ын утверждает, что даже простая модель может достичь высокой точности, если обучать ее на хорошо структурированных и репрезентативных данных. В интервью он приводит примеры из собственной практики в компании Landing AI, где его команда помогает заводам внедрять компьютерное зрение для визуального контроля. Вместо того чтобы собирать огромные датасеты, инженеры работают с клиентами над тем, чтобы разметить несколько сотен изображений, но сделать это максимально качественно, устраняя шум и ошибки.

Как синтетические данные решают проблему малых выборок

Одним из ключевых инструментов data-centric AI, по мнению Ына, являются синтетические данные. Когда реальных размеченных примеров недостаточно, их можно генерировать искусственно, моделируя различные условия освещения, ракурсы или дефекты. В Landing AI этот подход активно используется для обучения моделей на производствах, где каждый новый дефект может быть редким. Синтетические данные позволяют расширить обучающую выборку без затрат на ручную разметку, но при этом требуют тщательной валидации, чтобы не внести искажений.

Ограничения больших моделей в видео и NLP

Хотя Ын считает, что тренд на увеличение моделей в NLP еще не исчерпан, он отмечает, что в области видео ситуация иная. Создать foundation model для видео пока не удалось из-за колоссальных вычислительных затрат. Это делает data-centric подход особенно привлекательным для видеозадач, где данные часто структурированы слабо. Вместо того чтобы строить гигантскую модель, разработчики могут сосредоточиться на улучшении качества видеофрагментов, их разметке и аугментации.

Кому выгоден data-centric подход

Разработчики ИИ, работающие с ограниченными данными, получают новые методологии, которые позволяют добиваться результатов без суперкомпьютеров. Промышленные компании, особенно в сфере производства, могут внедрять компьютерное зрение без необходимости нанимать армию разметчиков. Исследователи получают новое поле для публикаций: data-centric AI становится самостоятельным направлением, где можно изучать влияние качества данных на производительность моделей.

Вопросы, которые остаются открытыми

Несмотря на очевидные преимущества, data-centric подход не универсален. Пока неясно, насколько он применим для задач с очень большими объемами данных, таких как обучение GPT. Кроме того, отсутствуют конкретные метрики, которые позволяли бы сравнивать эффективность улучшения данных и увеличения модели. Ын признает, что для foundation models data-centric методы могут быть менее значимы, но уверен, что в нишевых приложениях они станут стандартом.

Заключение

Эндрю Ын не призывает отказаться от больших моделей, но предлагает сбалансированный подход. Data-centric AI — это не революция, а эволюция, которая делает ИИ доступнее для бизнеса и промышленности. В мире, где данные становятся новым золотом, умение работать с ними качественно может оказаться важнее, чем способность строить все более глубокие нейросети.