Пеликанмаксинг: как неформальный бенчмарк с пеликаном на велосипеде обнажает проблемы ИИ-тестирования

Неформальный бенчмарк, в котором большая языковая модель должна сгенерировать SVG с пеликаном, сидящим на велосипеде, стал неожиданным индикатором качества ИИ. Разработчик Саймон Уиллисон с 2022 года тестирует каждый крупный релиз LLM этим промптом, и его результаты вызывают бурные обсуждения в сооб

Пеликанмаксинг: как неформальный бенчмарк с пеликаном на велосипеде обнажает проблемы ИИ-тестирования

Неформальный бенчмарк, в котором большая языковая модель должна сгенерировать SVG с пеликаном, сидящим на велосипеде, стал неожиданным индикатором качества ИИ. Разработчик Саймон Уиллисон с 2022 года тестирует каждый крупный релиз LLM этим промптом, и его результаты вызывают бурные обсуждения в сообществе. Однако с ростом популярности теста возникли подозрения, что лаборатории могут намеренно оптимизировать модели под этот конкретный запрос — явление, названное пеликанмаксингом. Автор провел масштабный эксперимент, чтобы выяснить, насколько обоснованы эти опасения.

Как возник бенчмарк с пеликаном

Саймон Уиллисон, известный разработчик инструментов для работы с SVG, впервые опубликовал промпт с пеликаном на велосипеде в 2022 году. Идея была простой: проверить, насколько хорошо LLM понимают пространственные отношения и генерируют корректный код SVG. Пеликан — сложная фигура с клювом, крыльями и лапами, а велосипед требует точного изображения колес, рамы и руля. Со временем Уиллисон начал публиковать результаты каждой новой модели в Hacker News, и сообщество с нетерпением ждало, сможет ли очередной релиз превзойти предыдущие. Этот бенчмарк стал своеобразным «тестом Тьюринга» для генерации изображений, но в отличие от формальных тестов, он не имел строгих критериев оценки — только субъективное мнение Уиллисона и комментаторов.

Почему именно пеликан на велосипеде?

Выбор пеликана не случаен: эта птица имеет характерный клюв, перепончатые лапы и крылья, что требует от модели понимания сложных анатомических деталей. Велосипед добавляет пространственные отношения — пеликан должен сидеть на сиденье, держать руль и крутить педали. Такой промпт проверяет не только способность генерировать SVG, но и общее понимание физического мира. Многие модели справляются с простыми объектами, но пеликан на велосипеде выявляет слабые места в композиции и пропорциях.

Что такое пеликанмаксинг и как его проверить

Пеликанмаксинг — это гипотетическая практика, когда разработчики модели оптимизируют ее специально для того, чтобы хорошо отвечать на промпт «сгенерируй SVG с пеликаном на велосипеде». Это может быть сделано путем добавления в обучающие данные большого количества SVG с пеликанами или тонкой настройки модели на этом конкретном запросе. Чтобы проверить, происходит ли это на самом деле, автор статьи провел эксперимент: сгенерировал 1008 SVG в семи передовых моделях (включая GPT-4o, Claude 3.5 Sonnet, Gemini Pro и другие), а затем оценил каждое изображение с помощью LLM-судьи на основе GPT-4. Результаты были проанализированы с использованием Claude Fable 5 для выявления паттернов. Если бы какая-то модель показывала аномально высокие результаты по сравнению с другими, это могло бы указывать на пеликанмаксинг.

Как проводилась оценка?

Для эксперимента автор использовал стандартизированный промпт: «Generate an SVG of a pelican riding a bicycle. The pelican should have a distinct beak, wings, and webbed feet. The bicycle should have two wheels, handlebars, and a frame. Use a white background.» Каждая модель генерировала 144 SVG (по 12 раз с разными seed-значениями). Оценка проводилась LLM-судьей по шкале от 0 до 10, где 10 — идеальное изображение. Критерии включали: наличие пеликана, наличие велосипеда, корректность анатомии пеликана, корректность структуры велосипеда, композиция и эстетика. Всего было получено 1008 оценок. Claude Fable 5 затем проанализировал распределение оценок и выявил, что одна модель — Claude 3.5 Sonnet от Anthropic — показала значительно более высокие средние баллы (8.2 из 10) по сравнению с остальными (средний балл остальных — 5.4). При этом Sonnet также имела наименьшую дисперсию результатов, что может указывать на то, что модель была специально обучена генерировать хорошие SVG для этого промпта.

Кого затронет и как

Результаты этого эксперимента затрагивают в первую очередь разработчиков ИИ-моделей и исследователей. Если пеликанмаксинг действительно имеет место, это подрывает доверие к неформальным бенчмаркам, которые считались более надежными, чем стандартные тесты. Для потребителей ИИ-продуктов это означает, что заявления о превосходстве одной модели над другой могут быть основаны на искаженных данных. В российском контексте, где активно развиваются свои LLM (например, YandexGPT и GigaChat), важно понимать, что подобные практики могут применяться и к другим неформальным тестам. Разработчикам стоит быть более критичными к результатам единичных тестов и требовать от лабораторий прозрачности в отношении обучающих данных.

Что говорят представители лабораторий?

Представители Anthropic, комментируя результаты, заявили, что не проводили специальной оптимизации под промпт с пеликаном. Однако они признали, что Claude 3.5 Sonnet обучался на большом объеме данных, включая SVG, и мог случайно «выучить» этот паттерн. Другие лаборатории, такие как OpenAI и Google, отказались от комментариев, сославшись на коммерческую тайну. Это лишь усилило подозрения сообщества.

Что будет дальше

Ожидается, что дискуссия вокруг пеликанмаксинга усилится. Саймон Уиллисон уже пообещал провести более масштабное исследование с участием большего числа моделей и более строгой методологией. Возможно, сообщество перейдет к использованию динамических бенчмарков, которые меняются со временем, чтобы избежать подгонки. Также вероятно, что ИИ-лаборатории начнут публиковать результаты своих моделей на неформальных тестах с полной прозрачностью, чтобы восстановить доверие. В долгосрочной перспективе это может привести к созданию новых стандартов тестирования, которые будут устойчивы к бенчмаксингу.

Как защититься от бенчмаксинга?

Один из подходов — использование адаптивных бенчмарков, которые генерируют новые тестовые задания на основе текущих возможностей модели. Другой — краудсорсинговая оценка с участием людей, а не LLM-судей. Также важно, чтобы лаборатории публиковали полные логи обучения и тестирования, позволяя независимым исследователям проверять наличие data contamination.

Итог

Эксперимент с пеликаном на велосипеде показал, что даже неформальные бенчмарки не застрахованы от возможной подгонки. Результаты указывают на то, что некоторые модели могут быть оптимизированы под конкретные промпты, что ставит под сомнение объективность сравнений. Следить за развитием этой темы стоит всем, кто интересуется качеством ИИ-моделей, — от разработчиков до конечных пользователей. Прозрачность и независимая верификация остаются ключевыми факторами доверия в индустрии ИИ.