Claude Opus 5 установил рекорд в FoodTruck Bench: $75 264 за 30 дней

Модель Claude Opus 5 от Anthropic достигла нового рекорда в бенчмарке FoodTruck Bench, завершив 30-дневный тест с итоговым капиталом $75 264. Это на 13,6% выше лучшего результата GPT-5.5 и на 41,4% выше показателя GPT-5.6 Sol. Результат подтверждает лидерство Claude Opus 5 среди современных языковых

Claude Opus 5 установил рекорд в FoodTruck Bench: $75 264 за 30 дней

Модель Claude Opus 5 от Anthropic достигла нового рекорда в бенчмарке FoodTruck Bench, завершив 30-дневный тест с итоговым капиталом $75 264. Это на 13,6% выше лучшего результата GPT-5.5 и на 41,4% выше показателя GPT-5.6 Sol. Результат подтверждает лидерство Claude Opus 5 среди современных языковых моделей в задачах стратегического планирования и принятия решений в условиях ограниченных ресурсов. Бенчмарк моделирует управление уличной точкой питания, требуя ежедневных решений о закупках, ценах и меню.

Claude Opus 5 побил рекорд FoodTruck Bench

FoodTruck Bench — это симулятор, в котором ИИ-агент управляет фудтраком в течение 30 игровых дней. Агент должен закупать ингредиенты, готовить блюда, устанавливать цены и обслуживать клиентов, чтобы максимизировать итоговый капитал. Claude Opus 5 показал результат $75 264, ROI +3 663%, прибыль $71 876 и продал 8 434 порции. Расходы на API составили всего $26,88 при уровне рассуждений xhigh. Модель обошла лучший прогон GPT-5.5 на 13,6%, а GPT-5.6 Sol — на 41,4%. Sol, вопреки ожиданиям, оказался слабее GPT-5.5.

Предыстория и контекст

FoodTruck Bench был создан как альтернатива традиционным тестам на знание фактов или решение математических задач. Он проверяет способность модели к долгосрочному планированию, адаптации к меняющимся условиям и оптимизации в реальном времени. Предыдущие рекорды принадлежали моделям GPT-5.5 и GPT-5.6 Sol, но Claude Opus 5 значительно их превзошёл. Успех объясняется улучшенной архитектурой рассуждений и способностью модели эффективно распределять ресурсы, что критически важно в симуляциях с ограниченным бюджетом.

Как Claude Opus 5 добился такого результата?

Ключевой фактор — продвинутый механизм рассуждений xhigh. Модель анализирует каждый день отдельно, прогнозирует спрос, корректирует меню и цены, минимизируя потери. В отличие от конкурентов, Claude Opus 5 реже менял стратегию, но делал это более обоснованно. Например, он быстро выявил наиболее прибыльные блюда и сосредоточился на их производстве, снизив долю неэффективных позиций. Низкие расходы на API ($26,88) показывают, что модель достигает высоких результатов без избыточных вычислительных затрат.

Технические подробности и анализ

Claude Opus 5 использует архитектуру с усиленным вниманием к контексту и памятью на длинные последовательности решений. В FoodTruck Bench это позволило модели избегать типичных ошибок: перепроизводства, неправильного ценообразования и игнорирования сезонности. Для сравнения: GPT-5.5 тратил больше ресурсов на неоптимальные эксперименты, а GPT-5.6 Sol часто застревал в локальных оптимумах. Уровень рассуждений xhigh даёт Claude Opus 5 преимущество в задачах, требующих многошагового планирования.

Кого затронет и как

Разработчики ИИ-агентов для бизнеса, трейдинга и логистики могут использовать стратегии Claude Opus 5 как эталон. Компании, внедряющие ИИ в управление цепочками поставок или розничную торговлю, получат ориентир для оценки своих моделей. Для пользователей Claude Opus 5 это сигнал, что Anthropic продолжает удерживать лидерство в сложных симуляционных задачах. В России и СНГ пока нет прямых конкурентов, но результаты могут стимулировать локальные разработки.

Что будет дальше

Ожидается, что Anthropic выпустит официальный отчёт с деталями архитектуры Claude Opus 5. Конкуренты, включая OpenAI и Google DeepMind, вероятно, ускорят работу над аналогичными бенчмарками. FoodTruck Bench может стать стандартом для оценки стратегических способностей ИИ. В ближайшие месяцы появятся новые прогоны с участием других моделей, и возможно, рекорд будет побит.

Итог

Claude Opus 5 доказал превосходство в FoodTruck Bench, набрав $75 264 капитала с ROI +3 663%. Это не просто цифры — они показывают, как ИИ может эффективно управлять ресурсами в реальном времени. Следите за обновлениями бенчмарка: именно такие тесты определяют будущее прикладного искусственного интеллекта.