OmniFood-Bench: новый бенчмарк выявил опасные ошибки ИИ в оценке питания
Исследователи разработали бенчмарк OmniFood-Bench для проверки мультимодальных языковых моделей в задачах питания. Тесты показали, что современные ИИ-системы отлично распознают блюда, но допускают серьёзные ошибки в оценке порций и дают опасные рекомендации людям с диабетом. Это ставит под вопрос го

Исследователи разработали бенчмарк OmniFood-Bench для проверки мультимодальных языковых моделей в задачах питания. Тесты показали, что современные ИИ-системы отлично распознают блюда, но допускают серьёзные ошибки в оценке порций и дают опасные рекомендации людям с диабетом. Это ставит под вопрос готовность ИИ к автономному использованию в диетологии и персонализированной медицине.
Как устроен OmniFood-Bench
OmniFood-Bench — это новый инструмент для оценки больших мультимодальных языковых моделей (VLM) в контексте питания. Бенчмарк построен на основе датасета MM-Food-100K, который содержит изображения блюд с подробными аннотациями. В отличие от существующих тестов, которые проверяют лишь распознавание еды, OmniFood-Bench оценивает цепочку рассуждений: от определения скрытых ингредиентов до синтеза рекомендаций с учётом здоровья.
Бенчмарк включает три уровня способностей. Первый — базовое восприятие: модель должна назвать ингредиенты и способ приготовления. Второй — количественные рассуждения: оценить размер порции и рассчитать нутритивный профиль. Третий — безопасные рекомендации: дать совет человеку с определённым заболеванием, например диабетом или гипертонией.
Какие модели тестировали и что обнаружили
В эксперименте участвовали шесть современных VLM, включая gpt-5.1, gemini-3-flash и qwen3-vl-8B. Результаты оказались неожиданными. Модели достигли почти человеческой точности в названии блюд — здесь ошибки были минимальны. Однако, как только речь зашла о количественных оценках, начались проблемы.
Исследователи выявили «семантико-физический разрыв»: ИИ легко оперирует терминами, но не понимает физических величин. Например, модель может правильно назвать «тарелку супа», но оценить её массу в 50 граммов вместо реальных 300. Такие ошибки критичны для диетологии, где точность порции напрямую влияет на расчёт калорий и нутриентов.
Ещё более тревожный результат — галлюцинации в рекомендациях. Для профилей с высоким риском диабета модели часто предлагали безобидные, но потенциально опасные советы, например, «добавьте сахар для вкуса». Это показывает, что современные VLM не готовы к автономному использованию в медицине.
Почему это важно для здоровья и безопасности
Ошибки ИИ в оценке питания могут иметь серьёзные последствия. Люди с диабетом, аллергиями или хроническими заболеваниями полагаются на точные данные о еде. Если приложение для отслеживания питания неправильно оценит порцию или даст неверный совет, это может привести к ухудшению состояния.
Текущие бенчмарки, такие как Food-101 или UECFood-256, проверяют только классификацию блюд. Они не учитывают контекст: размер тарелки, скрытые ингредиенты, способ приготовления. OmniFood-Bench впервые системно оценивает эти аспекты, делая тестирование более реалистичным.
Какие риски для пользователей приложений питания?
Пользователи приложений для отслеживания питания могут столкнуться с неточными данными. Например, если модель ошибается в оценке порции, приложение покажет неверное количество калорий. Это может нарушить диету или план лечения. Особенно опасно для людей, которые используют ИИ для контроля сахара в крови или веса.
Разработчики таких приложений должны учитывать результаты OmniFood-Bench. Даже если модель отлично распознаёт еду, её количественные оценки могут быть ненадёжны. Поэтому необходима дополнительная валидация и, возможно, гибридные системы, где ИИ сочетается с ручным вводом.
Кого затронут результаты исследования
Результаты OmniFood-Bench важны для нескольких групп. Разработчики VLM, планирующие применять модели в здравоохранении и диетологии, должны пересмотреть подходы к обучению. Исследователи в области ИИ и компьютерного зрения получат новый инструмент для тестирования. Пользователи приложений для отслеживания питания должны быть осторожны и не полагаться полностью на ИИ. Регуляторы, оценивающие безопасность ИИ-систем в медицине, получат доказательства необходимости строгих тестов.
Что остаётся неясным
В препринте не указаны точные показатели ошибок для каждой модели. Также не проведено сравнение с человеком-экспертом по всем задачам. Остаётся неясным, насколько хорошо модели справляются с реальными фотографиями еды в дикой природе, а не только с датасетом MM-Food-100K. Код и датасет доступны по анонимной ссылке, что может затруднить верификацию. Тем не менее, работа задаёт важное направление для будущих исследований.
Как улучшить ИИ для оценки питания
Чтобы преодолеть «семантико-физический разрыв», исследователи предлагают несколько подходов. Во-первых, обучать модели на данных с точными физическими измерениями, например, с указанием массы порции. Во-вторых, использовать цепочки рассуждений, где модель сначала оценивает размер тарелки, затем объём, и только потом массу. В-третьих, внедрять проверку на галлюцинации для рекомендаций, особенно для уязвимых групп.
OmniFood-Bench может стать стандартом для оценки VLM в питании. Он уже доступен для скачивания, и разработчики могут протестировать свои модели. Это поможет сделать ИИ безопаснее и точнее в такой важной сфере, как здоровье человека.