← Все статьи
Продукт Август 2026 · 6 мин чтения

Как AI распознаёт еду на фото: от снимка до калорий и БЖУ

Короткий ответ: когда вы фотографируете тарелку, приложение выполняет четыре шага подряд — отделяет еду от фона, называет каждую позицию, оценивает её количество и находит нутриенты для этого количества. Первые два шага сейчас очень надёжны; в третьем, оценке порции по плоскому изображению, живёт основная часть ошибки; а четвёртый целиком зависит от качества базы. Несколько слов контекста («куриная грудка, примерно 150 г, с рисом») сокращают итоговую ошибку примерно вдвое, потому что чинят второй и третий шаг сразу.

Почему это сложнее, чем кажется

Человек, взглянувший на тарелку, проделывает те же четыре шага не задумываясь — и чаще всего ошибается. В исследовании с двумя тысячами участников средний человек угадывал калорийность с точностью 20% всего 5 раз из 20. Обученные разметчики справлялись не лучше. Дело не в сообразительности, а в том, что одно изображение действительно не содержит достаточно данных. Глубина, плотность, скрытые масло и соус, разница между жирным и обезжиренным — всё это камере не видно.

Распознавание не решает эту проблему. Оно делает оценку быстрее, стабильнее и удобнее для исправления.

Шаг 1: сегментация — найти еду

Сначала модель делит изображение на области: тарелка, стол, руки и каждая отдельная позиция. Современная сегментация справляется даже с перекрывающимися продуктами, но теряет точность, когда составляющие перемешаны, а не лежат рядом, — рагу, карри, буррито со всем внутри. Если модель не может обвести рис, она не может его измерить.

Что ломает шаг: мало света, смазанность, съёмка под острым углом и блюда, где всё перемешано.

Шаг 2: классификация — назвать найденное

Каждая область сопоставляется с моделью, обученной на миллионах размеченных снимков еды. На распространённых продуктах — жареная курица, белый рис, брокколи, яичница — точность высокая. Ошибки собираются вокруг двойников:

  • бедро против грудки (разная жирность)
  • белый рис против ризотто против цветной капусты «под рис»
  • жирный йогурт против обезжиренного
  • сливочное масло против маргарина против спреда
  • подслащённые напитки против неподслащённых
  • региональные блюда, которые модель видела реже

Большинство приложений в 2026 году выполняют этот шаг на большой мультимодальной модели, а не на узком классификаторе, что улучшило охват необычных и региональных блюд, но не решило проблему двойников — жирность модель по-прежнему не видит.

Что ломает шаг: внешне похожие продукты, редкие кухни, еда под соусом или украшением.

Шаг 3: оценка порции — сколько там

Это самая трудная часть и главный источник ошибки. Модель должна вывести трёхмерный объём из двумерного изображения без масштабной линейки. Она опирается на подсказки — размер тарелки, вилка, рука, типичная форма порции, — но миска риса сверху выглядит одинаково, лежит в ней 150 г или 300 г.

Исследования оценки порций стабильно показывают, что этот шаг вносит наибольший вклад в ошибку. В одном краудсорсинговом исследовании добавление эталонного предмета вроде банковской карты сделало человеческие оценки хуже, что показывает, насколько объём противоречит интуиции.

Помогают две вещи:

  • Видео вместо одного кадра. Двухсекундная панорама даёт несколько ракурсов и позволяет рассуждать о глубине. Именно для этого в CalMePlease есть видеозапись.
  • Названное количество. «Примерно чашка» или «150 г» снимает вопрос полностью.

Что ломает шаг: глубокие миски, еда горкой, съёмка строго сверху, порции больше ожидаемых.

Шаг 4: поиск нутриентов — превратить продукт и количество в цифры

Опознанный продукт и оценённый вес сопоставляются с базой и разворачиваются в калории, белок, углеводы, жиры и — в приложениях, которые их ведут, — клетчатку, сахар, соль и прочее.

Этот шаг настолько хорош, насколько хороша база. «Куриное карри» попадает в очень разные записи в зависимости от сливок, масла и сахара. В краудсорсинговой базе есть неверные записи; в кураторской — отсутствующие. Лучшие приложения берут проверенную основу и позволяют модели подстроиться под то, что она видит (жирное, сливочное, сухое).

Что ломает шаг: общие записи для блюд с большим разбросом, ресторанная еда со скрытыми жиром и сахаром, упакованные продукты, которые следовало отсканировать.

Как ошибки складываются

Каждый шаг передаёт свою ошибку дальше. Промах в 10% по порции, подмена двойником, меняющая жирность на 30%, и общая запись в базе дают итог на 30–40% мимо — поэтому два приложения могут смотреть на одну тарелку и расходиться на треть.

Опубликованные цифры для всей цепочки: примерно 15–30% средней ошибки при оценке только по изображению на реальной еде, около 14% при добавлении короткого описания. Одиночные простые продукты у нижней границы, смешанные блюда у верхней.

Почему одно предложение контекста так важно

Короткая заметка текстом или голосом чинит два худших шага одним движением:

  • «куриная грудка» снимает вопрос классификации (грудка, не бедро)
  • «примерно 150 г» снимает вопрос порции
  • «с оливковым маслом» добавляет невидимый жир

Фотография по-прежнему делает работу по опознанию всего на тарелке; предложение исправляет две вещи, которых снимок не видит. Поэтому CalMePlease построен вокруг фото плюс голосовой заметки на вашем языке, а не вокруг одного снимка. Исследования говорят, что это сочетание и есть практический потолок точности без весов.

За пределами цифры: что приложение с ней делает

Распознавание заканчивается на четвёртом шаге. Дальше приложения расходятся.

Большинство счётчиков прибавляет калории к дневной сумме и на этом останавливается. CalMePlease передаёт все десять показателей — включая клетчатку, сахар и соль, которые большинство фото-приложений пропускает, — AI-коучу, который читает день целиком и говорит, что съесть дальше. Цепочка распознавания — это вход; советы — это продукт. Оценка, ошибающаяся на 20%, но приводящая к «вам не хватает белка, добавьте на ужин», полезнее идеальной цифры, на которую никто не реагирует.

Может ли распознавание работать на устройстве?

Некоторые приложения выполняют части цепочки прямо на телефоне, и тогда снимок его не покидает. В 2026 году цена этого — точность: модели на устройстве меньше и хуже справляются с необычной едой. Большинство приложений, включая CalMePlease, обрабатывают изображение на сервере и хранят получившуюся историю локально. Для приватности важно, что остаётся: CalMePlease держит историю приёмов пищи, вес и статистику на устройстве и не продаёт и не передаёт данные.

Частые вопросы

Откуда приложение знает калорийность по фотографии? Оно опознаёт каждый продукт, оценивает его вес по изображению и находит калорийность на грамм в базе. Все три шага — оценки; вес самый ненадёжный.

Почему два приложения дают разные калории по одному снимку? Разные модели классификации, разные допущения о порциях и разные базы. Ошибки каждого шага складываются.

Работает ли распознавание на домашней еде? Да, лучше, чем поиск по базе: AI называет составляющие, которые иначе пришлось бы искать по одной. Добавьте заметку про масло или соус для более близкой цифры.

Может ли AI распознать еду по видео? Да. Видео даёт несколько ракурсов, что улучшает оценку порции. CalMePlease принимает короткие ролики.

Достаточно ли распознавания для похудения? Для регулярного учёта да. Случайные ошибки усредняются за неделю; важно записывать каждый приём пищи и поправлять очевидные промахи. См. Насколько точен подсчёт калорий по фото?


Читайте также: Запись еды голосом · Сканер штрихкодов для калорий: о чём молчит этикетка

CalMePlease записывает еду по фото, видео, голосом или штрихкодом и считает десять показателей за приём пищи. Бесплатно в App Store.

Читать дальше
Продукт

Запись еды голосом: вести дневник питания, не печатая

Готовы попробовать?

Сканируйте, чтобы установить
Скачать в App Store