On digitalizing the analysis of food chemistry composition data

Abstract

The development of digital nutrition science, based on the application of artificial intelligence algorithms for the personalization of dietary recommendations, is hindered in the Russian Federation by the absence of a unified verified database of the chemical composition of foods. Such a resource should representatively reflect the current state of the agro-industrial complex and include products that form the basis of the diet of various demographic groups of the population.

The objective of the research was to develop a software-analytical complex for creating and verifying a national database of the chemical composition of food. The system being created will ensure the consolidation of data from heterogeneous sources on food raw materials, industrially produced products, and culinary dishes, forming a representative resource that reflects the structure of the actual nutrition of the population and the current product range.

Material and methods. The development of a three-tier software-analytical complex (MySQL 8.0, Python 3.13.3/Flask 2.0, HTML5/CSS3/JavaScript) involved the implementation and refinement of the following approaches: data collection (via web interface and REST API), data verification (using algorithms for missing value imputation, outlier detection, and k-means clustering), and the creation of algorithms to calculate the nutritional value of foods and dishes, accounting for technological losses. The system was validated against retrospective data from nutritional epidemiology studies.

Results. A software-analytical complex has been created, including three interconnected databases: the chemical composition of food raw materials and industrially produced foods, dishes and culinary products, as well as coefficients of losses during technological processing. Data verification algorithms were developed and implemented, including methods for processing missing values, detecting statistical outliers, and clustering. A module for calculating the nutritional value of ready-made dishes, taking into account technological losses, was created. Criteria for classifying data as verified were developed, including requirements for completeness of filling (≥95%), compliance with permissible value ranges, and consistency with reference values. Tools for calculating the nutritional value of ready-made dishes, taking into account technological losses, were created, including a methodology for selecting recipes considering regional dietary characteristics.

Conclusion. The developed software-analytical complex with a web interface is designed for managing data on the chemical composition of food. The system supports the full data lifecycle. Further development of the complex involves expanding the list of analyzed nutrients and integration with software for various purposes, including for dietitians, public catering specialists, diet calculations for organized groups, as well as applications for individual nutrition assessment and informing the population about the energy and nutritional value of diets. The implementation of the project will provide an evidence base for epidemiological research, the development of preventive measures for diet-related diseases, and the formation of a scientifically based state policy in the field of healthy nutrition.

Keywords: nutritional epidemiology; food chemical composition database; nutrient composition; intake assessment; digital nutrition science; data management system

Funding. The study was conducted under agreement 23-16-00242 with the Russian Science Foundation, https://rscf.ru/project/23-16-00242/

Conflict of interest. The authors declare no conflicts of interest.

Contribution. Study concept and design – Tutelyan V.A., Bessonov V.V., Smirnova E.A.; material processing and data analysis – Shakhvalieva E.S.-A., Keshabyants E.E., Shcherbakov G.D., Andronova M.S.; manuscript writing – Smirnova E.A., Shakhvalieva E.S.-A. All authors have read the results of the work and approved the final version of the manuscript.

For citation: Smirnova E.A., Bessonov V.V., Shakhvalieva E.S.-A., Shcherbakov G.D., Keshabyants E.E., Andronova M.S., Tutelyan V.A. On digitalizing the analysis of food chemistry composition data. Voprosy pitaniia [Problems of Nutrition]. 2025; 94 (6): 69–79. DOI: https://doi.org/10.33029/0042-8833-2025-94-6-69-79 (in Russian)

Современная наука о питании переживает трансформацию, движимую цифровизацией. Область знаний "цифровой нутрициологии" базируется на интеграции информационных технологий и сложных алгоритмов для преобразования данных о физиологических потребностях, химическом составе пищи и индивидуальных особенностях питания населения в персонализированные рекомендации по питанию [1-4]. Однако разработка надежных алгоритмов критически зависит от качества и репрезентативности исходных данных.

Краеугольным камнем объективной оценки питания служит точное описание и идентификация потребляемых пищевых продуктов с использованием стандартизированных баз данных химического состава (БДХС) [5, 6]. Эти базы данных играют важную роль в эпидемиологии питания. Они необходимы для анализа пищевого статуса населения, выявления дефицита эссенциальных нутриентов и определения основных пищевых источников избыточного потребления критически значимых для здоровья пищевых веществ, таких как добавленные сахара, соль (натрий), жир, насыщенные жиры и транс-изомеры жирных кислот [7-10]. Подобный ресурс должен адекватно отражать современные агропромышленные и пищевые технологии, а также включать продукты и кулинарные изделия, формирующие основу калорийности рационов различных возрастно-половых групп населения с учетом региональных и этнокультурных особенностей [11-14].

БДХС формируют доказательную основу для разработки рекомендаций по здоровому питанию, мер профилактики хронических неинфекционных заболеваний и таких инструментов политики в области питания, как установление норм физиологических потребностей, разработка рациональных норм (размеров) потребления основных групп пищевых продуктов и внедрение расширенной маркировки пищевой ценности, что в совокупности составляет основу государственной стратегии в области здорового питания населения.

В настоящее время в Российской Федерации отсутствует единая федеральная платформа, отвечающая этим требованиям. Этот пробел в исследовательской инфраструктуре ограничивает возможности для точного анализа данных эпидемиологических исследований питания.

В то же время значительный массив новых данных о содержании нутриентов и биологически активных веществ в пищевой продукции был накоплен в результате многолетних исследовательских программ, в том числе выполняемых Роспотребнадзором, ФГБУН "ФИЦ питания и биотехнологии" и другими научными учреждениями. Эти данные остро нуждаются в консолидации, стандартизации и верификации с использованием специализированного программно-аналитического комплекса.

Ключевым вызовом для популяционных исследований остается интеграция данных о домашнем питании. Разработка инструментов для сбора и валидации информации о составе и пищевой ценности блюд домашнего приготовления, включая традиционные и национальные, является необходимым условием для повышения точности оценки питания на уровне домохозяйств.

Цель данного исследования - разработка программно-аналитического комплекса с веб-интерфейсом для интеграции, обработки, хранения и верификации данных о химическом составе пищевых продуктов из разнородных источников. Создание данного комплекса направлено на решение ключевой научной задачи - формирование актуальной и верифицированной электронной базы данных, включающей сведения о химическом составе продовольственного сырья, пищевых продуктов промышленного производства, а также готовых блюд и кулинарных изделий, позволяющей репрезентативно отражать современное состояние агропромышленного комплекса и пищевых технологий, а также сложившуюся структуру питания населения.

Материал и методы

Для разработки программно-аналитического комплекса применяли методы системного анализа и программной инженерии. Архитектура системы построена по трехуровневой схеме, включающей базу данных (MySQL 8.0), сервер приложений (Python 3.13.3, Flask 2.0) и клиентский интерфейс (HTML5/CSS3/JavaScript).

Для обеспечения качества данных были установлены строгие критерии верификации, включающие требования к полноте заполнения данных (≥95%), соответствию допустимым диапазонам значений, отсутствию статистических аномалий и согласованности с референсными значениями.

Статистический анализ проводили с использованием методов описательной статистики и кластерного анализа с использованием SPSS v.20.0 и Python 3.13.3.

Валидация системы осуществлена на основе ретроспективных данных крупных эпидемиологических исследований "Выборочное наблюдение рационов питания населения Российской Федерации", выполненных Росстатом в 2018 и 2023 гг. (индивидуальные данные о питании, полученные методом 24-часового воспроизведения питания, общее число обследованных детей и взрослых составило 100 599 и 89 357 человек соответственно), а также на собственных данных ФГБУН "ФИЦ питания и биотехнологии", полученных в многоцентровом исследовании "Российский эпидемиологический мониторинг питания взрослого населения" в 2024 г. (385 взрослых) и 2025 г. (130 взрослых).

Результаты

Разработка архитектуры программно-аналитического комплекса для обработки, хранения, анализа и верификации данных химического состава пищевой продукции

Решение поставленной задачи потребовало создания IT-инфраструктуры для управления сложными массивами данных о химическом составе пищевой продукции. В рамках данного исследования представлена методология разработки программно-аналитического комплекса, направленного на решение ключевых проблем в исследовательской инфраструктуре через многоэтапный подход.

На первом этапе была создана концепция программного комплекса (рис. 1), включающая:

- проектирование системной архитектуры со стандартизированными классификаторами и кодификаторами пищевой продукции и блюд;

- разработку взаимосвязанных модулей для сбора данных, включая результаты лабораторных (аналитических) исследований, а также рецептов блюд и кулинарных изделий и их многоуровневой верификации;

- создание математических алгоритмов и критериев принятия решений для оценки качества данных и их интеграции в единую базу данных.

Второй этап был направлен на создание содержательного наполнения и реализацию аналитических функций:

- выявление приоритетных категорий пищевой продукции и блюд на основе их вклада в калорийность рациона населения, а также в поступление макро- и микронутриентов;

- внедрение расчетных алгоритмов для оценки пищевой ценности с возможностью обработки пользовательских рецептов;

- разработку компенсационных механизмов для учета потерь массы и пищевых веществ при обработке продовольственного сырья и приготовлении пищи.

Финальная фаза интеграции объединяет все компоненты в единую веб-платформу, включающую 3 специализированные базы данных: химического состава продовольственного сырья и пищевых продуктов промышленного производства, кулинарных изделий и коэффициенты потерь. Система содержит модульные интерфейсы ввода и протоколы верификации, поддерживающие полный жизненный цикл данных, - от сбора и валидации до анализа и хранения.

Модуль 1. Программный комплекс для сбора данных химического состава пищевых продуктов

В рамках решения задачи первичного накопления структурированных данных был разработан специализированный программный комплекс [15], обеспечивающий многоуровневый сбор информации о химическом составе пищевой продукции. Архитектура комплекса построена на принципах микросервисной организации, что позволяет обеспечить модульность, масштабируемость и отказоустойчивость системы.

Модуль ввода предназначен для регистрации обезличенных типовых данных, включая возможность ручного ввода результатов аналитических (лабораторных) исследований и обработку первичных протоколов. Параллельно функционирует модуль ввода брендированной продукции, ориентированный на работу с декларируемой производителями информацией. Для интеграции с внешними источниками предусмотрен модуль получения данных, осуществляющий взаимодействие со сторонними базами через программные интерфейсы REST API. Принципиальная схема модуля представлена на рис. 2.

Для практической реализации сбора данных разработан веб-интерфейс, позволяющий осуществлять ввод информации о пищевой ценности продукции. Интерфейс предусматривает выбор категории из иерархического классификатора, включающего 16 основных групп пищевой продукции, и последующее указание спектра показателей, включая энергетическую ценность, содержание макронутриентов, а также витаминов и минеральных веществ. Введенные данные сохраняются в структурированном формате, пригодном для последующего анализа и интеграции с другими компонентами программного комплекса.

В модуле реализована возможность выгрузки данных в формате баз данных, в том числе Microsoft Excel.

Модуль 2. Алгоритмы анализа и нормализации данных лабораторных исследований

Следующим критически важным этапом цифровизации является обеспечение качества и сопоставимости данных, получаемых из разнородных источников. Для решения этой задачи была разработана специализированная методика анализа и нормализации результатов лабораторных исследований, реализованная в виде веб-приложения на платформе R Shiny [16].

Методика включает 4 последовательных этапа обработки (рис. 3). Первоначальный этап анализа пропущенных значений направлен на идентификацию и обработку неполных данных. В условиях, когда различные лаборатории определяют неполный перечень показателей, применяется комбинированный подход: при незначительном количестве пропусков может осуществляться удаление соответствующих записей, тогда как при существенной доле пропущенных значений может быть использована импутация медианными значениями. Это позволяет минимизировать систематические смещения, неизбежно возникающие при искусственном восстановлении данных. Выбор комбинированного подхода (удаление записей при малом количестве пропусков и импутация медианными значениями при значительном) был сделан на основе сравнительного анализа методов [17- 20], который показал, что для результатов лабораторных исследований, где пропуски часто носят случайный характер, медианная импутация обеспечивает достаточную устойчивость и минимизирует смещение по сравнению с более сложными методами в условиях большой размерности данных. Такая функция может быть эффективно использована при обработке больших массивов информации, получаемых в ходе крупномасштабных мониторинговых исследований качества пищевой продукции, в том числе выполняемых Роспотребнадзором1. При этом сохраняется возможность накопления неполных данных для последующего обобщения, анализа и принятия решения о включении их в базу.

1 МР 2.3.7.0261-21 Рекомендации по алгоритму оценки достоверности и порядку анализа результатов мониторинговых исследований показателей качества отечественной продукции, способствующей устранению дефицита макро- и микронутриентов. Утверждены руководителем Роспотребнадзора, Главным государственным санитарным врачом А.Ю. Поповой 12.10.2021.

На этапе анализа выпадающих значений применяется правило 3 сигм, основанное на предположении о нормальном распределении содержания пищевых веществ в продуктах. Данное допущение подтверждается многочисленными научными исследованиями и является статистически обоснованным для большинства нутриентов. Несмотря на существование более робастных методов (например, на основе межквартильного размаха), правило 3 сигм было выбрано ввиду его простоты, интерпретируемости и подтвержденной эффективности для идентификации грубых ошибок в данных, распределение которых близко к нормальному [21]. Это особенно важно на начальном этапе очистки больших массивов данных, поступающих из множества источников. Выявление и последующее исключение статистических выбросов позволяет минимизировать влияние грубых ошибок измерения и некорректного ввода данных на итоговые результаты.

Особую роль играет модуль проверки данных, выполняющий функции контроля качества и достоверности поступающей информации. Данный модуль реализует алгоритмы оценки статистической значимости изменений, проверки корректности классификации продуктов и выявления дублирования записей. Все полученные и верифицированные сведения аккумулируются в централизованной БДХС, которая выступает в качестве единого хранилища знаний. Доступ к информации для различных категорий пользователей обеспечивается через гибкий пользовательский интерфейс, поддерживающий различные уровни детализации и аналитической агрегации.

Центральным элементом методики является этап кластеризации данных алгоритмом k-средних, направленный на выявление скрытых структур распределения показателей качества. Кластеризация осуществляется не по формальным признакам (торговое наименование, сортность), а на основе фактических значений химических показателей, что позволяет формировать статистически однородные группы продуктов для последующего анализа. Алгоритм k-средних был выбран для кластеризации после оценки альтернативных методов [иерархическая кластеризация, алгоритм плотностной кластеризации, устойчивый к шуму (Density-Based Spatial Clustering of Applications with Noise, DBSCAN)] на репрезентативных тестовых наборах данных. Сравнительный анализ показал, что k-средний демонстрирует наилучшее соотношение вычислительной эффективности, масштабируемости для больших объемов данных и интерпретируемости результатов [22-24]. В отличие от DBSCAN, он не требует задания параметра плотности, что затруднительно для разнородных по своей природе пищевых продуктов, а по сравнению с иерархической кластеризацией обладает значительно более высокой производительностью.

Завершающим этапом выступает нормализация данных, предназначенная для уменьшения влияния внутри- и межлабораторной вариабельности. Методология основана на преобразовании исходных значений показателей с использованием перцентильного подхода, где в качестве референсных значений используются 20-й и 80-й перцентили распределения. Это позволяет нивелировать систематические погрешности, связанные с использованием различного аналитического оборудования и разным уровнем квалификации персонала лабораторий, обеспечивая сопоставимость данных из разных источников. Использование 20-го и 80-го перцентилей в качестве референсных точек вместо более традиционных минимума/максимума или стандартных оценок (z-score) было обосновано необходимостью создания робастного метода, устойчивого к влиянию остаточных выбросов, которые могли не быть отфильтрованы на предыдущих этапах. Данный подход, известный как робастная стандартизация, широко рекомендуется в литературе [25, 26] для задач, где требуется снизить влияние экстремальных значений на итоговую шкалу.

Модуль 3. Модуль расчета энергетической ценности и химического состава блюд и кулинарных изделий

В рамках исследования разработан специализированный модуль для расчета энергетической ценности и химического состава кулинарных изделий на основе рецептур с учетом коэффициентов потерь при технологической обработке. Функциональные возможности модуля включают:

- ввод номенклатуры кулинарного изделия;

- формирование рецептуры с указанием ингредиентного состава и массы компонентов;

- выбор способа кулинарной обработки из систематизированной базы технологических процессов;

- автоматический расчет пищевой и энергетической ценности на 100 г готового продукта.

Алгоритм расчета реализует корректировку исходного химического состава сырьевых компонентов с применением коэффициентов потерь пищевых веществ в зависимости от выбранного способа тепловой или механической обработки. В тестовой версии модуль обеспечивает расчет основных нутриентов (белки, жиры, углеводы) и энергетической ценности, с перспективой расширения перечня рассчитываемых показателей за счет включения микронутриентов и биологически активных соединений.

В программный код были заложены следующие принципы и формулы:

1. Поиск введенного ингредиента по базе данных продовольственного сырья и пищевой продукции промышленного производства.

2. Поиск коэффициента потерь для каждого ингредиента в зависимости от вида кулинарной обработки в соответствующей базе данных (K).

3. Расчет количества каждого нутриента для ингредиентов (на примере энергии):

4. Расчет общего содержания нутриента для рецепта (на примере энергии):

Подобные формулы применяют к каждому нутриенту:

Разработанный модуль представляет собой инструмент для стандартизированной оценки пищевой ценности кулинарной продукции, обеспечивающий воспроизводимость результатов и сопоставимость данных в рамках проводимых исследований фактического питания.

Модуль 4. Базы данных

В состав программного комплекса входят 3 базы данных, включающие:

- базу данных химического состава продовольственного сырья и пищевой продукции промышленного производства;

- базу данных химического состава блюд и кулинарных изделий;

- базу данных потерь массы и пищевых веществ при механической или термической обработке.

Для формирования репрезентативной базы данных кулинарных изделий разработан многоуровневый алгоритм приоритизации, основанный на комплексном анализе данных эпидемиологических исследований и информации, полученной через специализированный онлайн-инструмент. Методология включала следующие критерии оценки:

- количественный анализ распространенности - вычисление интегрального показателя значимости рецепта на основе частоты упоминания в опросах и регулярности приготовления;

- региональная репрезентативность - определение географической и этнокультурной специфики рецептов с расчетом относительных рейтингов внутри каждой кулинарной традиции;

- нутриентная значимость - оценка вклада блюда в общую калорийность рациона целевых групп населения;

- кластеризация рецептур - идентификация уникальных рецептов методами машинного обучения с группировкой по ключевым параметрам: составу ингредиентов и способам кулинарной обработки.

Процедура интеграции в базу данных реализует автоматизированную категоризацию с проверкой на дубликаты, обновлением статистических показателей для существующих записей и пополнением базы новыми рецептурами с сохранением полной атрибутивной информации.

Разработанный алгоритм обеспечивает научно обоснованный отбор наиболее репрезентативных образцов кулинарных изделий для последующего анализа их химического состава.

Для точного расчета химического состава готовых кулинарных изделий и прогнозирования изменений пищевой ценности в процессе технологической обработки была разработана специализированная база данных "Потери пищевых веществ при механической или термической обработке пищевой продукции" [27]. БДХС, реализованная на платформе MySQL, представляет собой систему взаимосвязанных таблиц, содержащих детализированную информацию о величинах потерь массы и нутриентов.

Особенностью базы данных является интеграция информации из авторитетных международных и национальных источников. В структуру базы включены таблицы с данными из фундаментальных российских справочников под редакцией И.М. Скурихина, содержащих коэффициенты потерь для традиционных способов кулинарной обработки. Кроме того, система аккумулирует информацию из источников Министерства сельского хозяйства США (USDA), включая таблицы выхода продуктов и коэффициентов сохранности пищевых веществ.

База данных также содержит сведения из реестра организации Стандартов пищевых продуктов Австралии и Новой Зеландии (FSANZ) и материалы Европейской сети информационных ресурсов о пищевых продуктах (EuroFIR). Подобная многокомпонентная структура обеспечивает репрезентативность и достоверность информации, позволяя учитывать региональные особенности технологической обработки пищевой продукции.

Ключевым элементом базы является система кодификации видов кулинарной обработки, обеспечивающая унификацию и стандартизацию описания технологических процессов. Связи между таблицами позволяют осуществлять выборку величин потерь как по отдельным источникам с учетом конкретного вида сырья и способа обработки, так и получать усредненные значения на основе консолидированных данных. Это обеспечивает гибкость использования базы данных при решении различных прикладных задач - от расчета пищевой ценности готовых блюд до оптимизации технологических процессов с целью минимизации потерь нутриентов.

Методология интеграции верифицированных данных в базу химического состава пищевых продуктов

С целью объединения модулей в единый программный комплекс была разработана комплексная процедура интеграции новых верифицированных данных в существующую базу химического состава, обеспечивающая сохранение целостности и актуальности информации. Методология включала 4 последовательных этапа:

1. Аудит существующей базы данных с комплексным анализом структурной организации данных с оценкой форматов хранения, типов данных и системы идентификаторов, а также верификацией целостности существующих записей и их соответствия установленным стандартам.

2. Идентификация и удаление дублирующихся записей реализованы через алгоритмы детекции дубликатов на основе комбинации методов точного сопоставления (по уникальным идентификаторам) и анализа текстовой схожести с применением специализированных метрик. Разработаны критерии приоритизации записей при обнаружении противоречий.

3. Процедура интеграции новых данных и актуализация существующих включает многоуровневую систему верификации и сопоставления:

- структурный анализ поступающих данных и их источников;

- применение комбинированных алгоритмов сопоставления записей;

- протоколы разрешения конфликтующих значений;

- транзакционные механизмы обеспечения целостности данных;

- систему автоматизированного резервного копирования.

4. Для расширения перечня нутриентов реализованы процедуры пополнения базы данных новыми показателями химического состава с обеспечением совместимости с существующей структурой и методологией расчетов.

Предложенная методология обеспечивает систематическое обновление базы данных с минимальным риском потери информации и сохранением методологической согласованности, что соответствует требованиям современных исследований в области нутрициологии и пищевой безопасности.

Заключение

В настоящем исследовании реализована комплексная система управления данными о химическом составе пищевых продуктов, что обеспечивает прогресс в развитии цифровой нутрициологии в Российской Федерации. Разработанный программно-аналитический комплекс эффективно устраняет пробел в исследовательской инфраструктуре за счет создания единой верифицированной базы данных, репрезентативно отражающей современную структуру питания населения. Комплекс размещен на сайте ФГБУН "ФИЦ питания и биотехнологии" и доступен по ссылке https://ion.ru/nauka/baza-dannykh-khimicheskogo-sostava/.

Ключевым достижением работы стало создание интегрированной модульной архитектуры, объединяющей 3 специализированные базы данных. Научную и практическую ценность представляют разработанные алгоритмы многоуровневой верификации и нормализации данных, которые обеспечивают сопоставимость результатов из разнородных источников и минимизируют систематические погрешности, что в итоге позволяет применять разработанные алгоритмы для анализа результатов крупномасштабных мониторинговых исследований качества и химического состава пищевой продукции. Важным практическим достижением стало создание инструментов для расчета пищевой ценности готовых блюд с учетом технологических потерь, что особенно актуально для точной оценки домашнего питания.

Предложенная система обеспечивает полный жизненный цикл управления данными - от первичного сбора и верификации до комплексного анализа и долгосрочного хранения.

Реализация данного проекта создает прочную инфраструктурную основу для разработки научно обоснованных рекомендаций по питанию и мер профилактики алиментарно-зависимых заболеваний. Перспективы дальнейшего развития комплекса связаны с расширением перечня анализируемых нутриентов и интеграцией с программным обеспечением различного назначения, в том числе для врачей-диетологов и специалистов в области общественного питания, для расчетов рационов для организованных коллективов, а также приложений для индивидуальной оценки питания и информирования населения об энергетической и пищевой ценности рационов. Реализация проекта обеспечит доказательную основу для эпидемиологических исследований, разработки мер профилактики алиментарно-зависимых заболеваний и формирования научно обоснованной государственной политики в области здорового питания.

References

1. Tutel’yan V.A., Tarmaeva I.Yu., Kade M.A., Nikityuk D.B. Medicine of the future: the role of artificial intelligence in optimizing nutrition for the health of the Russian population. Voprosy pitaniia [Problems of Nutrition]. 2024; 93 (4): 6–13. DOI: https://doi.org/10.33029/0042-8833-2024-93-4-6-13 (in Russian)

2. Bessonov V.V., Bogachuk M.N., Bokov D.O., Makarenko M.A., Malinkin A.D., Sokurenko M.S., et al. Databases of the chemical composition of foods in the era of digital nutrition science. Voprosy pitaniia [Problems of Nutrition]. 2020; 89 (4): 211–9. DOI: https://doi.org/10.24411/0042-8833-2020-10058 (in Russian)

3. Moshfegh A.J., Rhodes D.G., Martin C.L. National food intake assessment: technologies to advance traditional methods. Annu Rev Nutr. 2022; 42: 401–422. DOI: https://doi.org/10.1146/annurev-nutr-062320-110636

4. Kapsokefalou M., Roe M., Turrini A., Costa H.S., Martinez-Victoria E., Marletta L., et al. Food composition at present: new challenges. Nutrients. 2019; 11 (8): 1714. DOI: https://doi.org/10.3390/nu11081714

5. Li Z., Forester S., Jennings-Dobbs E., Heber D. Perspective: a comprehensive evaluation of data quality in nutrient databases. Adv Nutr. 2023; 14 (3): 379–91. DOI: https://doi.org/10.1016/j.advnut.2023.02.005

6. Durazzo A., Astley S., Kapsokefalou M., Costa H.S., Mantur-Vierendeel A., Pijls L., et al. Food composition data and tools online and their use in research and policy: EuroFIR AISBL contribution in 2022. Nutrients. 2022; 14 (22): 4788. DOI: https://doi.org/10.3390/nu14224788

7. Fujiwara A., Omura Y., Oono F., Sugimoto M., Sasaki S., Takimoto H. A Scoping review of epidemiological studies on intake of sugars in geographically dispersed Asian countries: comparison of dietary assessment methodology. Adv Nutr. 2022; 13 (5): 1947–73. DOI: https://doi.org/10.1093/advances/nmac061

8. Liu Y., Cheng J., Wan L., Chen W. Total and added sugar intakes are increasing among children and adolescents in China: findings from CHNS 1997–2011. Nutrients. 2022; 14 (16): 3340. DOI: https://doi.org/10.3390/nu14163340

9. Zhong L., Blekkenhorst L.C., Bondonno N.P., Sim M., Woodman R.J., Croft K.D., et al. A food composition database for assessing nitrate intake from plant-based foods. Food Chem. 2022; 394: 133411. DOI: https://doi.org/10.1016/j.foodchem.2022.133411

10. Shaheen N., Basak Tukun A., Torab Ma Rahim A., Mohiduzzaman M., Islam S., Stadlmayr B., et al. Development of a new food composition table: an updated tool for estimating nutrient intake in Bangladeshi population. Food Chem. 2022; 395: 133544. DOI: https://doi.org/10.1016/j.foodchem.2022.133544

11. Carter M.C., Hancock N., Albar S.A., Brown H., Greenwood D.C., Hardie L.J., et al. Development of a new branded UK food composition database for an online dietary assessment tool. Nutrients. 2016; 8 (8): 480. DOI: https://doi.org/10.3390/nu8080480

12. Andrés-Hernández L., Blumberg K., Walls R.L., Dooley D., Mauleon R., Lange M., et al. Establishing a common nutritional vocabulary – from food production to diet. Front Nutr. 2022; 9: 928837. DOI: https://doi.org/10.3389/fnut.2022.928837

13. Jamieson J.A., Gill K., Fisher S., English M. Development of a Canadian food composition database of gluten-free products. Foods. 2022; 11 (15): 2215. DOI: https://doi.org/10.3390/foods11152215

14. Vijayakumar A., Dubasi H.B., Awasthi A., Jaacks L.M. Development of an Indian food composition database. Curr Dev Nutr. 2024; 8 (7): 103790. DOI: https://doi.org/10.1016/j.cdnut.2024.103790

15. Shakhvalieva E.S.-A., Andronova M.S., Smirnova E.A., Keshabyants E.E., Kudryavtseva K.V., Shcherbakov G.D., et al. Software complex for collecting food chemical composition data [Electronic resource]. Certificate of state registration of computer program No. 2025610194. Registered 09.01.2025. (in Russian)

16. Shcherbakov G.D., Bessonov V.V., Smirnova E.A., Keshabyants E.E., Tutel’yan V.A. Software complex for analyzing food chemical composition research results [Electronic resource]. Certificate of state registration of computer program No. 2023687055. Registered 11.12.2023. (in Russian)

17. Kigo S.N., Omondi E.O., Omolo B.O. Assessing predictive performance of supervised machine learning algorithms for a diamond pricing model. Sci Rep. 2023; 13 (1): 17315. DOI: https://doi.org/10.1038/s41598-023-44326-w

18. Casella M., Milano N., Dolce P., Marocco D. Transformers deep learning models for missing data imputation: an application of the ReMasker model on a psychometric scale. Front Psychol. 2024; 17 (15): 1449272. DOI: https://doi.org/10.3389/fpsyg.2024.1449272

19. Li J., Guo S., Ma R., He J., Zhang X., Rui D., et al. Comparison of the effects of imputation methods for missing data in predictive modelling of cohort study datasets. BMC Med Res Methodol. 2024; 24 (1): 41. DOI: https://doi.org/10.1186/s12874-024-02173-x

20. Baumgartner M., Kuhn C., Nakas C.T., Herzig D., Bally L. Carbohydrate estimation accuracy of two commercially available smartphone applications vs estimation by individuals with type 1 diabetes: a comparative study. J Diabetes Sci Technol. 2025; 19 (6): 1570–7. DOI: https://doi.org/10.1177/19322968241264744

21. Coucke W., China B., Delattre I., Lenga Y., Van Blerk M., Van Campenhout C., et al. Comparison of different approaches to evaluate External Quality Assessment Data. Clin Chim Acta. 2012; 413 (5-6): 582–6. DOI: https://doi.org/10.1016/j.cca.2011.11.030

22. Starczewski A., Cader A. Determining the eps parameter of the DBSCAN algorithm. In: L. Rutkowski, R. Scherer, M. Korytkowski, W. Pedrycz, R. Tadeusiewicz, J. Zurada (eds). Artificial Intelligence and Soft Computing. ICAISC 2019 (Book series: Lecture Notes in Computer Science. Vol. 11509). Cham: Springer, 2019: 420–30. DOI: https://doi.org/10.1007/978-3-030-20915-5_38 Print ISBN: 978-3-030-20914-8; Online ISBN: 978-3-030-20915-5.

23. Latifi-Pakdehi A., Daneshpour N. DBHC: A DBSCAN-based hierarchical clustering algorithm. Data Knowledge Eng. 2021; 135 (1): 101922. DOI: https://doi.org/10.1016/j.datak.2021.101922

24. Ng H.T., Ibrahim H., Rajendran P. Statistical-based methods to improve precision of DBSCAN clustering algorithm for obstacle detection application in autonomous vehicles. Multimed. Tools Appl. 2025. DOI: https://doi.org/10.1007/s11042-025-20986-w

25. Rahnenführer J., De Bin R., Benner A., Ambrogi F., Lusa L., Boulesteix A.L., et al. Statistical analysis of high-dimensional biomedical data: a gentle introduction to analytical goals, common approaches and challenges. BMC Med. 2023; 21 (1): 182. DOI: https://doi.org/10.1186/s12916-023-02858-y

26. Zhang X., Lee J., Wen Bin Goh W. An investigation of how normalisation and local modelling techniques confound machine learning performance in a mental health study. Heliyon. 2022; 8 (5): e09502. DOI: https://doi.org/10.1016/j.heliyon.2022.e09502

27. Andronova M.S., Shakhvalieva E.S.-A., Keshabyants E.E., Kudryavtseva K.V., Shcherbakov G.D., Smirnova E.A., Tutel’yan V.A. Losses of nutrients during mechanical and thermal processing of foods [Electronic resource]. Certificate of state registration of computer program No. 2025620084. Registered 09.01.2025. (in Russian)

All articles in our journal are distributed under the CC BY-NC-ND 4.0 (Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International)

© GEOTAR-Media Publishing Group. The use of textual and illustrative content from this publication for the training of any artificial intelligence systems - including machine learning models and neural networks - is strictly prohibited without the prior written consent of the copyright holder.

SCImago Journal & Country Rank
Scopus CiteScore
CHIEF EDITOR
CHIEF EDITOR
Viktor A. Tutelyan
Full Member of the Russian Academy of Sciences, Doctor of Medical Sciences, Professor, Scientific Director of the Federal Research Centre of Nutrition, Biotechnology and Food Safety (Moscow, Russia)

Journals of «GEOTAR-Media»