MicrocosmWorksInnover et Architecturer le Cosmos Numérique
Ă€ proposContact
MicrocosmWorksInnover et architecturer des cosmos numériques

Fournir des solutions informatiques qui comptent. Nous sommes passionnés par la technologie, la sécurité et aidons les entreprises à croître grâce à une infrastructure informatique fiable et innovante.

[email protected]
+91 7011868196
New Delhi, India

Hub de Croissance IA

Hub IAInnovation pour les startupsAccélérateur d'entreprise

Solutions

Toutes les solutionsApplications de bien-être et de fitnessPlateforme vidéo IADéveloppement d'agents IA

Ressources

PerspectivesGuides de l'industriePlans d'utilisationModèles d'architectureÉtudes de cas

Entreprise

Ă€ propos de nousContactNotre travail

Services

Consultation numériqueInfrastructure cloudDéveloppement SaaSDéveloppement IATechnologie vidéo
Développement ERPPersonnalisation ZohoDéveloppement OdooIntégration SalesforceDéveloppement CRM personnalisé
Intégration QuickBooksSolutions IoTDéveloppement Blockchain
Consultation en cybersécuritéSupport IT - L3

© 2026 MicrocosmWorks. Tous droits réservés.

Politique de confidentialitéConditions d'utilisation
Retour aux Perspectives
AI Development

Photographiez une assiette, enregistrez un repas : Un pipeline de nutrition par vision par ordinateur

Un pipeline de vision par ordinateur qui reconnaît les aliments à partir d'une photo et les enregistre auprès d'une API de nutrition.

Untitled (612 x 640 px).webpNishant Panchal
•
August 20, 2026
•
Mis Ă  jour August 29, 2026
•
5 min read
ChatGPT Image Aug 17, 2026, 06_13_19 PM (1).webp
5 min read

Quand vous en avez besoin

L'enregistrement manuel des aliments est l'endroit où les bonnes habitudes alimentaires vont mourir. Pour enregistrer une assiette de poulet au curry à l'ancienne, un utilisateur recherche "poulet au curry", fait défiler une liste, devine une taille de portion et répète l'opération pour chaque élément de l'assiette. C'est précis en théorie et abandonné en pratique — le frottement l'emporte sur la motivation.

L'appareil photo simplifie tout cela. Pointez un téléphone vers un repas, et quelques secondes plus tard, des recettes correspondantes avec une nutrition complète sont prêtes à être enregistrées. Ce modèle trouve sa place lorsque la capture de données est la barrière entre les utilisateurs et la valeur de votre produit — lorsque "il suffit de prendre une photo" peut remplacer une saisie manuelle en plusieurs étapes. C'est le genre de problème qui se situe précisément dans l'espace où opèrent les services de développement AI de MicrocosmWorks : transformer un modèle techniquement capable en un pipeline qui élimine de réelles frictions.

 

Aperçu du Modèle

Une photo devient un repas enregistré et quantifié en quatre étapes :

  1. Capture — photographier ou choisir une image ; l'optimiser sur l'appareil avant l'envoi.
  2. Voir — un modèle de vision identifie le plat, exprimé en termes de recherche classés plutôt qu'en étiquettes brutes.
  3. Faire correspondre — ces termes pilotent une recherche de recettes dont le classement hérite de la confiance du modèle.
  4. Enregistrer — l'utilisateur choisit une recette, voit les ingrédients et la nutrition, sélectionne une quantité et l'enregistre.

L'idée clé : la vision et la recherche ne sont pas des systèmes séparés et juxtaposés. Le modèle de vision est invité à produire exactement ce que le moteur de recherche souhaite, et le moteur de recherche fait confiance à l'ordre produit par le modèle. La distinction entre "ce que nous montrons" et "ce qui est sur la photo" disparaît.

 

Architecture de Référence

Capture, optimisée sur l'appareil. Les images sont redimensionnées à environ 512px de large et compressées à environ 40% de qualité JPEG avant l'envoi — les API de vision ont des plafonds de taille stricts, et une photo brute de téléphone les dépasse. Le serveur applique une limite de 2MB comme filet de sécurité.

Voir : le modèle écrit la recherche. L'image est envoyée à GPT-4o. L'invite demande cinq noms de recettes recherchables, classés du plus confiant au moins spécifique (le plat dans son ensemble, pas ses garnitures)—au lieu de "quel est cet aliment ?". Un burger est renvoyé comme suit :

["cheeseburger", "beef burger", "cheese burger", "hamburger", "burger"]

Faire correspondre : la confiance devient pertinence. Les cinq noms sont exécutés comme une recherche "match-any" contre un index de recettes Elasticsearch, chacun portant un boost pondéré par la position (50× jusqu'à 5×). Une recette intitulée Cheeseburger surclasse un Burger générique non pas grâce aux statistiques textuelles, mais parce que le modèle était plus confiant. Cinq termes OR-matched signifient que l'utilisateur voit presque toujours quelque chose ; les boosts propulsent la meilleure estimation en haut.

Enregistrer : de la fiche recette au repas quantifié. Les ingrédients — stockés en texte brut, références sélectionnées et références externes FatSecret — sont normalisés en une liste propre. L'utilisateur choisit une unité et une quantité ; les calories et les macros sont calculées à la volée et le repas est enregistré dans son journal.

Une deuxième piste pour les ingrédients bruts. Quand il n'y a pas de plat à rechercher, une API de reconnaissance alimentaire dédiée retourne la nutrition directement — moins chère et mieux adaptée qu'un modèle de vision général. L'application se route en fonction de l'intention.

 

Décisions de Conception & Compromis

Inviter le modèle à s'adapter au format d'entrée du système suivant. Des noms classés et recherchables — pas des étiquettes de forme libre — facilitent le transfert. L'invite fait partie du contrat ; nous la traitons comme du code, pas du texte.

Un large filet vaut mieux qu'une seule meilleure estimation. Cinq termes OR-matched réduisent considérablement les "aucun résultat trouvé", au prix de quelques résultats vaguement liés plus bas dans la liste.

Optimiser l'image là où elle se trouve. La compression sur l'appareil économise le temps d'envoi et évite les limites des API, au prix d'une petite dépendance côté client — cela en vaut la peine pour la fiabilité mobile dans le monde réel.

Bon modèle, bon travail. Un modèle de vision général excelle à identifier "quel est ce plat ?" et est excessif pour "combien de calories dans cette pomme ?". Deux pistes contrôlent les coûts et améliorent les résultats.

Dégrader honnêtement. Pas de détection, pas de correspondance — l'application le dit clairement et propose une recherche manuelle plutôt que de faire semblant ou de rompre le flux.

Les garde-fous comme la limitation de débit, les plafonds d'envoi et l'échec gracieux ne tiennent que si l'infrastructure sous-jacente est conçue pour cela — le genre de fondation que les services d'infrastructure cloud de MicrocosmWorks sont conçus pour fournir.

 

Quand l'utiliser — et quand l'éviter

Utilisez ce modèle lorsque la capture manuelle est la véritable barrière, qu'une photo peut remplacer une saisie en plusieurs étapes, que vous avez un catalogue à faire correspondre, et que "suffisamment bon, instantanément" l'emporte sur "parfait, éventuellement". Évitez-le lorsque le domaine nécessite une précision de laboratoire, qu'il n'y a pas de catalogue à faire correspondre, que les coûts de l'API de vision l'emportent sur l'engagement gagné, ou que les entrées sont trop ambiguës visuellement pour être identifiées de manière fiable.

 

Notre Approche

L'instinct avec la vision par ordinateur est de courir après un modèle qui nomme parfaitement l'aliment. Le véritable levier est ailleurs : dans la façon dont la sortie de vision se connecte à tout ce qui suit. Invitez le modèle à parler le langage du moteur de recherche, laissez sa confiance devenir le classement, normalisez le désordre en coulisses — et le tout se résume à quelques tapotements. La victoire n'est pas un classificateur plus intelligent ; c'est un pipeline sans couture.

Vous construisez quelque chose de similaire ? Explorez les solutions d'agents AI de MicrocosmWorks ou contactez-nous pour discuter de l'architecture de votre pipeline.

 

Autres Blogs

1. Recherche de recettes personnalisée : Une récupération qui sait ce que vous devriez manger ensuite

2. Mise Ă  l'Ă©chelle d'une plateforme de santĂ© numĂ©rique avec des microservices 

3. Synchroniser Apple Health et Health Connect


 

Computer VisionNutritionImage RecognitionAI
Untitled (612 x 640 px).webp

Ă€ propos de l'auteur

Nishant Panchal

AI & Cloud Solutions Expert at MicrocosmWorks

Building innovative AI-powered solutions and helping businesses transform through cutting-edge technology.

Vous souhaitez en savoir plus ?

Contactez-nous pour discuter de la façon dont nous pouvons vous aider à mettre en œuvre ces solutions pour votre entreprise.

Contactez-nous

Questions Fréquemment Posées

The pipeline uses GPT-4o to identify the dish and generate five ranked, searchable recipe names based on its confidence.

The AI-generated food names are sent to Elasticsearch as search terms, with higher-confidence results receiving stronger ranking boosts.

The pipeline identifies the food, finds a matching recipe, retrieves its nutrition data, and calculates calories and macros based on the user's selected quantity.

When no reliable match is found, the system reports the failure clearly and provides manual food search instead of returning an inaccurate result.

A general vision model is used to identify complete dishes, while a dedicated food-recognition API handles raw ingredients and direct nutrition lookup more efficiently.

Comments (0)

Share your thoughts and join the conversation

Leave a Comment

Your email will not be published

No comments yet

Be the first to share your thoughts!