Kapan Anda Membutuhkan Ini
Pencatatan makanan manual adalah tempat di mana kebiasaan nutrisi yang baik berakhir. Untuk mencatat sepiring kari ayam dengan cara lama, pengguna mencari "kari ayam," menggulir daftar, menebak ukuran porsi, dan mengulangi untuk setiap item di piring. Ini akurat secara teori namun dalam praktiknya ditinggalkan — gesekan yang ada lebih besar daripada motivasi.
Kamera mempersingkat semua itu. Arahkan ponsel ke makanan, dan beberapa detik kemudian resep yang cocok dengan nutrisi lengkap siap untuk dicatat. Pola ini menjadi relevan ketika pengambilan data adalah penghalang antara pengguna dan nilai produk Anda — ketika "cukup ambil foto" dapat menggantikan entri manual yang berjenjang. Ini adalah jenis masalah yang sangat sesuai dengan area di mana layanan pengembangan AI MicrocosmWorks beroperasi: mengubah model yang mampu secara teknis menjadi sebuah pipeline yang menghilangkan gesekan nyata.
Gambaran Umum Pola
Sebuah foto menjadi makanan yang tercatat dan terkuantifikasi dalam empat tahap:
- Ambil — memotret atau memilih gambar; optimalkan di perangkat sebelum diunggah.
- Lihat — model visi mengidentifikasi hidangan, diekspresikan sebagai istilah pencarian berperingkat daripada label mentah.
- Cocokkan — istilah-istilah tersebut mendorong pencarian resep yang peringkatnya mewarisi kepercayaan model.
- Catat — pengguna memilih resep, melihat bahan dan nutrisi, memilih kuantitas, dan menyimpannya.
Ide kuncinya: visi dan pencarian bukanlah sistem terpisah yang disatukan. Model visi diminta untuk menghasilkan persis apa yang diinginkan mesin pencari, dan mesin pencari memercayai urutan yang dihasilkan model. Perbedaan antara "apa yang kami tampilkan" dan "apa yang ada di foto" menghilang.
Arsitektur Referensi
Pengambilan, dioptimalkan di perangkat. Gambar diubah ukurannya menjadi lebar ~512px dan dikompresi hingga kualitas JPEG ~40% sebelum diunggah — API visi memiliki batas ukuran yang ketat, dan foto mentah dari ponsel melebihi batas tersebut. Server menerapkan batas 2MB sebagai pengaman.
Lihat: model menulis pencarian. Gambar dikirim ke GPT-4o. Prompt meminta lima nama resep yang dapat dicari, disusun dari yang paling yakin hingga yang paling umum sebagai fallback—menamai hidangan secara keseluruhan, bukan toppingnya—bukan "makanan apa ini?" Sebuah burger dikembalikan sebagai:
["cheeseburger", "beef burger", "cheese burger", "hamburger", "burger"]Cocokkan: kepercayaan menjadi relevansi. Kelima nama tersebut dijalankan sebagai satu pencarian "match-any" terhadap indeks resep Elasticsearch, masing-masing membawa boost berbobot posisi (50× hingga 5×). Resep berjudul Cheeseburger mengungguli Burger generik bukan dari statistik teks, tetapi karena model lebih percaya diri. Lima istilah yang dicocokkan dengan OR berarti pengguna hampir selalu melihat sesuatu; boosts mendorong perkiraan terbaik ke atas.
Catat: kartu resep menjadi makanan terkuantifikasi. Bahan-bahan — disimpan sebagai teks biasa, referensi terkurasi, dan referensi eksternal FatSecret — dinormalisasi menjadi satu daftar yang bersih. Pengguna memilih unit dan kuantitas; kalori dan makro dihitung secara langsung dan makanan disimpan ke log mereka.
Jalur kedua untuk bahan mentah. Ketika tidak ada hidangan untuk dicari, API pengenalan makanan khusus mengembalikan nutrisi secara langsung — lebih murah dan lebih cocok daripada model visi umum. Aplikasi mengarahkan berdasarkan niat.
Keputusan Desain & Pertimbangan
Arahkan model ke format input sistem berikutnya. Nama-nama yang diberi peringkat dan dapat dicari — bukan label bentuk bebas — membuat serah terima menjadi bersih. Prompt adalah bagian dari kontrak; kami memperlakukannya sebagai kode, bukan teks.
Jaring yang lebar lebih baik daripada satu tebakan terbaik. Lima istilah yang dicocokkan dengan OR secara dramatis mengurangi "tidak ada hasil ditemukan", dengan biaya hasil yang kadang-kadang kurang relevan lebih jauh di daftar.
Optimalkan gambar di tempatnya berada. Kompresi di perangkat menghemat waktu unggah dan menghindari batas API, dengan biaya dependensi sisi klien yang kecil — layak untuk keandalan seluler di dunia nyata.
Model yang tepat, pekerjaan yang tepat. Model visi umum unggul dalam "hidangan apa ini?" dan terlalu berlebihan untuk "berapa kalori dalam apel ini." Dua jalur mengontrol biaya dan meningkatkan hasil.
Degradasi secara jujur. Tidak ada deteksi, tidak ada kecocokan — aplikasi mengatakannya dengan jelas dan menawarkan pencarian manual daripada berpura-pura atau merusak alur.
Pembatas seperti rate limiting, batas unggah, dan graceful failure hanya akan bertahan jika infrastruktur di bawahnya dibangun untuk itu — jenis fondasi yang dibangun oleh layanan infrastruktur cloud MicrocosmWorks.
Kapan Menggunakannya — dan Kapan Menghindarinya
Gunakan pola ini ketika pengambilan manual adalah penghalang nyata, foto dapat menggantikan entri multi-langkah, Anda memiliki katalog untuk dicocokkan, dan "cukup baik, instan" mengalahkan "sempurna, pada akhirnya." Hindari ketika domain membutuhkan akurasi tingkat laboratorium, tidak ada katalog untuk dicocokkan, biaya API visi lebih besar daripada keterlibatan yang diperoleh, atau input terlalu ambigu secara visual untuk diidentifikasi dengan andal.
Pendekatan Kami
Naluri dengan computer vision adalah mengejar model yang menamai makanan dengan sempurna. Daya ungkit sebenarnya ada di tempat lain: pada bagaimana output visi terhubung ke semua hal di hilir. Arahkan model untuk berbicara bahasa mesin pencari, biarkan kepercayaannya menjadi peringkat, normalisasi kekacauan di balik layar — dan semuanya dapat dilakukan dengan beberapa ketukan. Kemenangannya bukanlah pengklasifikasi yang lebih pintar; melainkan sebuah pipeline tanpa celah.
Membangun sesuatu yang serupa? Jelajahi solusi AI agent MicrocosmWorks atau hubungi kami untuk membahas arsitektur pipeline Anda.
Blog Lainnya
1. Pencarian Resep Personal: Retrieval yang Tahu Apa yang Seharusnya Anda Makan Selanjutnya
2. Menskalakan Platform Kesehatan Digital dengan Microservices
3. Menyinkronkan Apple Health & Health Connect

