سه راه متفاوت برای بردن LLM توی جستوجو
خلاصهٔ کاملتر
سه شرکت بزرگ سفارش غذا — دورداش، اینستاکارت و اوبر ایتس — تو یه بازهٔ زمانی نزدیک به هم جستوجوشون رو دور LLM بازسازی کردن. تو این مقاله اومده که هر سه دنبال یه مسئلهٔ مشترک بودن: فهمیدن نیت کاربر از چیزی که تو نوار جستوجو تایپ میکنه. با این حال معماریهایی که آخرش بالا آوردن کاملاً با هم فرق داره، و نویسنده میگه سؤال اصلی این نیست که کدوم مدل، بلکه اینه که LLM چقدر عمیق باید تو مسیر اجرا بشینه.
جستوجوی غذا برای این بررسی نمونهٔ خوبیه، چون همهٔ نقطهضعفهای جستوجوی کلیدواژهای همزمان اونجا خودشونو نشون میدن: مترادفها (soda و soft drink)، غلط املایی، سرواژههایی مثل gf pizza، ابهام چندزبانه (کلمهٔ pan تو اسپانیایی یعنی نان)، کوئریهای دنبالهٔ بلند که خیلی کم تکرار میشن، و قیدهای سختی مثل «ساندویچ مرغ وگان» که بازیابی مبتنی بر شباهت بهراحتی نقضشون میکنه.
دورداش از قبل یه گراف دانش از آیتمها و رستورانها داشت، برای همین LLM رو کنار مسیر اجرا نگه داشت: آفلاین برای غنیکردن گراف، و در زمان اجرا فقط برای تکهتکه کردن کوئری به قیدهایی که به فیلدهای گراف وصل میشن — مثلاً «بدون شیر» میشه فیلتر سخت dairy-free. نکتهٔ جالبش اینه که RAG اینجا نقش نردهمحافظ داره نه تولیدکننده؛ مدل فقط از بین ۱۰۰ مفهوم نزدیکِ تاکسونومی یکی رو انتخاب میکنه و حق نداره برچسب جدید بسازه. حاصلش حدود ۳۰٪ رشد نرخ فعالشدن کاروسلهای غذای محبوب بود.
اینستاکارت مسئلهٔ دیگهای داشت: یه LLM آماده وقتی protein رو میبینه مرغ و توفو و گوشت پیشنهاد میده، ولی کاربر اینستاکارت دنبال پودر و بار پروتئینه. راهحلشون سهلایهست — تزریق زمینهٔ اختصاصی با RAG، فیلتر شباهت معنایی روی خروجی، و فاینتیون Llama-3-8B روی دادهٔ خودشون. کوئریهای پرتکرار از مسیر آفلاین و کش میآن و کوئریهای دنباله به مدل فاینتیونشدهٔ بلادرنگ با تأخیر زیر ۳۰۰ میلیثانیه میرسن. پوشش بازنویسی کوئری از ۵۰٪ به بالای ۹۵٪ رفت.
اوبر ایتس یه پیچیدگی اضافه داشت: چند عمودی (رستوران، خواروبار، خردهفروشی)، چند بازار و چند زبان، با مدلهای امبدینگ BERT جدا برای هرکدوم. جوابشون یه معماری دوبرجی بود که هر دو برجش یه Qwen فاینتیونشده رو بهعنوان لایهٔ امبدینگ دارن؛ برج کوئری آنلاین کار میکنه و برج سند آفلاین میلیاردها سند رو از قبل توی ایندکس برداری HNSW میریزه. با MRL و کوانتیزهکردن، تأخیر و حجم ذخیرهسازی تقریباً نصف شد.
نکات کلیدی:
- سؤال اصلی «کدوم مدل» نیست، اینه که LLM چقدر عمیق تو مسیر اجرا بشینه
- دورداش: LLM آفلاین برای غنیکردن گراف دانش، مسیر اجرا همچنان کلاسیک
- اینستاکارت: LLM تو لایهٔ فهم کوئری، کش برای سر توزیع و مدل فاینتیونشده برای دنباله
- اوبر ایتس: LLM فاینتیونشده خودش مدل امبدینگ بازیابیه
- جای هر شرکت روی این طیف رو زیرساخت قبلیش تعیین کرده، نه انتخاب مدل
- سیستمها همهجا هیبریدن و نردهمحافظها بخش جداییناپذیر هر سیستم LLM تولیدیان




