مسیریابی مدلهای هوش مصنوعی در API Gateway گوگل کلاود
خلاصهٔ کاملتر
به گفتهٔ تیم گوگل کلاود، وقتی داری اپ هوش مصنوعی میسازی معمولاً میخوای ترافیک رو به بهترین مدل برای هر کار بفرستی، ولی تا حالا یا باید اندپوینتها رو هاردکد میکردی یا یه پروکسی اوپنسورس نگه میداشتی. حالا API Gateway قابلیت model routing رو تو حالت Public Preview آورده: یه لایهٔ ingress سبک و سرورلس که درخواستهای سازگار با OpenAI رو قبول میکنه و پویا به Gemini، Claude یا GPT اوپنسورس میفرسته.
مسیریابی رو تو همون OpenAPI 3.x spec تعریف میکنی. یه بلوک جدید به اسم x-google-api-management اضافه شده که توش بکاندها رو با آدرس و deadline معرفی میکنی و بعد روترها رو میسازی؛ هر روتر یه defaultModel داره و چندتا rule که اسم مدل درخواستی رو به بکاند مربوطه نگاشت میکنن. بعد هر path با x-google-model-router به یکی از این روترها وصل میشه.
routers:
gemini-claude-router:
defaultModel:
backend: gemini-35-flashlite
targetModel: google/gemini-3.5-flash-lite
rules:
- model: "claude-opus-4-7"
backend: anthropic-claude-opus-47بعد از دیپلوی کردن کانفیگ، اپلیکیشن فقط یه درخواست استاندارد OpenAI به مسیری مثل /v1/chat/gemini-claude میفرسته و فیلد model تعیین میکنه کدوم بکاند جواب بده. خود Gateway پیلود رو به اسکیمای بومی اون بکاند ترجمه میکنه و درجا مسیرش میده. یه محدودیت مهم هم هست: همهٔ بکاندهای یک روتر باید روی یک هاست مشترک باشن، یعنی مسیریابی بین هاستهای متفاوت انجام نمیشه.
تو این مقاله اومده که API Gateway رو هم میشه مستقل و فقط برای rate limiting و شمردن توکن به کار برد، هم کنار Gemini Enterprise Agent Platform؛ مثلاً خروجی ایجنت رو از Agent Gateway رد کنی تا حاکمیت امنیتی سفتوسخت داشته باشی و بعد درخواست رو بدی به API Gateway که مسیریابی پویا رو انجام بده.
نکات کلیدی:
- model routing تو API Gateway گوگل کلاود الان بهصورت Public Preview در دسترسه
- درخواستهای سازگار با OpenAI بر اساس نام مدل به Gemini، Claude یا GPT اوپنسورس مسیر داده میشن
- قوانین مسیریابی تو بلوک x-google-api-management داخل OpenAPI 3.x تعریف میشن
- همهٔ بکاندهای یک روتر باید روی یک هاست مشترک باشن
- میشه مستقل برای rate limiting و ردیابی توکن یا کنار Agent Gateway ازش استفاده کرد




