چرا یک ایجنت کدنویس کافی نیست
خلاصهٔ کاملتر
نویسنده میگه رایجترین شکست توی کدنویسی با ایجنت این نیست که کد خراب دربیاد؛ اینه که ایجنت یک اسپک دقیق رو میگیره، چیزی میسازه که کامل به نظر میرسه، گزارش موفقیت میده و چند تا از خواستهها رو بیصدا جا میندازه. به گفتهٔ نویسنده جواب این مشکل مدل بهتر نیست، بلکه یک گردشکاره که توش نقشها از هم جدا میشن.
این گردشکار سه نقش داره. اول planner یا auditor: یک مدل با توان استدلال بالا اسپک اصلی رو کنار کدبیس فعلی میذاره و گزارش میده چی کم مونده و کجا از اسپک فاصله گرفته. بعد implementer، که معمولاً مدل ارزونتر و سریعتریه، همون فهرست رو برمیداره و اصلاحها رو مینویسه. آخر هم verifier، ترجیحاً مدلی غیر از مجری، که خودش برنامه رو اجرا و رفتارش رو تست میکنه، نه اینکه فقط کد رو بخونه.
تو یک نمونهٔ عملی، یک اپ آموزشی دربارهٔ اندامهای بدن، مرحلهٔ ممیزی فهمید که یکی از خواستههای اولیه یعنی افکت ذرات درخشان کلاً حذف شده، در حالی که ایجنت سازنده کار رو تمامشده اعلام کرده بود. قاعدهای که نویسنده ازش بیرون میکشه اینه: اگه با مدلهای یک لابراتوار پیادهسازی کردی، با مدل لابراتوار دیگه تأیید کن، چون مدلهای یک خانواده نقطهکورهای مشترک دارن.
چسبی که این کارو عملی میکنه ACP هست، یعنی Agent Communication Protocol؛ استانداردی که به IDE اجازه میده همزمان به چند ایجنت مختلف وصل بشه، از Codex و Claude Code و Cursor گرفته تا Kimi CLI. هر ایجنت کنترلهای خودش رو داره: انتخاب مدل، سطح تلاش استدلالی، و دامنهٔ دسترسی که میتونه کامل، فقطخواندنی، یا پرسیدن قبل از هر اقدام باشه. برای پاس ممیزی، استدلال بالا و دسترسی فقطخواندنی منطقیه.
دو چیز دیگه هم توی IDE هست که یک ایجنت CLI خالی نداره: به اشتراک گذاشتن context ادیتور، یعنی فایلهای باز و چیزی که همین الان روش کار میکنی، و دیدن هر تغییر به شکل diff قابل بازبینی. نویسنده قبول داره که این روش اولش کندتره و برای اسکریپت یکبارمصرف ارزشش رو نداره، ولی برای فیچری که واقعاً به دست کاربر میرسه، «ایجنت گفت تموم شد» بهتنهایی سیگنال قابل اعتمادی نیست.
نکات کلیدی:
- الگوی اصلی سه نقشه: planner/auditor، implementer، verifier؛ و ناظر باید مدلی غیر از مجری باشه.
- ACP هر IDE سازگار رو به Codex، Claude Code، Cursor و Kimi CLI وصل میکنه، بدون قفل شدن روی یک فروشنده.
- دموی مقاله روی PyCharm اجرا شده، با ترکیب Codex و Claude Code و Kimi CLI.
- پاس دوم تأیید، بعد از اصلاحها، باز هم ایراد باقیمونده پیدا کرد؛ پس اولین «خوبه» آخرین حرف نیست.
- برای کنترل هزینه، مدل ارزونتر مثل K2 در Kimi CLI پیادهسازی رو برمیداره و مدل قویتر ممیزی رو.




