هارنس ایجنتها داره از قاب مدل به رابط توجه آدمها تبدیل میشه
خلاصهٔ کاملتر
نویسندهی این پست، Dan McAteer، میگه یه جایی حوالی کریسمس ۲۰۲۵ مهندسهای هوش مصنوعی متوجه شدن که ایجنتها یهو دارن درست کار میکنن. دلیلش دقیق مشخص نیست؛ شاید مدلها از یه آستانهی توانایی رد شدن، شاید هم harness (یعنی همهچیزی غیر از وزنهای مدل که دور و برش رو میسازه: محیط، ابزارها، حافظه و قوانین دسترسی) بالغتر شده. نویسنده استدلال میکنه هر دو با هم اتفاق افتادن و منحنی رشدشون درست همون موقع همدیگه رو قطع کردن.
برای نشون دادن این تلاقی، نویسنده تاریخچهی هارنس رو مرحله به مرحله میره. اول ReAct (اکتبر ۲۰۲۲) که فقط یه روش پرامپتنویسی برای مدل بود، نه چیز واقعی. بعد نوبت AutoGPT/BabyAGI (بهار ۲۰۲۳) میرسه؛ اونجا هارنس خیلی جلوتر از توانایی واقعی مدلها میره و بهشون استقلال کامل میده، در حالی که مدلها هنوز خیلی شکننده بودن. نویسنده مثال میزنه: اگه هر قدم یه کار ۲۰ مرحلهای ۹۵٪ درست باشه، کل کار فقط حدود ۳۶٪ وقتها موفق میشه - یعنی خطاها روی هم تلنبار میشن.
بعدش نوبت Cursor/Copilot (۲۰۲۳ تا ۲۰۲۴) میرسه که هارنس رو عقب میکشن و آدم رو تو حلقهی تصمیمگیری نگه میدارن؛ اولین نسخهی Devin هم که دوباره استقلال کامل رو امتحان کرد فقط حدود ۱۵٪ موفق بود. اواخر ۲۰۲۴ با اومدن مدل استدلالی o1، این رابطه برعکس میشه: مدل از هارنس جلو میزنه.
Claude Code (فوریه ۲۰۲۵) دقیقاً همین لحظه رو میقاپه - دسترسی ترمینال و فایل رو مستقیم به مدل میده و بهجای تایید تکتک تغییرات، قوانین دسترسی از پیش تعریفشده میذاره. همین محصول تو شش ماه به درآمد سالانهی حدود ۱ میلیارد دلار رسید.
الان، به گفتهی نویسنده، تو دورهای هستیم که مدل و هارنس با هم آموزش میبینن. آزمایش Harness-Bench یه مدل ثابت رو روی ۱۰۶ تسک با هارنسهای مختلف امتحان کرد و نتیجه بین ۵۲.۴ تا ۷۶.۲ درصد نوسان داشت - بدون اینکه خود مدل عوض بشه. OpenAI هم با تغییر هارنس (نگه داشتن استدلال و فشردهسازی حافظه) امتیاز GPT-5.6 Sol رو تو ARC-AGI-3 از ۱۳.۳٪ به ۳۸.۳٪ رسوند. نتیجهش اینه که وقتی یه قابلیت جذب مدل میشه، مهندسها میتونن حذفش کنن؛ نویسنده میگه تیم Claude Code اخیراً ۸۰٪ از پرامپت سیستمیشو حذف کرده.
نویسنده میگه وقتی هارنس هرچی که مدل میتونه جذب کنه رو از دست بده، چیزی که میمونه قابلیتهای انسانمحوره: مجوزها، هویت، اعتماد و شفافیت. یعنی هارنس دیگه رابط بین آدم و مدل نیست، بلکه رابط بین ایجنت و توجه محدود آدمه. نویسنده پیشبینی میکنه ظرف یه سال هر شرکتی که ایجنت میسازه یه سند شبیه AGENTS.md ولی برای توجه انسان منتشر میکنه - چیزی که مشخص میکنه ایجنت کِی حق داره مزاحم آدم بشه و کدوم تصمیمها به تایید نیاز داره.
نکات کلیدی:
- تعریف هارنس: همهچیز بهجز وزنهای مدل که دور و برش رو میسازه - محیط، ابزار، حافظه و قوانین دسترسی.
- آزمایش Harness-Bench نشون داد یه مدل ثابت روی ۱۰۶ تسک با هارنسهای مختلف بین ۵۲.۴ تا ۷۶.۲ امتیاز گرفته.
- OpenAI با تغییر هارنس امتیاز GPT-5.6 Sol تو ARC-AGI-3 رو از ۱۳.۳٪ به ۳۸.۳٪ رسوند.
- Claude Code تو فوریه ۲۰۲۵ عرضه شد و تو شش ماه به درآمد سالانهی حدود ۱ میلیارد دلار رسید.
- به گفتهی نویسنده، تیم Claude Code اخیراً ۸۰٪ از پرامپت سیستمیشو حذف کرده.
- نویسنده پیشبینی میکنه ظرف یه سال هر شرکت ایجنتساز یه سند شبیه AGENTS.md برای مدیریت توجه انسان منتشر میکنه.




