GPT-5.6 Sol اولین مدلیه که یه بازی ARC-AGI-3 رو برد
خلاصهٔ کاملتر
OpenAI خانوادهٔ جدید مدلهای GPT-5.6 رو معرفی کرده که سه مدل داره: Sol، Terra و Luna، با ۱۵ حالت استدلالی مختلف. طبق نتایج منتشرشده توسط ARC Prize، مدل شاخص این خانواده Sol هست و با بالاترین سطح تلاش استدلالی (Max) تنها مدل قدرتمند تا جولای ۲۰۲۶ محسوب میشه که روی مجموعهٔ عمومی بهطور میانگین ۱۳٫۳۳ درصد و روی نیمهخصوصی ۷٫۷۸ درصد گرفته.
مهمترین دستاورد اینه که Sol اولین مدلیه که تونسته یه بازی عمومی ARC-AGI-3 رو ببره؛ بازی ft09 رو با ۸۷ درصد. این بنچمارکها یه مجموعه محیط تعاملی و بازیگونهان که میسنجن یه مدل چقدر میتونه تو یه محیط کاملاً ناآشنا خودش رو پیدا کنه و درست عمل کنه، نه اینکه فقط دانش قبلیش رو تکرار کنه.
تحلیل ARC میگه راز کار Sol تو اجرای بهتر نیست، بلکه تو جهتگیری درسته. Sol میتونه یه صحنهٔ ناآشنا رو درست بخونه و با واژگان خود همون بازی توصیفش کنه. وقتی یه فرضیه شکست میخوره، بهجای اینکه دستوپا بزنه، اون شکست رو بهانهای برای برنامهریزی دوباره میبینه. به گفتهٔ ARC، بیشتر شکستهای عاملهای هوش مصنوعی بالادستِ کدی که مینویسن یا کاری که انجام میدن اتفاق میافته؛ یعنی مشکل از بدفهمیدن محیطه، نه از بد اجرا کردن.
نتایج تأییدشده هم اختلاف بین مدلها و بین سطوح استدلال رو خوب نشون میده. Sol با حالت Max روی ARC-AGI-1 حدود ۹۶٫۵ درصد و روی ARC-AGI-2 حدود ۹۲٫۵ درصد میگیره، ولی همین مدل روی ARC-AGI-3 فقط به ۷٫۸ درصد میرسه؛ که نشون میده این نسل بنچمارک چقدر سختتره. هرچی سطح تلاش استدلالی پایینتر میاد، امتیازها هم بهشدت افت میکنن.
مقایسهٔ سه مدل هم روشنه: Terra و مخصوصاً Luna روی ARC-AGI-3 عملاً نزدیک صفر میمونن و فقط Sol با حداکثر تلاش تونسته از این سد رد شه. جمعبندی این نتایج اینه که پیشرفت واقعی این نسل نه تو قدرت خام، بلکه تو توانایی «درست فهمیدن محیط قبل از عمل» اتفاق افتاده.
نکات کلیدی:
- OpenAI سه مدل GPT-5.6 با نامهای Sol، Terra و Luna منتشر کرد
- Sol با حالت Max اولین مدلیه که یه بازی عمومی ARC-AGI-3 (ft09) رو با ۸۷ درصد برد
- برتری Sol از جهتگیری درست تو محیط ناآشنا میاد، نه اجرای بهتر
- روی ARC-AGI-3 حتی بهترین مدل هم فقط حدود ۷٫۸ درصد میگیره؛ بنچمارک خیلی سختیه
- افت شدید امتیاز با کمشدن سطح تلاش استدلالی نشون میده استدلال چقدر تعیینکنندهست




