Grok 4.3 رسماً معرفی شد؛ هوشمندتر و ارزانتر
خلاصهٔ کاملتر
xAI تازهترین مدل خودش یعنی Grok 4.3 رو رسماً لانچ کرد. این مدل در شاخص هوشمندی Artificial Analysis Intelligence Index امتیاز ۵۳ گرفته و در رنکینگ کلی، درست بالاتر از Muse Spark و Claude Sonnet 4.6 قرار داره. نسبت به نسخه قبلی یعنی Grok 4.20، حدود ۴ امتیاز جلوتره.
یکی از مهمترین نکات این انتشار اینه که Grok 4.3 همزمان هم هوشمندتر شده و هم ارزونتر. قیمت توکن ورودی ۳۷.۵٪ و قیمت توکن خروجی ۵۸.۳٪ کمتر شده. در نتیجه اجرای کامل بنچمارکهای Intelligence Index با این مدل حدود ۳۹۵ دلار هزینه داره که حدود ۲۰٪ از نسخه قبلی کمتره. این یعنی Grok 4.3 روی مرز پارتو (Pareto Frontier) هوشمندی در برابر هزینه نشسته؛ یعنی برای سطح هوشمندیی که داره، یکی از مقرونبهصرفهترین مدلهای موجوده.
بزرگترین جهش Grok 4.3 در بخش تسکهای عاملی دنیای واقعی (Agentic Tasks) بوده. در بنچمارک GDPval-AA که روی کارهای واقعی تمرکز داره، امتیاز ELO این مدل به ۱۵۰۰ رسیده؛ یعنی ۳۲۱ امتیاز بیشتر از Grok 4.20 که ۱۱۷۹ داشت. با این رشد، Grok 4.3 از مدلهایی مثل Gemini 3.1 Pro Preview، Muse Spark، GPT-5.4 mini و Kimi K2.5 جلو زده. البته هنوز با GPT-5.5 (xhigh) فاصله داره و احتمال برد در مقابلش حدود ۱۷٪ تخمین زده میشه.
در بخش پیروی از دستورالعملها (Instruction Following)، Grok 4.3 روی بنچمارک τ²-Bench Telecom به ۹۸٪ رسیده که ۵ امتیاز بهتر از قبله و همرده با GLM-5.1 میشه. امتیاز IFBench هم ۸۱٪ حفظ شده.
یه نکته جالب اینه که Grok 4.3 حدود ۴۴٪ توکن خروجی بیشتری نسبت به Grok 4.20 مصرف میکنه، ولی با وجود این، هنوز هم از خیلی از مدلهای پیشرفته دیگه کمحرفتره (less verbose). مصرف توکنش مشابه مدلهایی مثل Minimax M2.7 هست.
در بخش دانش و توانایی پاسخدهی، Grok 4.3 در AA-Omniscience Accuracy هشت امتیاز بهتر شده، ولی در عوض نرخ عدم توهمزایی (Non-Hallucination Rate) هشت امتیاز پایینتر رفته. یعنی مدل گاهی با اعتماد بیشتری جواب میده، ولی ممکنه بعضی مواقع اطلاعات اشتباه هم بده. در این بخش Grok 4.20 هنوز بهتره.
در مقایسه با رقبا، این مدل جایگاه خوبی داره؛ بین Claude Sonnet 4.6 و بالاتر از Muse Spark قرار میگیره. برای تیمهایی که دنبال تعادل بین هوشمندی و هزینه هستن، Grok 4.3 میتونه یه گزینه جدی باشه.
نکات کلیدی:
- امتیاز ۵۳ در شاخص Artificial Analysis Intelligence Index؛ ۴ امتیاز بهتر از Grok 4.20
- قیمت توکن ورودی ۳۷.۵٪ و خروجی ۵۸.۳٪ کاهش یافته
- هزینه اجرای کامل بنچمارکها حدود ۳۹۵ دلار؛ ۲۰٪ کمتر از نسخه قبلی
- رشد ۳۲۱ امتیاز ELO در GDPval-AA؛ بزرگترین پیشرفت مدل
- امتیاز τ²-Bench Telecom به ۹۸٪ رسیده
- نرخ توهمزایی نسبت به Grok 4.20 کمی بالاتر رفته
- هنوز با GPT-5.5 (xhigh) در بخش تسکهای عاملی فاصله قابل توجهی داره




