دیپسیک V4-Pro-0813؛ نسخهٔ نهایی رسید
خلاصهٔ کاملتر
دیپسیک نسخهٔ نهایی مدل کدنویسیش رو با اسم DeepSeek-V4-Pro-0813 بیرون داد؛ یه مدل open-weight (یعنی وزنهای مدل عمومی منتشر شده و خودت میتونی اجراش کنی) با لایسنس MIT که جای نسخهٔ Preview رو میگیره. طبق مدلکارت خودِ دیپسیک، این نسخه تو تکتک بنچمارکهای فهرستشده از Preview جلو زده و خودش رو تو ردهٔ مدلهای بسته مثل Opus-4.8 جا کرده.
مقایسه با Opus-4.8 یه الگوی مشخص داره. تو HLE (آزمون دانش و استدلال عمومی) بدون ابزار، Opus-4.8 با ۴۹.۸ جلوئه و دیپسیک ۴۲.۷ گرفته؛ ولی وقتی ابزار در دسترس باشه ورق برمیگرده و دیپسیک با ۶۰.۰ از ۵۷.۹ رد میشه. تو NL2Repo (تبدیل خواستهٔ متنی به تغییر واقعی روی کل ریپو) و DSBench-Hard هم Opus بالاتره، اما دیپسیک تو Terminal Bench 2.1، Cybergym و AutomationBench جلوئه. یعنی هرچی کار به ترمینال و اتوماسیون نزدیکتر بشه، دیپسیک رقابتیتره.
بین بقیهٔ رقبا، Kimi K3 نزدیکترین حریفه: تو Terminal Bench 2.1 با ۸۸.۳ در برابر ۸۷.۹، تو DeepSWE با ۶۷.۵ در برابر ۶۲.۷ و تو Toolathlon-Verified جلوئه، و دیپسیک فقط تو Cybergym و AutomationBench ازش جلو میزنه. GLM-5.2 تقریباً همهجا عقبه و مثلاً DeepSWEش ۴۶.۲ ثبت شده. Fable-5 هم بالاترین نمرهٔ HLE جدول رو داره، ولی چون خیلی از خونههاش خالی مونده نمیشه تصویر کاملی ازش ساخت.
نکتهٔ عملی این نسخه DSpark ـه، روش speculative decoding خودِ دیپسیک (یعنی یه بخش سبک چند توکن جلوتر رو حدس میزنه و مدل اصلی همه رو یکجا تأیید میکنه، بهجای تولید توکنبهتوکن). فرقش با روش معمول اینه که چکپوینت جداگانه برای مدل draft نمیخواد و وزنها از همون فایل مدل میان. روشن کردنش هم فقط یه فلگه: تو vLLM با --speculative-config و تو SGLang با --speculative-algorithm DSPARK. یعنی تیمها دیگه لازم نیست دو تا چکپوینت جدا رو نگه دارن و همنسخه نگهشون دارن.
حرف اصلی مدلکارت اما فاصله با نسخهٔ Preview ـه: Terminal Bench از ۷۲.۱ به ۸۷.۹، Cybergym از ۵۲.۷ به ۸۳.۳ و DeepSWE از ۱۲.۸ به ۶۲.۷ رسیده، یعنی بیشتر از چهار برابر. نویسنده یادآوری میکنه که این عددها با هارنس خودِ دیپسیک و تنظیمات max reasoning effort گرفته شده، پس مقایسهٔ مستقیمشون با عددهای اعلامی بقیهٔ آزمایشگاهها باید با احتیاط خونده بشه.
نکات کلیدی:
- Terminal Bench 2.1: نمرهٔ ۸۷.۹ برای V4-Pro-0813، در برابر ۸۵.۰ برای Opus-4.8 و ۸۸.۳ برای Kimi K3
- نمرهٔ HLE با ابزار ۶۰.۰ و بدون ابزار ۴۲.۷
- DeepSWE از ۱۲.۸ در نسخهٔ Preview به ۶۲.۷ رسیده
- DSpark بدون چکپوینت جدا کار میکنه و با یه فلگ تو vLLM و SGLang روشن میشه
- لایسنس MIT، و حداکثر طول خروجی پیشنهادی ۳۸۴K توکن در سطوح high و max




