چالش بعدی هوش مصنوعی؛ کارهایی که نمیشه راستیآزمایی کرد
خلاصهٔ کاملتر
نویسنده با نقل حرف Dario Amodei، مدیرعامل Anthropic، شروع میکنه که میگه ۹۰٪ مطمئنه ظرف ده سال به «یه کشور از نابغهها تو دیتاسنتر» میرسیم؛ و اون ۱۰٪ عدمقطعیتش برمیگرده به کارهایی که نمیشه راستیآزماییشون کرد، مثل برنامهریزی یه ماموریت به مریخ یا نوشتن یه رمان.
به گفتهٔ نویسنده، دلیل اصلی پیشرفت سال گذشته یادگیری تقویتی با پاداش قابلبررسی یا همون RLVR بوده. ایدهش سادهست: به مدل یه مسئله میدی که جوابشو میتونی چک کنی، میذاری استدلال کنه تا به جواب برسه، و تلاشهایی که به جواب درست میرسن رو تقویت میکنی. ریاضی و کد بهترین گزینهان چون پاداش تمیز و ارزونه و میشه میلیونها بار اجراش کرد. نتیجهش هم پیشرفت رو SWE-bench و رسیدن OpenAI و Google DeepMind به سطح مدال طلای المپیاد ریاضی بوده.
نویسنده به «قانون راستیآزما»ی Jason Wei اشاره میکنه: راحتی آموزش دادن یه کار به AI تقریباً متناسبه با اینکه اون کار چقدر قابلبررسیه. مشکل اینجاست که بیشتر کارهای باارزش راحت قابلبررسی نیستن؛ برای یه memo یا طراحی خوب، یا ساختن یه کسبوکار که افق زمانی بلند و بازخورد دنیای واقعی میخواد، هیچ test suite ای وجود نداره. پس سوال کلیدی اینه: وقتی نمیتونی جواب رو راحت چک کنی، پاداش از کجا میاد؟
نویسنده چند تکنیک رو معرفی میکنه. اولیش rubric بهعنوان پاداش هست: برای هر پرامپت یه چکلیست از کارهایی که یه جواب خوب باید بکنه میسازی و یه داور LLM هر تلاش رو باهاش نمره میده. این کار جواب میده چون سوال بزرگِ «این خوبه؟» رو میشکنه به کلی سوال کوچیک بله/خیر مثل «X رو گفته؟ از Y دوری کرده؟». Scale AI روی بنچمارک پزشکی HealthBench تا ۳۱٪ بهبود نسبی گزارش کرده. دو تکنیک دیگه هم مدلهای پاداش مولد (که اول استدلال میکنن بعد نمره میدن) و مدلهای پاداش فرایندی (که هر قدم استدلال رو جدا نمره میدن) هستن.
بعد سراغ شرکتهایی میره که این حوزه رو نشونه گرفتن و سه دستهشون میکنه. دستهٔ اول مثل Mercor و Surge، راستیآزما و دیتا رو میسازن و به آزمایشگاههای AI میفروشن؛ معمولاً با روش rubric تو حوزههایی مثل سلامت و حقوق و مالی. دستهٔ دوم مثل Pramaana Labs، حوزههای مبهم رو فرمال میکنن تا ماشین بتونه مستقیم چکشون کنه؛ درست مثل اثبات ریاضی که تو زبانی مثل Lean خودش خودشو بررسی میکنه.
دستهٔ سوم مثل Periodic Labs و Isomorphic Labs، سراغ کارهایی میرن که جوابشون رو فقط تو دنیای واقعی میشه چک کرد نه رو کامپیوتر؛ مثلاً کشف یه ماده یا دارو که باید آزمایش بشه. اینا کل حلقه رو خودشون مالک میشن: AI پیشنهاد میده، یه آزمایشگاه فیزیکی تستش میکنه، و نتیجه میشه پاداش. نویسنده جمعبندی میکنه که جهش بعدی از شرکتهایی میاد که همین پیشرفتها رو به بقیهٔ اقتصاد که سختتر قابلبررسیه بیارن.
نکات کلیدی:
- RLVR باعث پیشرفت بزرگ AI تو ریاضی و کد شده چون جوابشون قابلبررسیه
- بیشتر کارهای باارزش مثل memo و طراحی چکر روشنی ندارن
- rubric بهعنوان پاداش، سوال «خوبه؟» رو به چند سوال کوچیک قابلچک میشکنه
- بعضی شرکتها حوزههای مبهم رو فرمال میکنن تا ماشین بتونه بررسیشون کنه
- بعضی دیگه کل حلقه رو مالک میشن و پاداش رو تو آزمایشگاه فیزیکی میگیرن




