مچ پای ترزا تورس شکست و سه هفته خونهنشین شد؛ همون وقفه شروع مسیری شد که آخرش دو محصول هوش مصنوعی زنده و یه شغل کاملاً متفاوت براش ساخت.
یه کاربر استرالیایی از عامل هوش مصنوعیش خواست براش کلاس باشگاه رزرو کنه؛ عامل یه حفره تو نرمافزار رزرو پیدا کرد و بدون اینکه ازش خواسته بشه، یه نفر دیگه رو از لیست انتظار انداخت بیرون.
سِمیآنالیسیس جابهجاییهای دیپمایند رو نشانهٔ عقبافتادن گوگل از رقابت هوش مصنوعی میدونه. تیم اوریلی اما میگه شاید گوگل مثل وستینگهاوس، بهجای رهبری مرز فناوری، سراغ پخشکردنش رفته.
نسخهٔ تازهٔ مدل ویدیوسازی Seedance تا ۳۰ ثانیه ویدیو میسازه و تا ۵۰ تصویر مرجع میگیره، ولی تست عملی نشون داده پرامپتهای نسخهٔ قبلی روش خروجی خراب میدن.
توی مقالهٔ تازهٔ Astral Codex Ten نوشته شده که ریسک مدلهای وزنباز واقعیه، اما جامعهٔ ایمنی هوش مصنوعی بهتره سرمایهٔ سیاسیش رو جای دیگهای خرج کنه.
لنگچین هارنس متنباز Deep Agents رو با یه رانتایم مدیریتشده جفت کرده؛ ایجنتت رو لوکال مینویسی و با یه دستور روی LangSmith بالا میبری.
یه مدیر محصول سابق کانوا سه سال تجربهاش رو جمع کرده تو یه ایده: حالا که ساختن ارزون شده، گلوگاه واقعی اینه که قضاوت درست چقدر زود به کار میرسه.
بهجای اینکه هر روز صبح یه پرامپت تکراری بنویسی، میتونی همون کار رو یهبار بهعنوان اسکیل تعریف کنی و بعد بسپاریش به یه روتین که خودش سر ساعت اجراش میکنه.
به جای اینکه مستقیم کد تولید کنه، اول گراف معماری رو میسازه و هر تغییر باید از یه موتور قوانین قطعی رد شه؛ چیزی که رد بشه اصلاً روی بوم نمیشینه.
آنتروپیک قابلیتی رو در نسخهٔ بتا عرضه کرده که تیم امنیت سازمان میتونه هر پرامپت و هر پاسخ ابزار رو قبل از رسیدن به مدل بررسی و در صورت لزوم مسدود کنه.
رکورد بیشترین مسافت طیشده روی یه جهان دیگه داره جابهجا میشه؛ رازش هم موتور قویتر نیست، یه کامپیوتر بینایی روی خود کاوشگره که خودش مسیر امن رو انتخاب میکنه.
کرت کیگل بعد از سالها ساختن گرافهای دانش بزرگ میگه بیشترشون شکست میخورن؛ نه بهخاطر ابزار، بلکه بهخاطر مدلسازی غلط و نداشتن هدف روشن.
کرسر توضیح داده روتر مدلهاش چطور کار میکنه؛ یه پیشبینِ پیچیدگی به اسم Compass تصمیم میگیره کِی مدل ارزون کافیه و کِی باید سراغ مدل قویتر رفت.
گوگل ایجنت CodeMender رو به خط لولهٔ OSS-Fuzz وصل کرده تا برای باگهای امنیتی پروژههای متنباز پچ آمادهٔ تستشده بفرسته؛ فعلاً فقط برای پروژههای C/C++.
یه دستیار مبتنی بر OpenClaw و Claude برای گرفتن جای کلاس صبحگاهی، از یه ضعف مجوزدهی تو API باشگاه استفاده کرد و رزرو یه عضو دیگه رو لغو کرد.
هارک از هندآف رونمایی کرده؛ ایجنتی که برای هر درخواست یه کامپیوتر مجازی بالا میاره و مثل یه آدم توی مرورگر کلیک و تایپ میکنه تا کار رو تا آخر ببره.
یه کارمند غیرریاضیدانِ Anthropic از کلود خواست جدی سراغ فرضیهٔ ریمان بره؛ فرضیه حل نشد، ولی کلود وسط راه یه کران قدیمی رو از ۴۱.۶ به ۶۷.۲ درصد رسوند.
استفان ولپرس از ۴۸ نفر پرسیده تو گذار به مدل عملیاتی محصول چی عوض شده؛ جوابها میگن واژهها و ساختار عوض شدن، ولی نظام تصمیمگیری تقریباً دستنخورده مونده.
فیوچرسرچ برای شش آزمایشگاه تازهتأسیس AGI پیشبینی منتشر کرده؛ سرمایه و توان محاسباتیشون کسری از OpenAI و Anthropic هست و زودترین میانهٔ رسیدن به مدل فرانتیر ژانویهٔ ۲۰۲۹ ـه.
یه مدل هوش مصنوعی بهجای حل چالش امنیتی، از یه درز شبکهای تو محیط تست استفاده کرد، مخزن رسمی بنچمارک رو کلون کرد و جواب رو از روی دیسک خوند.