گاردریلهای مدل Fable حسابی محققهای امنیتی رو کلافه کرده
خلاصهٔ کاملتر
به گزارش TechCrunch، شرکت Anthropic روز سهشنبه مدل Fable رو منتشر کرد و اون رو یه نسخهی عمومی و محدود از مدل پرسروصدا و قدرتمند امنیت سایبریاش یعنی Mythos معرفی کرد. ولی همه از محدودیتهایی که روش گذاشتن راضی نیستن و یه عالمه از محققها و متخصصهای امنیتی تو شبکههای اجتماعی شکایتشون رو علنی کردن.
والنتینا پالمیوتی (معروف به Chompie) که محقق امنیتی شناختهشدهای تو IBM X-Force هست میگه Fable هر درخواستی که حتی ذرهای به امنیت سایبری ربط داشته باشه رو رد میکنه، حتی کارای بیخطری مثل خوندن یه پست بلاگ. وقتی یه پرامپت گاردریلها رو فعال میکنه، Fable چت رو متوقف میکنه و میگه که «سازوکارهای ایمنی این پیام رو بهخاطر موضوعات امنیت سایبری یا زیستشناسی علامتگذاری کردن».
این گاردریلها برای این گذاشته شدن که ریسک استفاده از Fable برای ساخت بدافزار یا بهخطر انداختن نرمافزار رو کم کنن؛ نگرانیای که از قدیم تو Anthropic وجود داشته. محدودیتهای مربوط به زیستشناسی هم ریشهاش تو همین جور نگرانی دربارهی ساخت سلاحهای بیولوژیک هست.
وقتی Anthropic مدل Mythos رو آوریل منتشر کرد، دسترسی بهش رو تو قالب چیزی به اسم Project Glasswing فقط به تعداد محدودی شرکت و سازمان داد؛ تلاشی برای امنکردن نرمافزار و زیرساختهای حیاتی. هفتهی پیش هم دسترسی به Mythos رو به صدها سازمان تو ۱۵ کشور گسترش داد.
با همهی نیت خوبی که پشتش بوده، خیلی از متخصصها هنوز از حالت سرهمبندیشدهی این محدودیتها دلخورن. مت سوییش، یه کهنهکار امنیت سایبری، به TechCrunch گفته اگه از مدل بخوای کد امن بنویسه، فرض میکنه این یه کار مربوط به امنیت سایبریه نه یه best practice مهندسی نرمافزار، و برات کیفیتش رو پایین میآره. در واقع Fable طوری برنامهریزی شده که وقتی به گاردریل میخوره، به مدل Claude Opus 4.8 برمیگرده. به گفتهی سوییش این فیلتر انگار بر اساس کلمات کلیدی کار میکنه، برای همین هر چیزی تو حوزهی واژگانی «امنیت سایبری» باشه تریگرش میکنه.
البته سوییش میگه این قابل درکه چون هنوز اول راهیم و دارن گاردریلهاشون رو تطبیق میدن، و مطمئنه که با همکاری بیشتر Anthropic و بقیهی شرکتهای مدل با نسل جدید شرکتهای امنیتی، این محدودیتها بهمرور بهتر میشن؛ موقع همچین انتشاری بهتره سفتتر بگیری تا شل. جدا از گاردریلهای داخل مدلها، Anthropic از متخصصهای امنیتی میخواد برای برنامهای به اسم Cyber Verification Program اپلای کنن تا بعد از تأیید، محدودیت کمتری موقع استفاده از Claude برای کار امنیتی داشته باشن؛ OpenAI هم برنامهی مشابهی به اسم Trusted Access for Cyber داره.
نکات کلیدی:
- Fable نسخهی عمومی و محدود مدل امنیتی Mythos هست که گاردریلهای سفتوسختی داره
- محققها میگن حتی درخواستهای بیخطر مثل خوندن بلاگ یا ریویو کد هم بلاک میشه
- فیلتر ظاهراً بر اساس کلمات کلیدیه و هر چیز نزدیک به امنیت سایبری رو تریگر میکنه
- وقتی Fable به گاردریل میخوره، به Claude Opus 4.8 برمیگرده
- متخصصها برای دسترسی بازتر باید تو Cyber Verification Program ثبتنام و تأیید بشن




