زنگ خطر یک کرم تزریق پرامپت
خلاصهٔ کاملتر
دنیل میسلر (Daniel Miessler)، پژوهشگر شناختهشدهٔ حوزهٔ امنیت، تو یه پست تازه نوشته که به نظرش اولین هک بزرگ هوش مصنوعی میتونه به شکل یه «کرم تزریق پرامپت» (prompt injection worm) باشه. تزریق پرامپت یعنی وقتی یه مدل زبونی نمیتونه بین دستور واقعی و متن مخربی که یه مهاجم قایم کرده فرق بذاره، و اون متن رو بهجای داده، بهعنوان دستور اجرا میکنه. میسلر میگه این کرم میتونه از یه سری شرایط که دارن همزمان جور میشن سوءاستفاده کنه.
به گفتهٔ اون، تا اواخر ۲۰۲۶ یا اوایل ۲۰۲۷ مدلهای متنباز به سطح مدلهایی مثل GPT-6 یا FABLE 5 میرسن یا حتی ازشون جلو میزنن. تو همین بازه، ایجنتهای هوش مصنوعی دارن تو ایمیل، فرمهای وب، تلگرام و بقیهٔ کانالهای ورودی همهجا نصب میشن. میسلر میگه مهاجمها (چه گروههای خصوصی چه دولتی) مدتهاست دارن روی این نقاط ورودی لیست هدف میسازن، ولی صبر کردن تا وقتی همه به این ایجنتها وصل بشن.
سناریوی اون اینه: مهاجم یه سری تزریقپرامپت روز-صفر (zero-day، یعنی حملهای که هنوز راهی برای شناساییش وجود نداره) میسازه که از فیلتر مدلهای آزمایشگاههای بزرگ و مدلهای متنباز رد بشه، با payloadهایی مثل «این داده رو بفرست به فلان آدرس». بخش آخر و ترسناک ماجرا اینه که خود پیام، بعد از اجرا شدن، دوباره از طریق ایمیل یا پیامک قربانی به قربانیهای بعدی فرستاده میشه؛ یعنی دقیقاً رفتار یه کرم رایانهای کلاسیکه، ولی اینبار روی مغز هوش مصنوعی اجرا میشه.
نتیجه، به گفتهٔ میسلر، میتونه یه روز از خواب بیدار شدن باشه و دیدن اینکه ترابایتها داده حساس (از رمز عبور تا اطلاعات مشتریها) یا افشا شده یا برای مهاجم فرستاده شده. یه مدل دیگه از این حمله هم میتونه خیلی هدفمندتر و آرومتر باشه؛ یعنی بهجای افشای یهجای همهچی، از دسترسیها به آرومی و بیسروصدا سوءاستفاده بشه که کشفش خیلی بیشتر طول بکشه.
میسلر معتقده این ماجرا در واقع یه مسابقهست بین قدرت دفاعهای تزریق پرامپت و هوشِ روزبهروز بیشتر مدلهای متنباز بدون محدودیت، و میگه شانس زیادی برای برنده شدن تو این مسابقه نمیبینه. راهحلی که پیشنهاد میده اینه که هر تیمی باید دقیق بدونه کجاها هوش مصنوعی داره ورودیها رو پردازش میکنه، این نقاط رو مدام رصد کنه، براشون تهدیدشناسی بر اساس سطح دسترسیشون بسازه، چند لایه دفاعی بچینه، و از قبل برای واکنش به حادثه آماده باشه.
نکات کلیدی:
- میسلر پیشبینی میکنه تا اواخر ۲۰۲۶ یا اوایل ۲۰۲۷ مدلهای متنباز به سطح GPT-6 یا FABLE 5 برسن
- حمله با یه تزریقپرامپت روز-صفر شروع میشه و مثل کرم از قربانی به قربانی بعدی پخش میشه
- دو حالت ممکنه: افشای انبوه و پرسروصدا، یا سرقت آروم و طولانیمدت داده
- راه مقابلهای که پیشنهاد میده: شناسایی دقیق همهٔ نقاطی که AI ورودیها رو پردازش میکنه و چیدن چند لایه دفاعی




