ردپای باتها در پسوردها: کشف ۲۸,۰۰۰ رمز ساختهشده توسط هوش مصنوعی
خلاصهٔ کاملتر
اگه فکر میکنی پسوردی که ChatGPT یا Claude برات ساخته واقعاً تصادفیه، باید بدونی که یه تیم امنیتی نشون داد اینطور نیست. محققان GitGuardian در آوریل ۲۰۲۶ یه تحقیق جالب منتشر کردن: مدلهای زبانی بزرگ وقتی پسورد میسازن، یه سری الگوهای آماری تکراری به جا میذارن که میشه ازشون برای شناسایی و حتی نسبت دادن پسورد به یه مدل خاص استفاده کرد.
ریشه مشکل اینجاست که LLMها برای پیشبینی «محتملترین» خروجی بهینه شدن، درحالیکه تولید پسورد واقعاً امن دقیقاً برعکسه: باید کاملاً تصادفی و غیرقابل پیشبینی باشه. این تناقض ذاتی باعث میشه که پسوردهای ساختهشده توسط هوش مصنوعی از یه سری الگوی مشخص پیروی کنن.
این تیم ۴۰ مدل LLM از ۱۱ ارائهدهنده مختلف رو بررسی کرد و در مجموع ۸,۰۰۰ پسورد تولید کرد. نتایج اولیه نشون داد که مثلاً Claude Opus فقط ۳۵٪ پسورد منحصربهفرد تولید میکنه، یا مدلهای Llama تقریباً همیشه با حرف بزرگ شروع میکنن. تقریباً همه مدلها از الگوی تکراری «حرف بزرگ، عدد، نماد، حرف کوچک» پیروی میکنن.
بعضی زیررشتههای خاص هم بهشکل باورنکردنی تکرار میشن. مثلاً:
- مدل Mistral-medium-3.1 رشته x7#pL9 رو در ۶۵٪ پسوردها تولید کرد (448 میلیارد بار بیشتر از یه توزیع تصادفی!)
- مدل Llama-3.3-70b-instruct رشته Gx#8dL رو در ۹۶٪ پسوردها داشت
برای شناسایی این الگوها، تیم GitGuardian سراغ یه مدل ریاضی ۱۰۰ ساله رفت: زنجیرههای مارکوف. این مدل که ریاضیدان روسی آندری مارکوف در ۱۹۰۶ معرفی کرده، احتمال هر رویداد رو بر اساس حالت قبلی محاسبه میکنه. تیم برای هر مدل LLM یه زنجیره مارکوف جداگانه آموزش داد تا الگوهای آماری اون مدل رو یاد بگیره.
نتیجه قابل توجه بود: این زنجیرهها در ۵۵٪ موارد مدل دقیق مولد پسورد رو شناسایی کردن و در ۶۵٪ موارد ارائهدهنده درست رو پیدا کردن. زنجیره کلی هم نصف مقدار معمول «تعجب» در برابر پسوردهای LLM نشون داد، یعنی بهوضوح میفهمید با یه خروجی هوش مصنوعی طرفه.
بعد از اثبات کارایی مدل، تیم این ابزار رو روی ۳۴ میلیون پسورد واقعی از گیتهاب (بازه نوامبر ۲۰۲۵ تا مارس ۲۰۲۶) اجرا کرد. معیار تشخیص هم سختگیرانه بود: اطمینان بالای ۷۵٪ در سطح مدل و ارائهدهنده، و سطح perplexity زیر ۱۰۰. نتیجه؟ ۲۸,۰۰۰ پسورد LLM-Generated شناسایی شد که اغلب توسط مدلهای Anthropic، Qwen و Google ساخته شده بودن.
نگرانکنندهترین بخش اینجاست: این پسوردها صرفاً در فایلهای تست نبودن. ۱,۸۰۰ فایل .env واقعی پیدا شد که حاوی رمزهای ساختهشده توسط LLM بودن، مثل کلیدهای AWS، کلیدهای رمزنگاری و رمزهای سرویسهای شخص ثالث. یعنی توسعهدهندهها از ChatGPT یا Claude خواستن یه پسورد امن بسازن، و اون پسورد رو مستقیم توی پروژه واقعیشون گذاشتن — پسوردی که حالا قابل شناسایی و پیشبینیه.
نکات کلیدی:
- LLMها به دلیل ماهیت احتمالیشان، پسوردهای واقعاً تصادفی تولید نمیکنن
- مدلهایی مثل Claude Opus فقط ۳۵٪ پسورد منحصربهفرد دارن
- زنجیرههای مارکوف میتونن با ۵۵–۶۵٪ دقت مدل مولد پسورد رو تشخیص بدن
- ۲۸,۰۰۰ پسورد LLM-Generated در گیتهاب شناسایی شد
- ۱,۸۰۰ فایل .env واقعی حاوی رمزهای ساختهشده توسط هوش مصنوعی بودن
- برای تولید پسورد امن، هرگز از LLM استفاده نکن — از ابزارهای اختصاصی مثل password managerها کمک بگیر




