تشخیص متن هوش مصنوعی با مدلی که تو مرورگر اجرا میشه
خلاصهٔ کاملتر
به گفتهی تیم Distil Labs، متنهای تولیدشدهی هوش مصنوعی یا همون «slop» دارن اینترنت رو پر میکنن؛ همون پستهای کلیشهای لینکدین، نقدهای مشکوکانه صیقلی و کامنتهایی که انگار از روی چکلیست شرکتی نوشته شدن. مشکل ابزارهای موجود اینه که یا به فراخوانی API نیاز دارن (نگرانی حریم خصوصی) یا مدلشون برای اجرای محلی خیلی بزرگه. هدف تیم این بود: چیزی که محلی اجرا بشه، تو یه افزونهی مرورگر جا بشه و دقتش هم بالا بمونه.
نکتهی اصلی پروژه نتیجهاش هست: یه مدل Gemma 3 270M که بعد از fine-tune شدن، روی مجموعهی تست به دقت ۱۰۰٪ رسیده و عملاً عملکرد مدل معلم خودش یعنی GPT OSS 120B رو match کرده. این یعنی یه مدل بیش از ۴۰۰ برابر کوچیکتر تونسته همون کیفیت رو بده. نسخهی کوانتایزشدهاش هم که تو مرورگر اجرا میشه، حدود ۹۵٪ دقت داره.
مدل پایه بهتنهایی به درد نمیخورد: Gemma 3 270M بدون آموزش فقط حدود ۴۰٪ دقت داشت که تقریباً مثل حدس تصادفیه. خطاهای رایجش هم این بود که نوشتههای رسمی انسانی رو هوش مصنوعی تشخیص میداد و نشانههای واضح هوش مصنوعی مثل عبارتهای «delve into» یا «it's worth noting» رو از دست میداد. همین نشون داد که این کار یادگرفتنیه ولی هنوز یاد گرفته نشده — یه کاندیدای عالی برای fine-tune.
خروجی مدل خیلی سادهست: فقط یه برچسب طبقهبندی، یا ai_generated یا human_written. قالب دادههای آموزشی هم همین شکلیه:
{
"input": "We recognize the value of your feedback and remain committed to continuous improvement.",
"output": "ai_generated"
}برای آموزش، تیم اول حدود ۵۰ نمونهی اولیه نوشت که نشانههای واضح هوش مصنوعی، زبان شرکتی ظریف، متن عامیانهی انسانی و حالتهای مرزی رو پوشش میداد. بعد با پلتفرم Distil Labs و از طریق knowledge distillation از مدل معلم، این مجموعه رو به حدود ۱۰٬۰۰۰ نمونه گسترش دادن. بعدش Gemma 3 270M رو با روش LoRA برای ۴ ایپاک آموزش دادن و در آخر برای استقرار تو مرورگر، مدل رو به فرمت Q4_K_M کوانتایز کردن که حجمش رو به حدود ۲۴۲ مگابایت رسوند.
تو اعتبارسنجی دنیای واقعی روی محتوایی که مدل قبلاً ندیده بود، دقتش روی کامنتهای Reddit حدود ۹۲٪، خروجیهای ChatGPT حدود ۹۸٪ و توییتهای انسانی حدود ۹۴٪ بود. نویسنده صادقانه میگه مدل بیشتر با نوشتههای رسمی انسانی (ایمیلهای کاری، متنهای دانشگاهی) مشکل داره و گاهی اونها رو اشتباهی هوش مصنوعی تشخیص میده، چون این متنها از نظر سبکی شبیه خروجی هوش مصنوعیان. خود مدل هم محلی و از طریق Wllama روی CPU اجرا میشه و سرعت استنتاجش حدود نیم تا دو ثانیه برای هر پرسوجوئه. نویسنده اضافه میکنه همین جریان کاری برای هر کار طبقهبندی دیگهای هم عمومیه و میشه با یه Claude skill مدل اختصاصی خودت رو آموزش بدی.
نکات کلیدی:
- یه مدل Gemma 3 270M که با fine-tune و knowledge distillation آموزش دیده، متن هوش مصنوعی رو تشخیص میده
- نسخهی tuneشده دقت مدل معلم ۱۲۰ میلیاردی رو match میکنه، با اینکه بیش از ۴۰۰ برابر کوچیکتره
- نسخهی کوانتایزشده (Q4_K_M، حدود ۲۴۲ مگابایت) کاملاً تو افزونهی Chrome و روی CPU اجرا میشه
- متن کاربر هیچوقت از دستگاه بیرون نمیره؛ نه API، نه ابر، نه نشت داده
- ضعف اصلیش تشخیص اشتباه نوشتههای رسمی انسانی بهعنوان هوش مصنوعیه




