S1 Mini: مدلی کوچیک برای تمیزکردن متن دیکتهشده
خلاصهٔ کاملتر
وقتی با صدا دیکته میکنی، خروجی خام موتور تبدیل گفتار به متن پر از «اوم»، مکث، و جملههای نصفهکارهست؛ مثلا وقتی میگی «جمعه، نه صبر کن پنجشنبه». S1 Mini دقیقا برای همین ساخته شده: یه لایهٔ تمیزکاری که بین موتور تشخیص گفتار (مثل Whisper) و متن نهایی میشینه و متن خام رو به یه نسخهٔ تمیز و قابلخوندن تبدیل میکنه؛ فیلرها رو حذف میکنه، خودتصحیحیها رو حل میکنه و اعداد، تاریخ و ایمیل رو درست فرمت میکنه. این مدل چتبات نیست و قرار نیست محتوای جدید تولید کنه.
S1 Mini فاینتیونشدهٔ مدل Qwen با حدود ۰.۶ میلیارد پارامتره، همین باعث شده روی CPU یا یه GPU معمولی هم راحت اجرا بشه؛ تو تست، مصرف VRAM فقط کمی بیشتر از ۱.۴ گیگابایت بود. بهجای پرامپتنویسی، کنترل خروجی با سه سوییچ ساده انجام میشه: رسمیت (رسمی، نیمهرسمی، محاورهای)، ساختار (پاراگراف یا لیست) و زمینه (یادداشت عمومی یا ایمیل).
تو تستهای عملی، مدل تونست خودتصحیحیها، فرمت اعداد، ارز و تاریخ رو درست مدیریت کنه، حتی وقتی چندتاشون تو یه جمله روی هم انباشته شده بودن. تو یکی از سختترین تستها که چندتا خودتصحیحی و برگشت عدد و ارز و تاریخ و ایمیل رو با هم داشت، مدل همه رو درست تشخیص داد و فقط یه دونقطهٔ ساعت رو جا انداخت. تو حالت لیست فقط موارد قابلشمارش رو به بولت تبدیل میکنه و خوشآمد و امضا رو دست نمیزنه؛ تو حالت ایمیل هم متن رو با سلام و بدنه و امضا بازآرایی میکنه.
طبق این بررسی، اشکالای مدل کوچیک و سطحیان، مثل جا انداختن یه کلمه یا یه علامت، نه نقص تو منطق اصلی تمیزکاری. برای کسایی که پایپلاین دیکته میسازن، S1 Mini یه راهحل سبک و بدون وابستگی به کلاوده که میشه بدون پرامپتنویسی پیچیده بهش وصل شد.
نکات کلیدی:
- S1 Mini فاینتیون Qwen روی حدود ۰.۶ میلیارد پارامتره و مخصوص تمیزکردن متن دیکتهست، نه چت عمومی
- تو تست فقط حدود ۱.۴ گیگابایت VRAM مصرف کرد و روی CPU هم اجرا میشه
- کنترل خروجی با سه سوییچ: رسمیت، ساختار (پاراگراف/لیست) و زمینه (یادداشت/ایمیل)
- تو سختترین تست، همهٔ خودتصحیحیها رو درست گرفت و فقط یه دونقطهٔ ساعت رو جا انداخت
- برای اجرا فقط به transformers و torch نیاز داره و از طریق Gradio قابل استفادهست




