Unlimited-OCR بایدو؛ پارس یکمرحلهای اسناد طولانی
خلاصهٔ کاملتر
بایدو مدل OCR جدیدش، Unlimited-OCR، رو بهصورت متنباز منتشر کرده و میگه هدفش اینه که کار DeepSeek-OCR رو یک قدم جلوتر ببره. شعار اصلی پروژه «آغاز عصر پارس یکمرحلهایِ افقبلند»ه؛ یعنی مدل بهجای اینکه سند رو تیکهتیکه پردازش کنه، میتونه یک سند طولانی رو یکجا بخونه و به متن ساختارمند تبدیل کنه.
مدل و وزنهاش روی GitHub و Hugging Face منتشر شده، روی ModelScope هم هست و یک دموی آماده روی Hugging Face Spaces داره. مقالهٔ فنیش هم روی arXiv در دسترسه. تیم بایدو از پروژههای DeepSeek-OCR، DeepSeek-OCR-2 و PaddleOCR بهعنوان منبع ایده و مدل تشکر کرده.
برای اجرا دو تا مسیر گذاشتن: یکی با کتابخانهٔ transformers هاگینگفیس روی GPUهای NVIDIA، و یکی هم بالا آوردن یک سرور SGLang که یک API سازگار با OpenAI ارائه میده. برای تصویر تکی هم دو حالت داره: حالت gundam که تصویر رو با اندازهٔ کوچکتر و برش (crop) پردازش میکنه، و حالت base که کل تصویر رو با اندازهٔ ۱۰۲۴ میبینه.
برای چند صفحه و PDF فقط حالت base کار میکنه؛ صفحات PDF اول با کتابخانهٔ PyMuPDF به تصویر تبدیل میشن و بعد پارس میشن. طول کانتکست مدل تا ۳۲۷۶۸ توکنه و برای جلوگیری از تکرار خروجی، از یک پردازشگر لاجیت مخصوص (بر پایهٔ همون ترفند no-repeat-ngram دیپسیک) استفاده میکنه. یک اسکریپت اینفرنس دستهای هم داره که سرور رو خودکار بالا میاره و درخواستها رو همزمان میفرسته.
نکات کلیدی:
- Unlimited-OCR یک مدل OCR متنباز از بایدوئه که کار DeepSeek-OCR رو جلوتر میبره
- روی پارس یکمرحلهای اسناد طولانی و چندصفحهای تمرکز داره
- روی GitHub، Hugging Face و ModelScope در دسترسه و دموی آماده روی HF Spaces داره
- هم با transformers و هم روی سرور SGLang با API سازگار OpenAI اجرا میشه
- دو حالت gundam و base داره؛ چندصفحه و PDF فقط با حالت base




