EVE: مدلی که سند رو مثل عکس میخونه، نه با OCR
خلاصهٔ کاملتر
Tencent یه مدل بازیابی سند به اسم EVE Preview 4.5B منتشر کرده که بهجای OCR کردن صفحهها و تبدیلشون به متن، مستقیم تصویر صفحه رو در برابر سوال کاربر میسنجه. این مدل ۴.۵میلیارد پارامتری هم متن سوال و هم تصویر صفحه رو به یه سری بردار کوچیک تبدیل میکنه و با تکنیکی به اسم late interaction امتیاز تطابق رو حساب میکنه. طبق ادعای سازنده، EVE رو بنچمارکهای ViDoRe V3 و نسخههای قبلیش رتبهی اول رو گرفته و از مدلهای خیلی بزرگتر هم جلو زده.
مشکلی که EVE حلش میکنه براش هرکسی که رو فرمهای اسکنشده یا گزارشهای فنی سیستم بازیابی ساخته آشناست: OCR حلقهی ضعیفه. جدولها ساختار ردیف و ستونشونو از دست میدن، چارتها به تیکههای متن بیمعنی تبدیل میشن و سلسلهمراتب بصری صفحه (تیتر، تاکید، چیدمان) کلا گم میشه. EVE با نگاه مستقیم به پیکسلهای صفحه، از اول این مرحله رو حذف میکنه.
از نظر معماری، EVE یه بکبون مشترک برای سوال و تصویر سند داره، نه دو تا انکودر جدا. هر کلمهی سوال و هر تیکهی بصری صفحه یه بردار ۱۲۸بعدی میگیره، و صفحه هیچوقت تو یه بردار خلاصه فشرده نمیشه؛ بهجاش هر بخش کوچیک صفحه بردار خودشو نگه میداره. این یعنی سیستم هر بردار سوال رو با تکتک بردارهای سند مقایسه میکنه و بیشترین شباهت رو بهعنوان امتیاز نهایی برمیداره؛ همین باعث میشه EVE بتونه یه ارجاع تنها رو وسط دهها ارجاع دیگه تو یه صفحهی شلوغ پیدا کنه.
برای اجرا لوکال، طبق تستهای نویسنده روی اوبونتو با یه GPU انویدیا (از RTX A6000 استفاده شده)، مدل موقع لود شدن با دقت bfloat16 حدود ۱۰ گیگابایت VRAM مصرف کرده، که نشون میده کارتهای ضعیفتر هم احتمالا جواب میدن. سرو کردنش با موتور vLLM انجام میشه و وزنهای مدل هم اولین بار از Hugging Face دانلود میشن. تو تست عملی، یه عکس فاکتور با دو تا سوال دربارهی مبلغ کل و قیمت یه قطعه امتحان شده و مدل درست تشخیص داده کدوم سوالا جواب داره، بدون اینکه خودِ عددها رو استخراج کنه.
نکتهای که نویسنده تاکید میکنه اینه که EVE فقط نصف یه پایپلاین کامله: یه بازیابیکنندهست، نه یه مولد جواب. بعد از اینکه صفحهی درست رو پیدا کرد، هنوز باید یه مدل زبانی-تصویری (VLM) بخونتش و عدد یا اسم یا واقعیت دقیق رو ازش بیرون بکشه. پایپلاین کامل یعنی EVE صفحه رو پیدا میکنه، اون عکس میره پیش یه VLM خواننده، و اون VLM جواب دقیق رو استخراج میکنه.
نکات کلیدی:
- EVE Preview 4.5B مدل ۴.۵میلیاردپارامتری Tencentه که سند رو بهشکل عکس، نه متنِ OCRشده، بازیابی میکنه.
- رو بنچمارکهای ViDoRe V1/V2/V3 رتبهی اول رو گرفته، جلوتر از مدلهای بزرگتر.
- بردارهاش ۱۲۸بعدیان و ایندکسش برای هر میلیون صفحه حدود ۱۸۰ گیگابایت جا میگیره.
- موقع لود شدن با bfloat16 حدود ۱۰ گیگابایت VRAM مصرف میکنه، یعنی رو یه GPU معمولی هم جواب میده.
- EVE فقط صفحهی درست رو پیدا میکنه؛ استخراج جواب نهایی کار یه مدل زبانی-تصویری جداست.




