
بهترین مدل Embedding برای فارسی مدلی است که روی سندها و پرسشهای واقعی شما، نتیجه مرتبط را با هزینه و زمان پاسخ قابل قبول برگرداند. رتبه یک جدول عمومی نمیتواند این تصمیم را بهجای شما بگیرد. نوع متن، لحن کاربران، طول سند و حتی شیوه Chunking نتیجه را تغییر میدهد.
در این راهنما یک آزمون کوچک اما قابل تکرار میسازیم. مدلهای فعال را از کاتالوگ Embedding API پاستا میگیریم، همه را روی یک داده ثابت اجرا میکنیم و با معیارهای بازیابی میسنجیم.
برای انتخاب مدل Embedding چه معیارهایی مهماند؟
| معیار | سؤال عملی |
|---|---|
| کیفیت بازیابی | آیا سند درست در نتایج اول است؟ |
| پشتیبانی فارسی | آیا متن رسمی، محاورهای و ترکیبی را میفهمد؟ |
| طول ورودی | آیا Chunkهای واقعی بدون بریدن پذیرفته میشوند؟ |
| ابعاد | حجم ذخیره و سرعت جستوجو چقدر است؟ |
| هزینه | Ingest اولیه و Queryهای ماهانه چقدر خرج دارند؟ |
| پایداری | نسخه و شناسه مدل برای Production ثابت میماند؟ |
مجموعه ارزیابی فارسی بسازید
از ۳۰ تا ۱۰۰ پرسش واقعی شروع کنید. برای هر پرسش، سند یا Chunk درست را از قبل مشخص کنید. داده آزمون باید شکلهای مختلف فارسی را پوشش دهد:
- لحن رسمی و محاورهای، مانند «لغو سفارش» و «چطور خریدمو پس بدم؟»؛
- نیمفاصله و شکل بدون نیمفاصله؛
- اعداد فارسی و لاتین؛
- نام محصول یا اصطلاح انگلیسی در جمله فارسی؛
- غلط املایی رایج و شکل کوتاهشده پرسش؛
- پرسشهایی که پاسخشان اصلاً در اسناد نیست.
داده ارزیابی را از همان منبعی بردارید که محصول قرار است روی آن کار کند. آزمون خبر فارسی برای انتخاب مدلِ جستوجوی مستندات فنی معیار قابل اعتمادی نیست.
Recall@5 و MRR چه میگویند؟
Recall@5 نشان میدهد در چند درصد پرسشها، Chunk درست میان پنج نتیجه اول بوده است. MRR جایگاه اولین نتیجه درست را هم در نظر میگیرد؛ نتیجه درست در رتبه یک امتیاز بیشتری از رتبه پنج دارد.
recallAt5 = queriesWithRelevantChunkInTop5 / allQueries
MRR = average(1 / rankOfFirstRelevantChunk)
یک مدل ممکن است Recall بهتری داشته باشد اما بردار بزرگتر و هزینه بیشتری ایجاد کند. برنده را با یک امتیاز ترکیبی انتخاب کنید که وزنهایش با محصول شما هماهنگ باشد.