ت آزمایشگاه جست‌وجوی تکنولایف لایهٔ معنایی ↗ ← نمونه‌کارها
RAG · Persian retrieval

یک جملهٔ فارسی بنویسید، ببینید دستیار فروشگاه چطور به آن می‌رسد.

این صفحه دموی زندهٔ یک دستیار پرسش‌وپاسخ است که روی کاتالوگ واقعی گوشی‌های تکنولایف کار می‌کند. کاتالوگ در ۱ شهریور ۱۴۰۵ کرال شده و همین‌جا داخل مرورگر شما جست‌وجو می‌شود: جمله پارس می‌شود، فیلترهای سخت اعمال می‌شوند، نتایج با ترکیب امتیاز واژگانی و مفهومی رتبه می‌گیرند، و دقیقاً همان شواهدی که به مدل زبانی فرستاده می‌شود کنار نتیجه نمایش داده می‌شود.

آزمایشگاه پرسش

فارسی محاوره‌ای بنویسید — «تا ۴۰ میلیون»، «رم ۸»، «سامسونگ»، «مقایسه کن»، یا یک سؤال دربارهٔ گارانتی و مرجوعی.

نمونه:

نتایج رتبه‌بندی‌شده

در حال بارگذاری کاتالوگ…

شواهد ارسالی به مدل

context window
پرامپت زمینه
پرسشی بنویسید تا شواهد ساخته‌شده را ببینید.

مسیر یک پرسش

همان معماری‌ای که در نسخهٔ کامل روی PostgreSQL و pgvector اجرا می‌شود؛ این صفحه نسخهٔ سبک و مرورگری‌اش است.

۰۱ کرال

کشف از سایت‌مپ

۱۳ فایل سایت‌مپ محصولات خوانده شد و ۲٬۶۹۰ آدرس گوشی جدا شد؛ با تأخیر ۹۰۰ میلی‌ثانیه و بدون آدرس‌های ممنوع در robots.

۰۲ استخراج

پارس ساختاریافته

قیمت، فروشنده، گارانتی، رنگ و مشخصات فنی از پیلود واقعی صفحه استخراج و به شکل جدولی ذخیره می‌شود.

۰۳ فیلتر

محدودیت‌های سخت

برند، بودجه، رم، حافظه و موجودی قبل از رتبه‌بندی اعمال می‌شوند؛ چیزی که شرط را رد کند اصلاً به مدل نمی‌رسد.

۰۴ رتبه

ترکیب واژگانی و معنایی

دو فهرست رتبه با فرمول RRF ترکیب می‌شوند و تطبیق دقیق مدل، اولویت مطلق می‌گیرد.

۰۵ پاسخ

پاسخ مستند

فقط همین شواهد به مدل زبانی می‌رود؛ پاسخ باید به منابع ارجاع دهد و قیمت را «ثبت‌شده در آخرین دریافت اطلاعات» بنامد.

کاتالوگ پشت این دمو

اعداد، خروجی واقعی همان کرال هستند — نه نمونهٔ ساختگی.

پراکندگی برندها

صداقت دربارهٔ داده

  • اسنپ‌شات است، نه قیمت زنده. همه‌چیز تاریخ‌دار است و دستیار هرگز آن را قیمت لحظه‌ای معرفی نمی‌کند.
  • یک آگهی حذف‌شده در فهرست سایت‌مپ بود که به صفحهٔ دسته‌بندی می‌رفت؛ به‌جای جعل داده، به‌عنوان خطا ثبت شد.
  • نظرات کاربران کرال نشد — فقط امتیاز عددی که خود صفحه منتشر می‌کند.
  • ارقام و لینک هر گوشی به صفحهٔ اصلی همان محصول در تکنولایف وصل است.
چرا نسخهٔ مرورگری؟ نسخهٔ کامل روی PostgreSQL + pgvector اجرا می‌شود و بردارهای معنایی را با مدل چندزبانهٔ محلی می‌سازد؛ این صفحه برای آنکه بدون سرور و بدون کلید API قابل امتحان باشد، همان منطق پارس و فیلتر و ترکیب رتبه را در جاوااسکریپت بازسازی می‌کند. لایهٔ معنایی اینجا سبک‌شده است و برای همین در پرسش‌های کاملاً مفهومی، دقت نسخهٔ کامل را ندارد.

جعبه‌ابزار

نسخهٔ کامل

  • PostgreSQL ۱۶ + pgvector — واقعیت‌های ساختاریافته و بردارها در یک پایگاه‌داده
  • امبدینگ چندزبانهٔ محلی — بدون ارسال متن به سرویس بیرونی
  • بازیابی هیبریدی — فیلتر SQL + جست‌وجوی واژگانی + برداری، ترکیب با RRF
  • Gemini پشت یک لایهٔ ایزوله، با دوقلوی جعلی برای تست بدون کلید
  • ۲۱۶ تست خودکار و ارزیابی بازیابی روی کیس‌های فارسی

همین صفحه

  • یک فایل HTML، بدون فریم‌ورک و بدون وابستگی بیرونی
  • نرمال‌سازی فارسی: یکسان‌سازی ی/ک، حذف نیم‌فاصله، ارقام فارسی
  • پارس بودجه به‌صورت عددی و حروفی («تا پنجاه میلیون»)
  • ترکیب رتبه با همان فرمول RRF نسخهٔ اصلی
  • کل کاتالوگ حدود ۱۳۰ کیلوبایت فشرده منتقل می‌شود