→ بازگشت به صفحهٔ اصلی
semantic layer · technolife rag

از «یه گوشی خوب برای بازی» تا یک معیار سنجش‌پذیر

این جمله دقیقاً یک چیز دارد که یک parser می‌تواند رویش کار کند — «۶۰ میلیون» — و سه چیز که نمی‌تواند: یک فعالیت، یک فعالیت دوم، و یک آرزو. در کاتالوگ هیچ ستونی به نام «بازی» وجود ندارد. این صفحه نشان می‌دهد فاصلهٔ بین آن جمله و آن ستون‌ها چطور پر می‌شود — و مهم‌تر از آن، اینکه هر عدد را می‌شود خط به خط خواند.

یک پرسش را انتخاب کن، و مرحله‌به‌مرحله دنبالش کن

هجده پرسش واقعی از مجموعهٔ ارزیابی. هیچ‌کدام از این خروجی‌ها شبیه‌سازی نیست: همه با اجرای واقعی خط لوله روی همان پایگاه دادهٔ ۲٬۶۸۱ گوشی تولید شده‌اند، و ردّ کامل هر مرحله ذخیره شده است.

تابلوی ارزیابی

یک عدد قبول/رد برای کل خط لوله بی‌فایده است: وقتی «یه گوشی خوب برای بازی زیر ۶۰ تومن» یک گوشی ساده برمی‌گرداند، سؤال این است که کدام مرحله خراب شده. پس هر پرسش در هر مرحله جداگانه نمره می‌گیرد و اولین مرحله‌ای که شکسته گزارش می‌شود.

نمرهٔ هر مرحله
نمرهٔ هر دستهٔ پرسش

گراف دانش دامنه

دانش دامنه در YAML نسخه‌دار نشسته، نه در prompt: یک prompt را نمی‌شود diff گرفت، تست کرد یا اعتبارسنجی کرد؛ یک گراف را می‌شود. سه لایه عمداً از هم جدا مانده‌اند، چون هرکدام جور دیگری می‌شکنند: کاربر ترجیح می‌گوید، فروشگاه روی کیفیت می‌فروشد، پایگاه داده متریک ذخیره می‌کند.

شش متریکی که عمداً هیچ‌چیز را نمی‌سنجند

این‌ها وجود دارند تا یک خواسته بتواند فهمیده و بعد صادقانه رد شود. بدون آن‌ها سیستم فقط دو انتخاب دارد: «گرم نکنه» را بی‌صدا نادیده بگیرد، یا با یک جانشین ضعیف تظاهر کند که سنجیده است. هر دو بدتر از گفتنِ حقیقت‌اند.

هر متریک واقعاً چقدر از کاتالوگ را جواب می‌دهد

این سنجه است که مدل دامنه را صادق نگه می‌دارد: متریکی که صفر ردیف دارد، وعده‌ای است که خط لوله نمی‌تواند به آن عمل کند و باید unsupported علامت بخورد.