Zero-Shot Baseline
Day 7-এ project pick করেছ। আজ Day 8 — Module 2-এর প্রথম hands-on production day: একটা ৩-part zero-shot prompt (role + task + format) লিখবে, ১০টা hand-built test case বানাবে (৬ typical + ৩ edge + ১ adversarial), আর grade-by-eye দিয়ে নিজের baseline pass rate measure করবে।
- •Zero-shot মানে কী, এবং কেন এটাই সবার শুরু — সেটা বলতে পারা।
- •একটা ৩-part zero-shot prompt template লিখতে পারা — role + task + format।
- •10 test case-এর recommended mix বুঝতে পারা: ৬ typical + ৩ edge + ১ adversarial।
- •৪টা edge-case category চিনতে পারা: sarcasm, mixed/ambiguous, irrelevant/nonsense, overly long।
- •Day 7-এ committed project-এর জন্য ১টা v1 prompt + ১০টা hand-built test case লিখে localStorage-এ save করা।
- •Day 7 শেষ — `localStorage.day7.project`-এ তোমার committed project artifact আছে।
- •Day 4-6-এ শেখা vocabulary fresh — baseline, regression, assertion, success criterion।
The Big Picture
Day 7-এ project pick করেছ। আজ প্রথম real prompt — zero-shot দিয়ে শুরু, কেন সেটাই সঠিক starting point।
Day 7-এ তুমি একটা project pick করেছ — title, task, example input, success criterion, সব localStorage-এ committed। আজ Day 8 — Module 2-এর প্রথম সত্যিকারের production day। আরেকটা concept demo না — আজ তুমি নিজের project-এর জন্য প্রথম prompt লিখবে, ১০টা hand-built test case বানাবে, আর নিজের চোখে (grade-by-eye) সেই prompt-এর pass rate বের করবে। এটাই তোমার baseline — যার বিরুদ্ধে Day 9-এর few-shot, আর পরের সব change, measure হবে।
Zero-shotno examples in the prompt
Prompt-এ কোনো input/output example নেই — শুধু instructions। Easiest to write, lowest baseline পারফর্মেন্স, কিন্তু সঠিক starting point। তুমি দেখবে model out-of-the-box কী করে — তারপর scaffolding (few-shot, CoT) দিয়ে improve করবে।
Day 9-এ few-shot add করব। পরে chain-of-thought-ও আসবে। সবগুলো zero-shot baseline-এর উপর measurement করে justify করতে হবে — “zero-shot 62%, few-shot 78%, CoT 84%।” এই comparison ছাড়া কোনো change-এর value বুঝবে না।
Baselineyour measurement floor
First reasonable prompt-এর pass rate। সাধারণত 60-70% range-এ। এটাই floor — সব future change এর বিরুদ্ধে compare হবে। Day 4-এ concept introduced; আজ তুমি নিজের project-এর জন্য তৈরি করবে।
Baseline না থাকলে “আমি prompt improve করেছি” বলা impossible। Team meeting-এ PR review-এ — “baseline ছিল 62%, এই change-এ 78% — ship” — এটাই AI engineer-এর daily currency।
নিচে নিজের ৩-part prompt বানাও — role, task, format। Day 7-এ project commit করে থাকলে সেটার task এখানে দেখতে পাবে।
প্রথম prompt লিখলে। এবার এই prompt-কে measure করার পালা — তার জন্য দরকার test cases। পরের অংশে ১০-case mix আর edge-case category।
Core Concepts
৬/৩/১ mix থেকে grade-by-eye পর্যন্ত — baseline measure করার বাকি ধারণা।
The 6/3/1 mix10 test cases, right proportions
১০টা test case-এর recommended distribution: ৬ typical (average input), ৩ edge (sarcasm, mixed, ambiguous), ১ adversarial (empty, irrelevant)। ৬/৩/১ proportion important — শুধু typical case-এ ৯৫% pass করলেও edge case ফেইল হলে production-এ disaster।
Real production traffic এই proportion-এই আসে। ৬/৩/১ mix তোমাকে real-world distribution-এর জন্য prepared রাখবে। পরের eval-harness lesson এই 10 case দিয়ে run শুরু করবে।
নিচে distribution-টা visualize করে দেখো।
Edge-case taxonomya canonical taxonomy
একটা canonical taxonomy-তে ৪টা category: Sarcasm/irony (literal ≠ intended meaning), Mixed/ambiguous (multiple valid interpretations), Irrelevant/nonsense (input task-এ fit করে না), Overly long (token budget stretches)। প্রতিটা category-তে তোমার archetype-এর জন্য specific examples।
Edge cases over-represented থাকলে prompt-এর real-world robustness বাড়বে। ১০টার মধ্যে ৩টা edge — পর্যাপ্ত catch করার জন্য, overwhelming না।
নিচে ৪টা category-ই explore করো — একটা tab select করে দেখো তোমার archetype-এর জন্য concrete example।
Hand-built casesyou write them, not the AI
Beginner instinct: “AI-কে বলি ১০০টা test case generate করতে।” ভুল order। প্রথম ১০টা নিজে লেখো। তুমি task-এর nuance শিখবে যেটা auto-generation miss করবে। পরে AI সাহায্য করবে — কিন্তু আগে ১০টা by hand।
Self-built test cases তোমার task-এর mental model build করে। Auto-generated cases superficial pattern catch করে। ১০ × ১৫ min = ২.৫ hours — investment worth it।
Grade-by-eyeday-8 grading protocol
Day 8-এ কোনো runner নেই। Manual grade: expected output vs imagined model output। ৩ buckets — Pass / Fail / Partial। পরে assertions দিয়ে automate করব, কিন্তু eye-grade দিয়ে শুরু করলে তুমি একটা feel develop করবে “কখন model কী miss করছে”।
Eye-grade pre-eval-harness intuition development। পরের eval-harness lesson-এ তুমি assertions লিখবে এই eye-grade experience-এর উপর ভিত্তি করে — কোন patterns ধরা দরকার, কোনগুলো ছেড়ে দেওয়া যায়।
আজ চারটা জিনিস করো — (১) নিজের project-এর জন্য ৩-part zero-shot prompt লেখো (role + task + format); (২) ৬/৩/১ mix মাথায় রেখে ১০টা test case বানাও; (৩) ৪টা edge-case category-তে তোমার ৩টা edge case map করো; (৪) নিজের চোখে প্রতিটা case grade করে baseline pass rate বের করো। চারটাই আজকের lesson-এর সরাসরি ফল।
Try It Yourself
পড়া বন্ধ — এবার নিজের ১০টা test case বানাও আর baseline দেখো।
পড়া শেষ — এবার হাতে-কলমে। নিচে তোমার ১০টা test case বানাও — টাইপ pre-assigned আছে, শুধু input আর expected output লেখো।
Test cases লিখলে। এবার দেখো একটা typical zero-shot baseline run কেমন দেখতে — Run চেপে animate করা pass/fail দেখো।
Check Your Understanding
ভুল হলে সমস্যা নেই — প্রতিটার ব্যাখ্যা আছে।
Baseline target 90%+ থাকা উচিত — না হলে weak prompt
AI-কে বলি ১০০টা test case generate করুক — efficient
Adversarial = security stuff — beginner-এ লাগে না
Edge cases ২০% — basically optional
Few-shot examples এখনই যোগ করব — better হবে
“Zero-shot” মানে কী?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
১০ test case-এর recommended mix কী?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
নিচের কোনটা edge case (“mixed/ambiguous”) category-র উদাহরণ?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
Day 8-এ test cases কেন hand-build করব, auto-generate না?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
Baseline pass rate target কী হওয়া উচিত?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
Prove It To Yourself
চারটা ধারণা মনে রাখো। নিজের ভাষায় লেখো। Day 8 শেষ।
চারটা ধারণা মনে রাখো — Zero-shot আগে, fancy পরে: Day 9-এ few-shot, তারপর chain-of-thought — সবগুলো আজকের zero-shot baseline-এর উপর measure হবে। ৬ typical + ৩ edge + ১ adversarial = ১০ — real-world distribution match, hand-building তোমার task-এর mental model বানায়। Baseline 60-70% healthy — ৯৫% মানে test cases too easy, headroom দরকার পরের lesson-গুলোর জন্য। আর localStorage-এ save করো — `day8.prompt` + `day8.testCases`, পরের eval-harness lesson automatically read করবে।
আজকের শব্দগুলো — zero-shot, baseline, typical case, edge case, adversarial case, hand-built, grade-by-eye, pass rate — এখন থেকে English-ই থাকবে; team meeting, PR review, নিজের project-এর decision নেওয়ার সময় এভাবেই দেখবে। কাল কেউ “baseline” বললে তুমি জানো সেটা কী। পুরো তালিকা নিচের glossary-তে।
শব্দার্থ — পরে ফিরে দেখার জন্য
একনজরে সব key term। কোনো শব্দ ভুলে গেলে এখানে এসে খুঁজে নিও।
- Adversarial case
- Intentionally tricky test input — empty, irrelevant, wrong-language। Day 8 mix-এ ১টা minimum।
- Baseline
- First reasonable prompt-এর pass rate। 60-70% target। সব future change এর বিরুদ্ধে compare।
- Edge case
- Unusual but real input — sarcasm, mixed sentiment, ambiguous wording। Day 8 mix-এ ৩টা।
- Few-shot (preview)
- Prompt-এ ২-৫টা example pair। Day 9-এর topic — zero-shot vs few-shot comparison।
- Golden answer / Ground truth
- Test case-এর expected correct output — Day 4-এ introduced।
- Grade-by-eye
- Day 8-এর grading protocol — expected vs (imagined) model output, manual pass/fail। পরে assertions দিয়ে automate।
- Hand-built
- নিজে লেখা — AI-এর সাহায্য ছাড়া। প্রথম ১০টা hand-built চাই।
- Iteration
- v1 → v2 → v3 — measurement-driven prompt change। Day 4-এর flowchart-এর core।
- Pass rate
- শতাংশ test cases যেগুলো pass করেছে। Day 4-এ introduced।
- Test case mix
- Typical/edge/adversarial proportion — recommended 6/3/1 for 10 cases।
- Typical case
- Average input — production traffic এমন দেখাবে। Day 8 mix-এ ৬টা।
- v1 / v2 / v3
- Prompt versions — Day 4-এ version control concept। আজ তুমি v1 লেখো।
- Zero-shot
- Prompt-এ কোনো example নেই — শুধু instructions। Baseline-এর starting point।
Sources consulted to author this lesson. Citation style is informal — follow the links if you want to dig deeper.
- Define success criteria and build evaluations — Anthropic (2025)
- Patterns for Building LLM-based Systems — Eugene Yan (2024)
- Your AI Product Needs Evals — Hamel Husain (2024)
- Promptfoo test case design — Promptfoo (2024)
দুই বাক্যে নিজের ভাষায় লেখো
নিজের ভাষায় দুই বাক্যে লেখো — ৬/৩/১ mix কী কী, আর তোমার baseline pass rate measure করতে grade-by-eye কীভাবে কাজ করে।