Back to course
Module 2 · Day 8

Zero-Shot Baseline

Day 7-এ project pick করেছ। আজ Day 8 — Module 2-এর প্রথম hands-on production day: একটা ৩-part zero-shot prompt (role + task + format) লিখবে, ১০টা hand-built test case বানাবে (৬ typical + ৩ edge + ১ adversarial), আর grade-by-eye দিয়ে নিজের baseline pass rate measure করবে।

~120 min read5 learning objectives
What you'll learn
  • Zero-shot মানে কী, এবং কেন এটাই সবার শুরু — সেটা বলতে পারা।
  • একটা ৩-part zero-shot prompt template লিখতে পারা — role + task + format।
  • 10 test case-এর recommended mix বুঝতে পারা: ৬ typical + ৩ edge + ১ adversarial।
  • ৪টা edge-case category চিনতে পারা: sarcasm, mixed/ambiguous, irrelevant/nonsense, overly long।
  • Day 7-এ committed project-এর জন্য ১টা v1 prompt + ১০টা hand-built test case লিখে localStorage-এ save করা।
Before this
  • Day 7 শেষ — `localStorage.day7.project`-এ তোমার committed project artifact আছে।
  • Day 4-6-এ শেখা vocabulary fresh — baseline, regression, assertion, success criterion।
1

The Big Picture

Day 7-এ project pick করেছ। আজ প্রথম real prompt — zero-shot দিয়ে শুরু, কেন সেটাই সঠিক starting point।

Day 7-এ তুমি একটা project pick করেছ — title, task, example input, success criterion, সব localStorage-এ committed। আজ Day 8 — Module 2-এর প্রথম সত্যিকারের production day। আরেকটা concept demo না — আজ তুমি নিজের project-এর জন্য প্রথম prompt লিখবে, ১০টা hand-built test case বানাবে, আর নিজের চোখে (grade-by-eye) সেই prompt-এর pass rate বের করবে। এটাই তোমার baseline — যার বিরুদ্ধে Day 9-এর few-shot, আর পরের সব change, measure হবে।

Zero-shotno examples in the prompt

Prompt-এ কোনো input/output example নেই — শুধু instructions। Easiest to write, lowest baseline পারফর্মেন্স, কিন্তু সঠিক starting point। তুমি দেখবে model out-of-the-box কী করে — তারপর scaffolding (few-shot, CoT) দিয়ে improve করবে।

Why it matters

Day 9-এ few-shot add করব। পরে chain-of-thought-ও আসবে। সবগুলো zero-shot baseline-এর উপর measurement করে justify করতে হবে — “zero-shot 62%, few-shot 78%, CoT 84%।” এই comparison ছাড়া কোনো change-এর value বুঝবে না।

Baselineyour measurement floor

First reasonable prompt-এর pass rate। সাধারণত 60-70% range-এ। এটাই floor — সব future change এর বিরুদ্ধে compare হবে। Day 4-এ concept introduced; আজ তুমি নিজের project-এর জন্য তৈরি করবে।

Why it matters

Baseline না থাকলে “আমি prompt improve করেছি” বলা impossible। Team meeting-এ PR review-এ — “baseline ছিল 62%, এই change-এ 78% — ship” — এটাই AI engineer-এর daily currency।

নিচে নিজের ৩-part prompt বানাও — role, task, format। Day 7-এ project commit করে থাকলে সেটার task এখানে দেখতে পাবে।

প্রথম prompt লিখলে। এবার এই prompt-কে measure করার পালা — তার জন্য দরকার test cases। পরের অংশে ১০-case mix আর edge-case category।

2

Core Concepts

৬/৩/১ mix থেকে grade-by-eye পর্যন্ত — baseline measure করার বাকি ধারণা।

The 6/3/1 mix10 test cases, right proportions

১০টা test case-এর recommended distribution: ৬ typical (average input), ৩ edge (sarcasm, mixed, ambiguous), ১ adversarial (empty, irrelevant)। ৬/৩/১ proportion important — শুধু typical case-এ ৯৫% pass করলেও edge case ফেইল হলে production-এ disaster।

Why it matters

Real production traffic এই proportion-এই আসে। ৬/৩/১ mix তোমাকে real-world distribution-এর জন্য prepared রাখবে। পরের eval-harness lesson এই 10 case দিয়ে run শুরু করবে।

নিচে distribution-টা visualize করে দেখো।

Edge-case taxonomya canonical taxonomy

একটা canonical taxonomy-তে ৪টা category: Sarcasm/irony (literal ≠ intended meaning), Mixed/ambiguous (multiple valid interpretations), Irrelevant/nonsense (input task-এ fit করে না), Overly long (token budget stretches)। প্রতিটা category-তে তোমার archetype-এর জন্য specific examples।

Why it matters

Edge cases over-represented থাকলে prompt-এর real-world robustness বাড়বে। ১০টার মধ্যে ৩টা edge — পর্যাপ্ত catch করার জন্য, overwhelming না।

নিচে ৪টা category-ই explore করো — একটা tab select করে দেখো তোমার archetype-এর জন্য concrete example।

Hand-built casesyou write them, not the AI

Beginner instinct: “AI-কে বলি ১০০টা test case generate করতে।” ভুল order। প্রথম ১০টা নিজে লেখো। তুমি task-এর nuance শিখবে যেটা auto-generation miss করবে। পরে AI সাহায্য করবে — কিন্তু আগে ১০টা by hand।

Why it matters

Self-built test cases তোমার task-এর mental model build করে। Auto-generated cases superficial pattern catch করে। ১০ × ১৫ min = ২.৫ hours — investment worth it।

Grade-by-eyeday-8 grading protocol

Day 8-এ কোনো runner নেই। Manual grade: expected output vs imagined model output। ৩ buckets — Pass / Fail / Partial। পরে assertions দিয়ে automate করব, কিন্তু eye-grade দিয়ে শুরু করলে তুমি একটা feel develop করবে “কখন model কী miss করছে”।

Why it matters

Eye-grade pre-eval-harness intuition development। পরের eval-harness lesson-এ তুমি assertions লিখবে এই eye-grade experience-এর উপর ভিত্তি করে — কোন patterns ধরা দরকার, কোনগুলো ছেড়ে দেওয়া যায়।

Tip

আজ চারটা জিনিস করো — (১) নিজের project-এর জন্য ৩-part zero-shot prompt লেখো (role + task + format); (২) ৬/৩/১ mix মাথায় রেখে ১০টা test case বানাও; (৩) ৪টা edge-case category-তে তোমার ৩টা edge case map করো; (৪) নিজের চোখে প্রতিটা case grade করে baseline pass rate বের করো। চারটাই আজকের lesson-এর সরাসরি ফল।

3

Try It Yourself

পড়া বন্ধ — এবার নিজের ১০টা test case বানাও আর baseline দেখো।

পড়া শেষ — এবার হাতে-কলমে। নিচে তোমার ১০টা test case বানাও — টাইপ pre-assigned আছে, শুধু input আর expected output লেখো।

Test cases লিখলে। এবার দেখো একটা typical zero-shot baseline run কেমন দেখতে — Run চেপে animate করা pass/fail দেখো।

4

Check Your Understanding

ভুল হলে সমস্যা নেই — প্রতিটার ব্যাখ্যা আছে।

Misconception check

Baseline target 90%+ থাকা উচিত — না হলে weak prompt

Misconception check

AI-কে বলি ১০০টা test case generate করুক — efficient

Misconception check

Adversarial = security stuff — beginner-এ লাগে না

Misconception check

Edge cases ২০% — basically optional

Misconception check

Few-shot examples এখনই যোগ করব — better হবে

Quick check

“Zero-shot” মানে কী?

ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।

Quick check

১০ test case-এর recommended mix কী?

ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।

Quick check

নিচের কোনটা edge case (“mixed/ambiguous”) category-র উদাহরণ?

ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।

Quick check

Day 8-এ test cases কেন hand-build করব, auto-generate না?

ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।

Quick check

Baseline pass rate target কী হওয়া উচিত?

ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।

5

Prove It To Yourself

চারটা ধারণা মনে রাখো। নিজের ভাষায় লেখো। Day 8 শেষ।

Note

চারটা ধারণা মনে রাখো — Zero-shot আগে, fancy পরে: Day 9-এ few-shot, তারপর chain-of-thought — সবগুলো আজকের zero-shot baseline-এর উপর measure হবে। ৬ typical + ৩ edge + ১ adversarial = ১০ — real-world distribution match, hand-building তোমার task-এর mental model বানায়। Baseline 60-70% healthy — ৯৫% মানে test cases too easy, headroom দরকার পরের lesson-গুলোর জন্য। আর localStorage-এ save করো — `day8.prompt` + `day8.testCases`, পরের eval-harness lesson automatically read করবে।

আজকের শব্দগুলো — zero-shot, baseline, typical case, edge case, adversarial case, hand-built, grade-by-eye, pass rate — এখন থেকে English-ই থাকবে; team meeting, PR review, নিজের project-এর decision নেওয়ার সময় এভাবেই দেখবে। কাল কেউ “baseline” বললে তুমি জানো সেটা কী। পুরো তালিকা নিচের glossary-তে।

Glossary

শব্দার্থ — পরে ফিরে দেখার জন্য

একনজরে সব key term। কোনো শব্দ ভুলে গেলে এখানে এসে খুঁজে নিও।

Adversarial case
Intentionally tricky test input — empty, irrelevant, wrong-language। Day 8 mix-এ ১টা minimum।
Baseline
First reasonable prompt-এর pass rate। 60-70% target। সব future change এর বিরুদ্ধে compare।
Edge case
Unusual but real input — sarcasm, mixed sentiment, ambiguous wording। Day 8 mix-এ ৩টা।
Few-shot (preview)
Prompt-এ ২-৫টা example pair। Day 9-এর topic — zero-shot vs few-shot comparison।
Golden answer / Ground truth
Test case-এর expected correct output — Day 4-এ introduced।
Grade-by-eye
Day 8-এর grading protocol — expected vs (imagined) model output, manual pass/fail। পরে assertions দিয়ে automate।
Hand-built
নিজে লেখা — AI-এর সাহায্য ছাড়া। প্রথম ১০টা hand-built চাই।
Iteration
v1 → v2 → v3 — measurement-driven prompt change। Day 4-এর flowchart-এর core।
Pass rate
শতাংশ test cases যেগুলো pass করেছে। Day 4-এ introduced।
Test case mix
Typical/edge/adversarial proportion — recommended 6/3/1 for 10 cases।
Typical case
Average input — production traffic এমন দেখাবে। Day 8 mix-এ ৬টা।
v1 / v2 / v3
Prompt versions — Day 4-এ version control concept। আজ তুমি v1 লেখো।
Zero-shot
Prompt-এ কোনো example নেই — শুধু instructions। Baseline-এর starting point।
References

Sources consulted to author this lesson. Citation style is informal — follow the links if you want to dig deeper.

Exit check

দুই বাক্যে নিজের ভাষায় লেখো

নিজের ভাষায় দুই বাক্যে লেখো — ৬/৩/১ mix কী কী, আর তোমার baseline pass rate measure করতে grade-by-eye কীভাবে কাজ করে।

0 chars
Back to course