Prompt Review — Three Changes, Each Measured
Module 3-র শেষ দিন। ৭-dimension rubric দিয়ে prompt পড়ো, top-৩ highest-leverage সমস্যা বাছো, আর প্রতিটা change measure করে সংখ্যা সহ সুপারিশ দাও।
- •একটা repeatable prompt-review framework — ৭টা dimension দিয়ে যেকোনো prompt পড়া।
- •সব সমস্যা না — top-৩ highest-leverage সমস্যা বাছা (error analysis)।
- •প্রতিটা প্রস্তাবিত change measure করা: pass-rate + cost + latency, before/after।
- •"৩টা change, প্রতিটার সংখ্যা সহ" — একটা পেশাদার review deliverable লেখা।
- •Module 3-র সব (Claude Code, tool use, single-tool, failure, cost) এক skill-এ মেলানো।
- •English-এ একটা prompt critique লেখা (আজকের হাতে-কলমে অংশ) — কাজের PR review-তে যা লিখবে।
- •Days 14–23 — পুরো Module 3 (এই দিনটা সব মেলায়)।
- •Days 11–12 — eval harness + pass rate (measurement-এর হাতিয়ার)।
- •Day 20 — production prompt-এর ৮ move (review lens-এর কাঁচামাল)।
The Review Framework
যেকোনো prompt পড়ার জন্য একটা checklist — ৭টা প্রশ্ন।
Day 14–23-এ Claude Code চালানো শিখেছ, tool wire করেছ, guardrail বসিয়েছ, খরচ-গতি মেপেছ — পুরো Module 3। আজ (Day 24), Module 3-র শেষ day, এই সবকিছু এক skill-এ মেলাবে: অন্যের (বা নিজের পুরোনো) prompt পড়ে, rubric আর measurement দিয়ে, সংখ্যা সহ উন্নতির সুপারিশ দেওয়া — production-এ senior-দের রোজকার কাজ, ঠিক PR review-র মতো।
Prompt reviewa senior's everyday skill
অন্যের prompt (বা নিজের পুরোনো prompt) পড়ে উন্নত করা production-এ রোজকার কাজ — PR review-র মতো। একটা ভালো review-র দুটো অংশ: একটা checklist (কোথায় তাকাবে) আর পরিমাপ (তোমার fix আসলেই কাজ করল কিনা)। আজ পুরো Module 3-কে এই এক skill-এ মেলাবে।
তুমি যখন দলে কাজ করবে, prompt লেখার চেয়ে বেশি সময় যাবে অন্যের prompt পড়ে ভালো করতে। রাফি সাকিবের support bot review করছে — এই দক্ষতাই তাকে junior থেকে senior-এ নেয়। আর review-টা নিজেই একটা English deliverable — যা কাজের PR review-তে লিখবে।
The 7-point rubricthe whole module as a checklist
যেকোনো prompt পড়ো এই ৭টা প্রশ্ন দিয়ে: (১) clarity ও role স্পষ্ট? (২) output format + examples? (৩) guardrails (কী NOT করবে)? (৪) tool use ঠিক? (৫) failure handling (loop/error)? (৬) cost ও latency? (৭) tested (test set + pass-rate)? প্রতিটা Module 3-র কোনো দিনের।
Checklist না থাকলে review এলোমেলো হয় — কেউ শুধু wording দেখে, tool বা cost মিস করে। এই ৭টা dimension একটা পূর্ণ scan নিশ্চিত করে। মুখস্থ করার দরকার নেই — কাজের সময় পাশে রাখো, যেমন pilot-রা checklist পড়ে।
Find The Flaws, Pick The Three
১০টা সমস্যা পাবে — কিন্তু top-৩ highest-leverage বাছো।
সাকিব একটা support bot বানিয়েছে — prompt অস্পষ্ট, output format নেই, সব প্রশ্ন Opus-এ যায়, কোনো guardrail নেই, কোনো test নেই। রাফি Module 3-র চোখ দিয়ে পড়ে — নিচের prompt-এ কোন অংশ কোন dimension ভাঙছে খুঁজে বের করো।
Highest-leveragenot exhaustive — pick top three
একটা দুর্বল prompt-এ ১০টা সমস্যা পাবে। নতুনরা সব list করে — সেটা noise, কেউ কাজে লাগাতে পারে না। ভালো reviewer top-৩ বাছে: যেগুলো ঠিক করলে সবচেয়ে বেশি ফারাক হবে। কোনটা সবচেয়ে বেশি ব্যথা দিচ্ছে — সেটা খোঁজাই error analysis।
৩টা actionable fix > ২০টা nit-এর list। সাকিবের bot-এ বানান ঠিক করা vs guardrail যোগ করা — দুটো এক জিনিস না। leverage-এর সাথে সাজালে review-টা মানুষ আসলে প্রয়োগ করে। (একটা established practice: auto-tool পুরোনো bug ঠিক করে, নতুন খুঁজে দেয় না — error analysis দেয়।)
এবার তুমি — একটা আলাদা prompt-এ (invoice summary) top-৩ highest-leverage fix বাছার পালা।
Measure It, Then Ship The Review
"ভালো লাগছে" প্রমাণ না — একই test set-এ আগে-পরে মাপো, তারপর ৩টা change লেখো।
Measure don't guessA/B on the same test set
প্রতিটা প্রস্তাবিত change একই test case-এ আগে-পরে চালাও: pass-rate বাড়ল? cost/latency? এক জায়গা ঠিক করতে গিয়ে আরেক জায়গা ভাঙল কিনা? "মনে হচ্ছে ভালো" কোনো প্রমাণ না — একটা সংখ্যা প্রমাণ। Days 11–12-র eval harness এখন review-র হাতিয়ার।
এটাই review-কে মতামত থেকে আলাদা করে। অনেক "উন্নতি" আসলে regression — test ছাড়া ধরা পড়ে না production-এ, গ্রাহকের কাছে। আর সাবধান: ১০০% pass মানে eval সম্ভবত too easy; ৭০% pass প্রায়ই বেশি অর্থবহ।
মাপার discipline জানলে এবার দেখো একটা পেশাদার review ঠিক কী আকারে বের হয় — সাকিবের bot-এই, সংখ্যা সহ।
Three changeseach with a before/after number
একটা পেশাদার review-র আকার: ৩টা নির্দিষ্ট পরিবর্তন, প্রতিটার পাশে before/after সংখ্যা। যেমন — "Change 1: route easy FAQs to Haiku → cost 5¢→1¢, pass 60%→65%"। মতামত না, প্রমাণ সহ সুপারিশ। এটাই Module 3 exit-এর ঠিক আকার।
এই ফরম্যাটে review লিখলে দল তা বিশ্বাস করে ও প্রয়োগ করে — কারণ সংখ্যা আছে। আর সব fix prompt না: latency/cost প্রায়ই model বদলে (Day 23), hallucinated tool code-এর validation-এ (Day 22)। review পুরো system দেখে, শুধু শব্দ না।
Module 3 completewhat you can do now → Module 4
এই review skill-এ পুরো Module 3 এক হলো: Claude Code চালানো, tool use, একটা tool wire করা, failure ঠেকানো, খরচ-গতি কষা — সব এখন এক চোখে দেখো। তুমি এখন কারো prompt/agent পড়ে সংখ্যা সহ উন্নত করতে পারো।
এটাই একজন প্রয়োগকারী AI engineer-এর দৈনন্দিন কাজ। সামনে Module 4 — prompt থেকে system: RAG (বাইরের জ্ঞান যোগ), আর injection defense। আজকের measure-don't-guess সেখানেও মেরুদণ্ড থাকবে।
Check Your Understanding
ভুল হলে সমস্যা নেই — প্রতিটার ব্যাখ্যা আছে।
ভালো review মানে সব সমস্যা খুঁজে list করা
একটা change "ভালো লাগলে" সেটা ship করা যায়
eval-এ ১০০% pass মানে prompt perfect
Prompt-এর সব সমস্যা prompt বদলেই ঠিক হয়
Review মানে শুধু ভাষা/বানান ঠিক করা
নিজের prompt review করার দরকার নেই, শুধু অন্যেরটা
একটা শক্তিশালী prompt review-র দুটো অপরিহার্য অংশ কী?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
একটা দুর্বল prompt-এ ১০টা সমস্যা পেলে কী করবে?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
একটা change "ভালো" দাবি করার আগে কী করবে?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
eval-এ ১০০% pass দেখলে প্রথম সন্দেহ কী?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
Module 3 exit-এর deliverable-টা ঠিক কী আকারের?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
সব সমস্যা কি prompt বদলেই ঠিক হয়?
ভুল হলেও সমস্যা নেই — প্রতিটা option-এর সাথে ব্যাখ্যা আছে।
Prove It To Yourself
চারটা takeaway মনে রাখো — আর Module 3 শেষ।
চারটা জিনিস মনে রাখো — Review = a rubric + a measurement: ৭টা প্রশ্নে পড়ো, তারপর fix-গুলো মেপে দেখাও। একটা ছাড়া review দুর্বল। Pick the highest-leverage three: সব সমস্যা না — top-৩ যেগুলো সবচেয়ে বেশি ফারাক করবে। Measure, don't guess: একই test set-এ before/after। "মনে হচ্ছে ভালো" প্রমাণ না। Three changes, each with a number: এটাই পেশাদার review-র আকার — আর Module 3 শেষ! সামনে RAG।
আজকের শব্দগুলো — prompt review, review rubric, highest-leverage, error analysis, baseline, A/B test, pass rate, regression, before/after, measure don't guess, three-changes deliverable — এখন থেকে English-ই থাকবে; নিজের PR review-এ এভাবেই লিখবে। পুরো তালিকা নিচের glossary-তে। Module 3 (Claude Code & Tools) এখন সম্পূর্ণ — পরের lesson-এ (Day 25) থেকে Module 4 শুরু: prompt থেকে system, RAG দিয়ে।
শব্দার্থ — পরে ফিরে দেখার জন্য
একনজরে সব key term। কোনো শব্দ ভুলে গেলে এখানে এসে খুঁজে নিও।
- A/B test
- পুরোনো বনাম নতুন একই test case-এ চালিয়ে তুলনা।
- Baseline
- change-এর আগের সংখ্যা — তুলনার ভিত্তি।
- Error analysis
- আসল ব্যথা কোথায় খুঁজে বের করা — top-৩ leverage বাছার ভিত্তি।
- Highest-leverage
- যে fix সবচেয়ে বেশি ফারাক করবে — top-৩ বাছার মাপকাঠি।
- Measure don't guess
- "ভালো লাগছে" না — সংখ্যা দিয়ে যাচাই।
- Pass rate
- test case-এর কত শতাংশ পাস (Days 11–12)।
- Prompt review
- অন্যের/নিজের prompt পড়ে rubric + measurement দিয়ে উন্নত করা।
- Regression
- এক জায়গা ঠিক করতে গিয়ে আরেক জায়গা খারাপ হওয়া।
- Review rubric
- ৭টা dimension-এর checklist — কোথায় তাকাবে।
- Success criteria
- prompt engineer করার আগে যা ঠিক করে নিতে হয় — measurement-এর ভিত্তি।
- Three-changes deliverable
- ৩টা change + প্রতিটার before/after — review-র আকার।
Sources consulted to author this lesson. Citation style is informal — follow the links if you want to dig deeper.
- Prompt engineering overview — Anthropic (2025)
- Prompting best practices — Anthropic (2025)
- AI Evals FAQ (error analysis, measure don't guess) — Hamel Husain & Shreya Shankar (2026)
- Define success criteria & build evaluations — Anthropic (2025)
- Day 20 — Production prompts: the 8-move taxonomy (this course) (2026)
দুই বাক্যে নিজের ভাষায় লেখো
নিজের ভাষায় দুই বাক্যে লেখো — একটা ভালো prompt review-র দুটো অপরিহার্য অংশ কী, আর কেন "৩টা change, প্রতিটার সংখ্যা সহ" ফরম্যাটটা একটা মতামতের চেয়ে ভালো প্রমাণ।