เบนช์มาร์กบริษัทจำลองของ CMU (175 งานจริงในออฟฟิศ) บอกว่าเอเจนต์ตัวเก่งสุดทำงานจบเองได้ยังไม่ถึงครึ่ง — แต่ปัญหาที่แพงกว่าคือมัน 'ทำผิดแล้วรายงานว่าเสร็จ' เล่มนี้สอนวางจุดตรวจ 5 จุด + ตารางแยกงานที่ปล่อยจบเองได้ vs ต้องมีคนกดยืนยัน + วิธีทำให้มันยอมบอกว่า 'ทำไม่ได้' + ตัวอย่างจริงในบอทตอบแชตและ n8n
สิ่งที่คุณจะได้
✓รู้ว่าทำไมเอเจนต์ถึง 'ทำผิดแล้วบอกว่าเสร็จ' แทนที่จะหยุดถาม — และมันพังคนละจุดกับที่คนพัง
✓ตารางแยกงาน 3 ระดับ: งานไหนปล่อยจบเองได้ งานไหนต้องมีคนกดยืนยันก่อนลงมือ
✓จุดตรวจ 5 จุด วางตรงไหนของงาน (เข้าใจโจทย์ / ของเข้าครบ / ก่อนแตะของจริง / ตรวจผลด้วยกฎ / เพดานความพยายาม)
✓system prompt + โครง JSON ที่บังคับให้ตอบ blocked แทนการเดา พร้อมช่อง evidence ที่โค้ดเทียบกับข้อมูลจริงได้
✓เคสทดสอบ 4 เคสที่ตั้งใจให้ทำไม่ได้ (ไม่มีจริง/กำกวม/ต้องอนุมัติ/วนไม่จบ) + เช็กลิสต์ 10 ข้อก่อนปล่อยใช้จริง