เบนช์มาร์กบริษัทจำลองของ CMU (175 งานจริงในออฟฟิศ) บอกว่าเอเจนต์ตัวเก่งสุดทำงานจบเองได้ยังไม่ถึงครึ่ง — แต่ปัญหาที่แพงกว่าคือมัน 'ทำผิดแล้วรายงานว่าเสร็จ' เล่มนี้สอนวางจุดตรวจ 5 จุด + ตารางแยกงานที่ปล่อยจบเองได้ vs ต้องมีคนกดยืนยัน + วิธีทำให้มันยอมบอกว่า 'ทำไม่ได้' + ตัวอย่างจริงในบอทตอบแชตและ n8n
10 หน้าฟรี
สิ่งที่คุณจะได้
✓รู้ว่าทำไมเอเจนต์ถึง 'ทำผิดแล้วบอกว่าเสร็จ' แทนที่จะหยุดถาม — และมันพังคนละจุดกับที่คนพัง
✓ตารางแยกงาน 3 ระดับ: งานไหนปล่อยจบเองได้ งานไหนต้องมีคนกดยืนยันก่อนลงมือ
✓จุดตรวจ 5 จุด วางตรงไหนของงาน (เข้าใจโจทย์ / ของเข้าครบ / ก่อนแตะของจริง / ตรวจผลด้วยกฎ / เพดานความพยายาม)
✓system prompt + โครง JSON ที่บังคับให้ตอบ blocked แทนการเดา พร้อมช่อง evidence ที่โค้ดเทียบกับข้อมูลจริงได้
✓เคสทดสอบ 4 เคสที่ตั้งใจให้ทำไม่ได้ (ไม่มีจริง/กำกวม/ต้องอนุมัติ/วนไม่จบ) + เช็กลิสต์ 10 ข้อก่อนปล่อยใช้จริง
หน้าตาเล่มจริง
สารบัญ
9 หัวข้อ · 10 หน้า
ตัวอย่างเนื้อหา
พรอมท์ใช้ 'ขอความร่วมมือ' ได้ แต่ห้ามใช้ 'ค้ำประกัน'
หลายคนเอาความปลอดภัยทั้งหมดไปฝากไว้กับพรอมท์ แล้วคาดหวังว่าโมเดลจะทำตาม เขียนว่า 'ถ้าหาออเดอร์ไม่เจอห้ามเดา' แล้วก็จบ — แต่คำขอร้องแบบนั้นเอเจนต์เชื่อฟังบ้างไม่เชื่อฟังบ้าง ส่วนจุดตรวจจริงคือกฎที่อยู่นอกตัวโมเดล เช่น บังคับให้มันส่งเลขออเดอร์ที่จะแก้ออกมาก่อน แล้วโค้ดฝั่งเราเช็กว่าเลขนั้นผูกกับเบอร์ที่ทักเข้ามาจริงไหม ไม่ตรงคือระบบไม่ยอมให้แก้ ต่อให้เอเจนต์ยืนยันว่าถูกแล้วก็ตาม