NetKubeLab EN

เตรียมสอบ CCAO-F เจ็ดโดเมนตาม blueprint

โดเมน 2 · Output Evaluation and Validation

ยี่สิบเอ็ดเปอร์เซ็นต์ หนักที่สุดในเจ็ดโดเมน และตัวอย่างข้อสอบทางการข้อแรกก็มาจากโดเมนนี้ ซึ่งไม่น่าจะบังเอิญ

· หมวด 2 · เจ็ดโดเมนตาม blueprint · 3 นาที

น้ำหนัก 21% ของข้อสอบ หนักที่สุดในเจ็ดโดเมน

ถ้ามีเวลาอ่านโดเมนเดียว อ่านโดเมนนี้ และตัวอย่างข้อสอบทางการข้อแรกจากสามข้อ ก็มาจากโดเมนนี้ ซึ่งไม่น่าจะเป็นเรื่องบังเอิญ

วัตถุประสงค์ตามคู่มือ

หกข้อ มากที่สุดในบรรดาเจ็ดโดเมน

"Evaluate Claude-generated outputs for accuracy and completeness"

"Identify hallucinations, inconsistencies, and biases in responses"

"Apply fact-checking and validation techniques"

"Determine when human review or additional verification is required"

"Edit, adapt, refine, and compare outputs for the intended audience"

"Organize and curate information and select appropriate output formats (artifacts, inline, structured data)"

ทำไมมันหนักที่สุด

เพราะมันคือสิ่งที่แยกคนใช้ AI เป็นออกจากคนใช้ AI ไม่เป็น คู่มือหัวข้อ 3 บรรยาย ผู้เข้าสอบไว้ว่าเป็นคนที่

"critically evaluate AI-generated content"

และหัวข้อ 4 ระบุประสบการณ์ที่แนะนำไว้ข้อหนึ่งว่า

"A practical understanding of AI limitations, including hallucinations, context constraints, and data sensitivity"

สามคำนั้นแมปเข้ากับสามโดเมนพอดี — hallucinations คือโดเมนนี้ context constraints คือโดเมน 3 และ data sensitivity คือโดเมน 6 ซึ่งบังเอิญเป็นสามในสี่โดเมนที่มีน้ำหนักสูงสุด

ตัวอย่างข้อสอบทางการ

คู่มือหัวข้อ 8 ให้ตัวอย่างไว้สามข้อ พร้อมย้ำว่า

"They are not drawn from the live item bank."

ข้อแรกอยู่ในโดเมนนี้ สรุปสถานการณ์ได้ว่า Claude สรุปกฎระเบียบฉบับใหม่ออกมา อย่างมั่นใจ พร้อมอ้างเลขมาตราย่อยเจาะจง แล้วถามว่าก่อนส่งให้ทีม compliance ควรทำอะไร

เฉลยคือ ตรวจเลขมาตราที่อ้างกับตัวบทจริงก่อนส่ง และเหตุผลที่คู่มือให้คือ

"Language models can fabricate specific-looking details such as citation numbers, a hallucination. Validating factual claims, especially citations bound for a compliance audience, against an authoritative source is the diligence step required. Self-reported confidence (A, C) is not a reliable accuracy signal"

ประโยคสุดท้ายคือบทเรียนที่ยกไปใช้ได้กับทั้งข้อสอบ — การถามโมเดลว่ามั่นใจแค่ไหน ไม่ใช่การตรวจสอบ ตัวเลือกที่ให้โมเดลประเมินตัวเองจึงผิดเสมอในโจทย์แนวนี้

รูปแบบผลลัพธ์ก็อยู่ในโดเมนนี้

วัตถุประสงค์ข้อสุดท้ายพูดถึงการเลือกรูปแบบผลลัพธ์ และวงเล็บไว้สามอย่าง

  artifacts        ชิ้นงานแยกออกมาเป็นก้อน แก้ไขต่อได้
  inline           ตอบในบทสนทนาเลย
  structured data  ข้อมูลที่มีโครงให้เอาไปใช้ต่อ

นี่เป็นวัตถุประสงค์เดียวในโดเมนนี้ที่วัดความรู้เรื่องฟีเจอร์ ที่เหลือวัด วิจารณญาณ และคู่มือหัวข้อ 7 ก็สั่งให้ไปอ่านเอกสารฟีเจอร์เหล่านี้โดยตรง

"Review official Anthropic documentation and help articles for Claude features such as Projects, Artifacts, Memory, Skills, and Code Execution"

เมื่อมันโกหก

"ถ้าโมเดลบอกว่ามั่นใจ แปลว่าน่าจะถูก" คู่มือปฏิเสธข้อนี้ตรง ๆ ในเฉลยตัวอย่าง ข้อแรก ความมั่นใจที่โมเดลรายงานเองไม่ใช่สัญญาณความถูกต้อง

"hallucination คือการแต่งเรื่องทั้งเรื่อง" ตัวอย่างในคู่มือเป็นการแต่ง เลขมาตราย่อย ในเนื้อหาที่ถูกต้องเป็นส่วนใหญ่ ซึ่งจับยากกว่ามาก

"ตรวจงานคือหน้าที่ของคนรีวิวทีหลัง" วัตถุประสงค์ข้อสี่บอกว่าการ ตัดสินว่า เมื่อไหร่ต้องให้คนรีวิว เป็นทักษะของคุณเอง

อ้างอิง

เอกสารทางการ

  • คู่มือสอบ CCAO-F หัวข้อ 6 โดเมน 2 · หัวข้อ 8 ตัวอย่างและเฉลย · หัวข้อ 3 และ 4 คุณสมบัติผู้เข้าสอบ

อ่านต่อในคอร์สนี้

สัดส่วนคะแนนสูงวัดการตัดสินใจ

อ่านหน้านี้เป็นภาษาอังกฤษ