已通過會帶 Gate,需要設計正式 40 分鐘 Agentic AI 課程與可校準評量的候選講師。
I07 · WEEK 7 · 會教 · 40 分鐘
聽眾分析、四層教案與評量設計
從學員最後做出的證據往回設計,不從投影片頁數開始。課程規格與能力指標
本課程以可觀察行為與可檢查成果定義完成標準。
- I06 會帶 Gate 通過
- 準備一個明確目標聽眾與工作情境
- 能提供預期學員 Artifact 範例
- 依工作、起點、風險及課後情境分析聽眾
- 從 Artifact 與評量反向設計概念、Demo、實作、評量四層
- 撰寫能供不同評量者校準的四級 Rubric
- 聽眾分析摘要
- 分鐘合計為 40 的四層教案
- 至少四個維度的行為式 Rubric
40 分鐘授課流程
每一階段均配置明確的講師動作、學員活動與完成訊號。
失敗反例
投影片很多但學員做不出來。
聽眾四問
工作、起點、風險、課後情境。
反向設計
Artifact→評量→實作→Demo→概念。
Demo
把『了解 Human Gate』改成可觀察目標。
個人設計
完成 40 分鐘教案與 Rubric。
同儕走查
每項評量在哪裡教、看、做。
核心術語與正式定義
術語不作為記憶測驗,而是作為設計與審查時的共同語言。
Observable Objective
描述學員在指定情境中能完成的可觀察行動與成果。
Backward Design
先定義最終 Evidence 與評量,再反推實作、Demo 與必要概念。
Four-layer Alignment
概念、Demo、實作與評量使用同一任務及判斷尺度。
Rubric Calibration
透過共同樣本與行為描述,使不同評量者得到接近結論。
核心知識與判斷框架
以下四項為完成本堂實作與後續工作應用所需的最低知識集合。
先看聽眾
工作任務、起始能力、風險與課後使用情境。
先定 Artifact
最後要交什麼,決定教什麼。
四層對齊
概念、Demo、實作、評量使用同一把尺。
四級 Rubric
未呈現、部分呈現、獨立達標、可帶別人。
Human Gate 內訓設計
原課程目標寫成『了解 Human Gate』,只有講解與案例,無學員產出。
- 輸入資料
- 混合技術背景學員、40 分鐘時限、合成寄送流程與既有投影片。
- 任務要求
- 重設為學員能為流程標出核准點並說明理由。
- Agent 範圍
- 協助產生案例變體、工作紙初稿與 Rubric 草案,不決定治理規則。
- 人員判斷
- 講師決定目標深度、規則正確性、評量門檻與案例適用性。
- Human Gate
- 教材發布、能力門檻變更與正式授課之前。
- 必要 Evidence
- 聽眾畫布、四層對齊矩陣、工作紙、Rubric 與走查紀錄。
若只壓縮投影片而未重設實作與評量,學員仍無法轉移到工作。
同一項能力,換三種工作情境練習
主案例建立共同框架;以下案例可依學員職務選一個用於分組判讀、工作紙實作或 Gate 走查。
良率摘要課只有概念沒有產出
既有 40 分鐘課程有 28 頁投影片,完整介紹 Prompt 技巧,但學員沒有任何實作。
- 輸入
- 既有投影片、學員輪廓、合成良率表與課後工作情境。
- Agent 做
- 協助整理案例變體與工作紙草稿,不決定專業正確性。
- 人判斷
- 講師選擇唯一 Artifact、必要概念與評量門檻。
- Human Gate
- 教案正式發布與能力標準設定之前。
- 必要 Evidence
- 聽眾分析、四層矩陣、工作紙、Rubric 與刪減清單。
- 主要風險
- 保留過多內容會擠壓實作,學員仍無法回到工作中使用。
若唯一 Artifact 是一段可追溯摘要,哪三頁內容可以先刪?
維修檢索 Demo 與實作不一致
講師 Demo 使用設備手冊搜尋,學員實作卻改成一般網路搜尋,評量只看答案是否完整。
- 輸入
- Demo 腳本、學員任務、搜尋來源規則與評量表。
- Agent 做
- 協助產生相同結構的合成 Alarm 與文件片段。
- 人判斷
- 講師決定核准來源、學習目標與 Evidence 標準。
- Human Gate
- 學員可使用的資料源與評量規準發布之前。
- 必要 Evidence
- Concept/Demo/Practice/Assessment 對齊矩陣與修正版教案。
- 主要風險
- 學員練到的行為與正式工作要求不同,評量結果沒有轉移效度。
指出四層中斷裂的地方,並用同一任務與同一把尺重排。
文件 Diff Rubric 太模糊
兩位評量者對同一份差異矩陣分別給 2 分與 4 分,理由都是『整體品質』。
- 輸入
- 合成差異矩陣、兩份評分、原 Rubric 與學習目標。
- Agent 做
- 協助整理評語與找出尺度用語差異。
- 人判斷
- 講師定義可見行為、必要 Evidence 與通過門檻。
- Human Gate
- Rubric 用於資格判定或正式成績之前。
- 必要 Evidence
- 共同樣本、盲評差異、修正版行為尺度與重評結果。
- 主要風險
- 模糊尺度會把個人偏好偽裝成能力判定。
把『品質很好』改寫成 1–4 級可觀察行為,各級差在哪裡?
本堂必要交付成果
完成課程必須留下可由第三方檢查、重用或接手的工作證據。
Artifact 必須包含必要欄位、來源、限制、責任邊界與適用的核准紀錄。
示範流程與觀察重點
示範的目的不是展示工具熟練度,而是使關鍵選擇、Evidence 與控制點可見。
模糊目標
『了解 Human Gate』無法判定。
可見行動
為流程標出發布前核准點。
指定 Artifact
交 Human Gate 決策表。
反推四層
用評量倒查概念、Demo 與實作。
課堂實作與交付要求
學員應使用合成、公開或已去識別資料,在課堂內完成最小可驗收版本。
- 1完成聽眾四問
- 2定唯一必要 Artifact
- 3排 40 分鐘四層
- 4寫四級 Rubric
常見錯誤與導正方式
下列錯誤應在課堂觀察或成果審查時主動辨識。
缺少可觀察成果
改寫為在指定任務中完成 Artifact 並依尺度說明理由。
四層未對齊
用同一任務貫穿教、看、做、驗,降低無關認知負荷。
缺少可見行為描述
描述每級獨立程度、Evidence 完整度與是否能帶別人。
當堂評量規準
評量必須引用 Artifact、操作紀錄或可見行為,不採用學員或 Agent 的自我宣稱。
課後應用與延伸教材
課後任務用於確認學員能將課堂框架轉移至實際工作情境。
40 分鐘教案反向走查
邀請一位未參與設計的講師,從 Rubric 逐項倒查評量內容在哪裡被教、展示與練習。
應提交
- 四層教案 V1
- 反向走查缺口清單
- 教案 V2 與修改理由
通過條件
分鐘合計 40;每項必要評量皆有對應概念、Demo 與實作 Evidence。
建議複習與備課資源
- 八堂工作紙包:I07 40 分鐘四層教案畫布
- 八堂 Gate 評量規準:I08 會教 Gate
- 延伸備課:聽眾分析、四層教案與評量 Showcase
延伸教材不增加八堂必修時數,由講師依學員背景與任務風險選用。