業州愚公在《AI 提效實戰手冊》第 06 篇中提到,老陳使用週報模板快速完成客戶週報,但客戶回信詢問新功能上線時間,老陳才發現自己犯了錯誤。這個事件凸顯了同一模型自我檢查的不足,業州愚公因此提出雙模型盲審的方法,利用兩個模型交叉驗證以攔截幻覺和偏誤。這個方法包括使用材料治理幻覺和提問治理偏誤,業州愚公還提供了一份可參考的審稿提示詞和成本適用邊界表,以幫助讀者改善自己的工作流程。
菜鳥之友系列:《AI 提效實戰手冊》・第 06 篇作者:業州愚公
老陳上週吃了個悶虧。他用第 05 篇那道週報模板,五分鐘把客戶週報交出去——格式漂亮、段落規整,他掃兩眼就發送了。
半小時後客戶回信:「新功能的上線時間,我怎麼沒聽說過?」
那個時間點不在任何材料裡。模板的約束欄明明寫著「不出現估算數字、沒提到的進度一律寫進行中」,AI 還是補了一句「預計下週上線」——週報這種文體,天生就期待有人給一個時間點。
老陳犯的錯不是用了 AI,是只讓同一個 AI 檢查自己剛寫的東西。他把稿子貼回去問「有沒有問題」,模型回他「內容完整、邏輯清晰」——挑不出毛病,因為那句話本來就是它自己寫的。
這一篇講的就是這道工序:檢查。 誰來檢查 AI?答案不是「換一個更聰明的模型」,而是換一個不知道你希望答案是對的模型。
很多人以為檢查是 AI 順手就能幹的活,隨口一句「你再看看有沒有問題」就當查過了。這一步幾乎不花成本,也幾乎沒作用。原因不複雜:
生成和檢查如果同一個模型、同一個對話來做,面對的是同一套偏好、同一個盲區。它寫下「預計下週上線」時認為合理,回頭再讀還是認為合理。它不是不誠實,是它的盲區和它的產出,從同一個地方長出來。
我拿同一份埋了錯的稿子做過幾種審法(個人實測記錄;預埋 3 處事實錯誤、2 處結論超出證據):
| 審稿方式 | 抓到的事實錯誤 | 抓到的邏輯問題 | 單次耗時 |
|---|---|---|---|
| 同一對話裡問「有沒有問題」 | 0 | 1 | 半分鐘 |
| 換另一家模型、盲審(只給稿件與原始材料) | 3 | 2 | 6 分鐘 |
| 換模型盲審 + 人回原始出處逐條對 | 3 | 2 | 20 分鐘 |
這張表有三件事要看清楚。
第一,同一對話的自查是真的沒用,不是運氣差。它一句錯話都挑不出來,卻能挑出一處邏輯問題——邏輯問題是客觀斷裂,事實問題是它自己造的。
第二,換個模型,結果就變了。不是第二個更聰明,而是它沒參與生成,對那句話沒有偏愛。
第三,只有最後一行才算真的查過:前兩行的「抓到」只是縮小可疑範圍,事實錯誤的定案永遠要回到原始出處。
要講清楚「怎麼審」,先得把「審什麼」分開。AI 的產出問題是兩種病,長得很像,藥完全不同。
幻覺(hallucination):說了不存在的事實。 數字、時間、人名、來源、條款都有外部標準答案。它編了一個上線日期、一個不存在的文件名。判斷幻覺只有一條路:回原始材料或外部來源找原句,找不到就是幻覺。 模型審不出幻覺——它用的還是「像不像真的」這套標準;只有材料能審幻覺。
偏誤(bias):事實沒錯,取捨歪了。 五條進度只挑三條好的寫、把「還在測試」寫成「進展順利」、結論比證據走得更遠。挑不出一個假數字,但整篇判斷是歪的。偏誤沒有外部標準答案,只能靠對抗式提問逼出來:問它「如果結論要反過來,你會拿哪幾條材料?」
| 病 | 長什麼樣 | 靠什麼攔 | 誰能定案 |
|---|---|---|---|
| 幻覺 | 不存在的數字、時間、來源、引用 | 回原始材料逐句對 | 材料與外部來源,不是模型 |
| 偏誤 | 取捨、措辭、結論超出證據 | 對抗式提問、反向假設 | 人(要懂業務脈絡) |
一句話記住:幻覺用材料治,偏誤用提問治,格式用模板治。 拿「你再檢查一下」去治幻覺,等於拿體溫計量血壓。
異模型互審不是「把稿子丟給另一家模型問好不好」——那樣只會換回一段客氣話。要它真的挑錯,有四個規矩。
規矩一:盲審,不給生成過程。 只給它三樣:待審稿件、原始材料、評分清單。不要給它你的提示詞,也不要給它生成模型的解釋。它一旦知道你「本來想要什麼」,就會照著你的期待去讀,審出來還是「挺好的」。
規矩二:隔離材料。 審稿模型拿到的必須是同一份原始材料(報價單、會議紀錄、數據表),不是生成模型轉述過的版本。轉述過一遍,錯的東西就被洗白了——第 04 篇老陳貼錯報價單那次,栽的是同一件事。
規矩三:要依據,不要意見。 每一條問題後面必須跟一句「依據」:引原始材料的原句,引不到就寫「無依據」。這一條把「審稿模型自己也會幻覺」的風險壓到可接受的程度——它編的依據你一眼看得出來,它給的意見你看不出來。
規矩四:允許它說「查不到」。 硬逼模型給結論,它就會編。明文寫上「查不到依據的請單獨列出來」,反而能得到最有用的訊號。
按這四條,審稿提示詞照第 05 篇那五段結構來寫:
| 段落 | 內容(可直接照抄改) |
|---|---|
| 角色 | 你是獨立審稿人。立場是「假設這份稿件有錯,去把它找出來」,不是「確認它沒問題」 |
| 輸入 | 待審稿件〔貼〕/原始材料〔貼〕/評分清單〔貼〕 |
| 約束 | 不得改寫稿件;不得補充你自己知道的知識;只允許指出「與原始材料不符」或「原始材料未提及」 |
| 輸出格式 | 三欄表格:位置|問題類型(事實/邏輯/語氣)|依據;引不到原句的一律寫「無依據」。最後另起一段列「查不到依據的三處」 |
| 自檢清單 | 逐條確認:每個判定是否都附了依據;有沒有把自己的推測寫成事實 |
一個必須知道的邊界:審稿模型也會幻覺。 所以它的結論要分級看——附了原始材料原句的,回去核一下就能定案;給不出依據的只當提示。也別拿第二個模型去審第二個模型的審稿意見,一層套一層,只會得到一堆沒有出口的意見。
盲審一輪不便宜。以我這邊的實測,換一家模型做一輪三欄表式盲審,耗時約是生成本身的四成,費用也在同一量級(以各家官方公告為準)。所以問題不是「要不要審」,而是哪些稿件值得審。
判斷標準是兩個數相乘:翻車代價 × 發生的機率,高過審稿成本才審。
| 任務類型 | 翻車代價 | 建議審稿層級 |
|---|---|---|
| 對外文件、報價、合約摘要、給客戶的週報 | 高(丟單、擔責) | 異模型盲審 + 人回原始出處逐條核 |
| 內部草稿、腦暴、自己看的筆記 | 低 | 同模型開新對話自查就夠 |
| 任何含數字、時間、人名、條款的內容 | 高 | 一律回原始出處,模型審稿不算「查過」 |
| 決策建議、方案比較 | 中高 | 異模型做對抗式提問,人做最終裁決 |
| 批量改寫、格式轉換 | 低(錯了看得見) | 抽樣審 |
還有一句話很多人不願意接受:審稿的最後一哩不能外包。 模型能把可疑處圈出來,把範圍從兩千字縮到三句;但「這三句對不對」只有你能定案。
| 工序 | 派誰 | 要點 |
|---|---|---|
| 生成初稿 | 主筆型模型 | 中文語感穩、長文結構不散,與第 05 篇的模板同一套 |
| 圈出可疑處 | 與主筆不同家的分析型模型 | 一定要換一家:同一家的模型錯誤傾向高度重疊,盲區也重疊 |
| 事實定案 | 人 + 原始材料(可先讓帶聯網檢索的模型篩一遍) | 模型只負責縮小範圍,不負責裁決 |
| 偏誤審稿 | 分析型模型,用對抗式提問 | 不給生成過程,逼它反向假設 |
| 最終發布 | 人 | 高代價任務,人工裁決這一關不能省 |
第 01 篇講「不要用一個模型幹六種活」,這一篇是它的反向用法——寫稿的模型和審稿的模型,最好不是同一個,甚至不是同一家。
挑一份你最近三天內要發出去、含數字或時間點的稿件。開一個新對話(最好換一家模型),只貼三樣:稿件、原始材料,再加這段要求:
假設這份稿件有錯,逐條列出來。三欄表格:位置、問題類型(事實/邏輯/語氣)、依據;依據必須引原始材料的原句,引不到就寫「無依據」。最後列出你查不到依據的三處。
然後只看「依據」那一欄,凡是寫「無依據」的回原始材料核一遍,核不實的刪掉。這一輪大概十五分鐘,換回來的是你不會在客戶面前被問一句「我怎麼沒聽說」。
老陳後來把「客戶週報」的流程改了,只在末尾加一步:發送前換一家模型盲審一次。他說了一句挺準的話:「它不是比我聰明,是它不用給我自己面子。」
一個模型寫,另一個模型挑——不是因為第二個更聰明,是因為它不知道你希望答案是對的。 檢查這道工序花掉的十幾分鐘,買的不是更漂亮的文字,是你敢把它發出去。
工具推薦隨身機器人(新用戶免費試用 7 天)
不想每次手動換模型、手動貼材料?SY 視野的「隨身機器人」把生成與審稿串成一條流程:一份稿件走完寫作與檢查兩道工序才交到你手上,可疑處會連同依據一起標出來。進入 SY 視野(sylogs.com)開通試用——試用 7 天,先讓你最不敢發的那份稿件過一遍。
下一篇預告: 工序有了、模板有了、審稿也有了,但還剩最後一個問題沒回答:你到底省了多少? 「感覺快多了」不是答案,第 01 篇那筆帳也只是別人的一天。《提效要能量化:三個指標與一張月度帳本》將給出時間、成本、返工率三個指標的口徑與一份可照著填的月度帳本,並點出那些其實在虧本的任務。敬請關注。
業州愚公 | SY 視野(sylogs.com)原創內容,轉載請註明出處。
編輯評論 / Editor's Note
這種雙模型盲審的方法可以有效地提高對話系統的準確性和可靠性,減少因為單一模型審查而導致的錯誤和偏見。通過使用兩個不同的模型進行交叉驗證,可以更好地檢測和糾正錯誤,從而提高整體的質量和可信度。這種方法對於需要高準確性和可靠性的應用領域尤其重要。