Pingbo
繁體中文
加入 Beta

Pingbo 如何判斷哪些郵件需要你處理

Pingbo 會學習哪些事對你重要,整理好已處理、等待中,以及還需要你處理的事。你可以有空的時候再來看,不必隨時被新郵件打擾。

郵件中提出請求的文字被標示出來,連向「需要你」收件盤,旁邊另有「等待中」收件盤和一把尺。

Pingbo 的任務很單純:找出收件匣裡真正重要的郵件,其他的先放一旁。但要做好這件事,比聽起來難得多。

Pingbo 其它的功能都是建立在這個判斷之上。對方確實需要你回覆,預先寫好的草稿才有用;你確實在等對方,安排後續追蹤才有意義。該提醒的沒提醒,你就會漏掉重要郵件;不該提醒的也列進來,你又得逐封確認,跟一般的收件匣軟體沒兩樣。因此,我們最先測試、也最嚴格檢視的,就是這個判斷能有多準。

這篇文章分享了我們的測試方法和完整結果。文章裡的每個數字、每個模型對每封郵件給出的答案,以及重新計算這些結果的程式碼,都公開在 pingbo-bench。

郵件分類不是新問題

電腦最早學會處理郵件的方式,就是先把其中一些丟掉。1997 年,Microsoft Research 的團隊開始用貝氏方法製作垃圾郵件篩選器,並在 1998 年發表 A Bayesian Approach to Filtering Junk E-Mail。原理不複雜:先統計各個字詞在垃圾郵件與一般郵件中出現的頻率,再把新郵件裡各個字詞的勝算相乘。「免費」「中獎」會讓郵件更可能被判為垃圾郵件,「會議」「議程」則相反。2002 年,Paul Graham 在 A Plan for Spam 中提出另一個版本,程式設計師用自己的信箱,花一個下午就能完成訓練,這個做法也因此廣為流傳。

但寄垃圾郵件的人也會調整用字,光靠字詞統計很快就不夠用了。Gmail 逐漸從固定規則轉向能從資料學習的模型。到了 2019 年,它已經用大型模型分析郵件內文以外的線索:寄件者是誰、從哪裡寄出、身分是否經過驗證、同一封郵件在數十億個收件匣中的情況,以及使用者把哪些郵件標為垃圾郵件。Gmail 靠這些方法擋下超過 99.9% 的垃圾郵件。方法一直在變,要回答的問題始終相同:這封信是不是垃圾郵件?

篩選完以後,收件匣的樣子也沒什麼改變。Gmail、Outlook 和 Yahoo 仍然把每串對話分開列出,最新的排在最上面。收件匣知道你讀過哪些信,卻不知道你處理完哪些事、正在等誰,或還有哪些事沒做。一件工作如果橫跨五串對話、持續三週,你仍得自己記住它們的關聯。Pingbo 則以事項整理工作:續約、招募、爭議處理,同一件事的所有對話都收在一起,連同相關人員、承諾、期限和下一步,持續保留到事情結束。

Pingbo 要判斷的是:這件事需不需要你處理?如果需要,該做什麼?這得看寄件者親自提出了什麼要求,以及現在輪到誰採取行動,光靠字詞統計無法判斷。篩選器即使認出「請」和「核准」,也分不清對方是在請你核准,還是只是轉寄給你參考。語言模型能讀懂這層意思,但如果只讓它自由回答,得到的往往是一段看法。要用在產品裡,還得把這段看法轉成有明確依據的判斷。

關鍵判斷

這個判斷以事項為單位。Pingbo 讀到郵件對話之前,Gmail 已經先篩掉垃圾郵件。Pingbo 會把其餘與工作有關的對話整理成事項,再將進行中的事項分到兩個區域。分到哪裡,決定了接下來怎麼處理。

需要你只列出還等著你處理的事,卡片會標明要做什麼。待回覆表示郵件裡有你該回答的問題;打開卡片時,回覆草稿已經準備好了。你可以確認後寄出、修改內容,或先和 Pingbo 討論。如果需要提交表單、核准發票,或做其他回信以外的工作,就會標為待處理,卡片會寫清楚下一步。等你來看時,看板上已經整理好昨晚的進展,需要的回覆也都備好了。

等待中收的是仍在進行、但今天不需要你採取行動的事。你可能正在等別人回覆,也可能只是需要留意進度。Pingbo 會先判斷是否需要追蹤,訂好日期,再依照安排提醒你。到了那一天,卡片會重新出現,根據對話紀錄說明該向誰詢問、要問什麼。你可以選現在跟進,也可以選還沒,繼續等候。

事項標為完成後,就會移出看板。Pingbo 只會提出結案建議,並附上作為依據的郵件;是否接受,由你決定,系統不會自行結案。

工作以外的郵件也各有去處,不會出現在看板上。已篩選會保留不需要你處理的郵件,包含大量寄送郵件、自動通知和參考資料,例如收據、通知,以及你不看的郵件清單。這些信都會保留,也能搜尋,不會被刪除。閱讀則放值得看、看完就好的郵件,例如電子報、進度更新或通知。

選取需要你的看板,列出兩件需要你處理的事項。 需要你之中的一件事項,附有待回覆的回信草稿和一項待處理。 等待中一件已到跟進日期的事項,附有現在跟進按鈕。 Pingbo 建議標為完成的等待中事項,附有還沒和標記完成兩個按鈕。 閱讀頁,值得一看的電子報分成未讀、過往和已儲存。 已篩選頁,列出判定為不重要的登入驗證碼、收據和送達通知。
圖 1。一封信在 Pingbo 裡會去哪裡:需要你(待回覆、待處理)、等待中(現在跟進、還沒)、完成;看板之外還有閱讀和已篩選。

為了做出這些判斷,我們讓模型依序填寫一份表格,每個答案都會限制接下來能選的項目。它得先判斷現在輪到你還是對方,再決定事項要放在哪個區域。接著,從前面介紹的四種狀態中選一種:需要回信,就附上草稿並標為待回覆;需要做其他事,就標為待處理;正在等別人,就放進等待中;對話已結束,就建議標為完成,由你接受或拒絕。如果模型認為你需要回信,還必須引用對話裡要求回覆的原文,不能只憑推測。

有了這套流程,模型的回答才能用來整理事項、準備草稿和安排下一步。但每多一項判斷,也就多一個可能出錯的地方,比單純回答「是」或「否」更難。我們不能只相信模型說了什麼,必須實際測試。

如何衡量判斷是否正確

我們用 508 封真實工作郵件評分,資料集來自 Sappelli 等人(2016),Information Sciences,郵件內文則從 Enron 郵件檔案中取得。原研究由兩位標註者閱讀 1,145 封信,分別記錄每封信要求收件人做什麼。我們只採用兩人判斷一致的 508 封。如果兩個人仔細讀完都得不出相同結論,那封信就不該拿來給任何人打分數。

原研究將郵件分為四類:112 封需要立即回覆;67 封需要稍後回覆,也就是該回,但不必今天回;285 封屬於必須知悉、但不用回覆的內容;44 封可以忽略。Pingbo 要判斷的是什麼樣的事項需要你的注意,因此前兩類合併為需要你;必須知悉的信對應等待中,可以忽略的信在 Pingbo 裡則會被已篩選擋在看板之外。這次評測評分的只有一件事:這封信需不需要回覆。所以加起來就是 112 + 67 = 179 封需要回覆,以及 285 + 44 = 329 封不需要回覆。

這個比例給了我們一個最基本的比較基準。如果 508 封全部回答「不需要回覆」,會答對 329 封,同時漏掉全部 179 封該回的信。即使一個字都沒讀,準確率也有 329 ÷ 508 = 64.8%。低於這個分數,表現就比什麼都不做還差。

準確率是整體判斷正確的比例,卻無法單獨說明錯在哪裡。兩個系統都可能得到 80%,也就是 508 封中答對 406 封。其中一個找出 179 封裡的 77 封,沒有多列出任何不需要回覆的信;另一個找出 160 封,卻多列了 83 封不需要回覆的信。兩者同分,但前者漏掉 102 封該回的信,後者只漏掉 19 封。因此,我們同時公布三項指標:準確率,看整體答對多少;召回率,看該回的信找出了多少;精確率,看列出的信有多少真的需要回覆。

我們用這套標準檢驗 32 個模型,選這些模型是為了回答三個問題。OpenAI 的 16 個模型與 Anthropic 的 11 個模型,讓我們了解目前領先模型的能力;在自有硬體上執行的開放權重模型 Qwen3.6,讓我們知道不租用外部模型時,Pingbo 能做到什麼程度;另外四個小型模型,則讓我們看到手機能分擔多少這項工作。Gemma 和兩個版本的 Ornith 小到未來有機會放進手機;Apple 的裝置端模型負責 iOS 26 與 macOS 26 上的 Apple Intelligence,較新的 iPhone 已經內建。Qwen3.6 和這四個模型共五個,都在我們自己的機器上執行,所以圖表把它們歸在自行託管。全部 32 個模型都測試了同樣的 508 封郵件。

不過,這份資料集不是為 Pingbo 設計的,所以在相信任何數字之前,我們先檢查了資料集本身。兩位標註者最常在四分類標籤上意見不同;Pingbo 實際評分所用的二選一問題,則和收件人實際有沒有回信對得上。我們重新盲評的 100 封郵件裡,有 24 封第三位讀者的判斷與資料集不同。想了解評測方法的讀者,可以參考文末的附錄。

從簡單的模型提示詞,到完整的產品框架

Pingbo 除了模型,還有我們自己開發的執行框架,包括前面那份表格、答案檢查,以及結果呈現給你之前的處理程式。加上這些流程,可能讓模型表現更好,也可能更差,必須經過測試才知道。因此,每次改動後,我們都用相同的 508 封郵件重測全部 32 個模型,其他條件維持不變,才能看出這次修改的影響。每一輪都只執行一次,同一個模型每次執行的答案本來就會有些許出入,所以一兩封郵件的差距看不出什麼意義。圖 2 記錄了每一輪結果。

30%35%40%45%50%55%60%65%70%75%80%85%90%64.8% —全部郵件都判為不需回覆準確率:508 封郵件中,判斷正確的比例步驟 0從四種分類選一個由模型直接回答步驟 1使用最初的提示詞測試完整流程步驟 2判定需要回覆時必須引用郵件作為依據步驟 3引用的請求須出自這封郵件中寄件者本人的話claude-fable-5 — 步驟 0 82.5%, 步驟 1 66.3%, 步驟 2 83.9%, 步驟 3 84.3%; 各組皆測試 508 封郵件82.5%66.3%83.9%84.3%claude-fable-5claude-fable-5-1 — 步驟 0 66.5%, 步驟 1 70.3%, 步驟 2 83.3%, 步驟 3 83.1%; 各組皆測試 508 封郵件66.5%70.3%83.3%83.1%claude-fable-5-1claude-haiku-4-5-20251001 — 步驟 0 68.9%, 步驟 1 60.6%, 步驟 2 78.0%, 步驟 3 80.1%; 各組皆測試 508 封郵件68.9%60.6%78.0%80.1%claude-haiku-4-5-20251001claude-opus-4-5-20251101 — 步驟 0 81.3%, 步驟 1 75.4%, 步驟 2 82.7%, 步驟 3 83.3%; 各組皆測試 508 封郵件81.3%75.4%82.7%83.3%claude-opus-4-5-20251101claude-opus-4-6 — 步驟 0 77.2%, 步驟 1 67.7%, 步驟 2 80.5%, 步驟 3 82.7%; 各組皆測試 508 封郵件77.2%67.7%80.5%82.7%claude-opus-4-6claude-opus-4-7 — 步驟 0 81.9%, 步驟 1 65.2%, 步驟 2 82.1%, 步驟 3 82.9%; 各組皆測試 508 封郵件81.9%65.2%82.1%82.9%claude-opus-4-7claude-opus-4-8 — 步驟 0 81.5%, 步驟 1 72.8%, 步驟 2 84.8%, 步驟 3 84.6%; 各組皆測試 508 封郵件81.5%72.8%84.8%84.6%claude-opus-4-8claude-opus-5 — 步驟 0 81.5%, 步驟 1 66.7%, 步驟 2 83.3%, 步驟 3 84.4%; 各組皆測試 508 封郵件81.5%66.7%83.3%84.4%claude-opus-5claude-sonnet-4-5-20250929 — 步驟 0 67.9%, 步驟 1 68.7%, 步驟 2 81.3%, 步驟 3 81.7%; 各組皆測試 508 封郵件67.9%68.7%81.3%81.7%claude-sonnet-4-5-20250929claude-sonnet-4-6 — 步驟 0 84.1%, 步驟 1 68.5%, 步驟 2 83.3%, 步驟 3 82.5%; 各組皆測試 508 封郵件84.1%68.5%83.3%82.5%claude-sonnet-4-6claude-sonnet-5 — 步驟 0 78.7%, 步驟 1 71.7%, 步驟 2 83.9%, 步驟 3 83.7%; 各組皆測試 508 封郵件78.7%71.7%83.9%83.7%claude-sonnet-5gemma-4-E4B-it-qat-4bit — 步驟 0 71.1%, 步驟 1 60.0%, 步驟 2 63.6%, 步驟 3 65.2%; 各組皆測試 508 封郵件71.1%60.0%63.6%65.2%gemma-4-E4B-it-qat-4bitgpt-4.1 — 步驟 0 81.1%, 步驟 1 63.8%, 步驟 2 81.3%, 步驟 3 82.9%; 各組皆測試 508 封郵件81.1%63.8%81.3%82.9%gpt-4.1gpt-4.1-mini — 步驟 0 71.1%, 步驟 1 54.5%, 步驟 2 72.8%, 步驟 3 75.6%; 各組皆測試 508 封郵件71.1%54.5%72.8%75.6%gpt-4.1-minigpt-4o-mini — 步驟 0 78.0%, 步驟 1 34.4%, 步驟 2 46.5%, 步驟 3 75.8%; 各組皆測試 508 封郵件78.0%34.4%46.5%75.8%gpt-4o-minigpt-5 — 步驟 0 76.8%, 步驟 1 60.4%, 步驟 2 78.9%, 步驟 3 80.5%; 各組皆測試 508 封郵件76.8%60.4%78.9%80.5%gpt-5gpt-5-mini — 步驟 0 72.2%, 步驟 1 56.5%, 步驟 2 71.7%, 步驟 3 79.9%; 各組皆測試 508 封郵件72.2%56.5%71.7%79.9%gpt-5-minigpt-5.1 — 步驟 0 79.5%, 步驟 1 59.4%, 步驟 2 82.1%, 步驟 3 82.5%; 各組皆測試 508 封郵件79.5%59.4%82.1%82.5%gpt-5.1gpt-5.2 — 步驟 0 78.7%, 步驟 1 61.8%, 步驟 2 83.1%, 步驟 3 83.5%; 各組皆測試 508 封郵件78.7%61.8%83.1%83.5%gpt-5.2gpt-5.4 — 步驟 0 82.5%, 步驟 1 67.9%, 步驟 2 82.5%, 步驟 3 82.9%; 各組皆測試 508 封郵件82.5%67.9%82.5%82.9%gpt-5.4gpt-5.4-mini — 步驟 0 69.5%, 步驟 1 69.9%, 步驟 2 79.3%, 步驟 3 79.1%; 各組皆測試 508 封郵件69.5%69.9%79.3%79.1%gpt-5.4-minigpt-5.5 — 步驟 0 82.5%, 步驟 1 72.2%, 步驟 2 83.9%, 步驟 3 85.0%; 各組皆測試 508 封郵件82.5%72.2%83.9%85.0%gpt-5.5gpt-5.6-luna — 步驟 0 70.7%, 步驟 1 63.6%, 步驟 2 81.5%, 步驟 3 84.1%; 各組皆測試 508 封郵件70.7%63.6%81.5%84.1%gpt-5.6-lunagpt-5.6-sol — 步驟 0 82.3%, 步驟 1 74.6%, 步驟 2 82.7%, 步驟 3 83.3%; 各組皆測試 508 封郵件82.3%74.6%82.7%83.3%gpt-5.6-solgpt-5.6-terra — 步驟 0 79.9%, 步驟 1 67.1%, 步驟 2 82.9%, 步驟 3 83.7%; 各組皆測試 508 封郵件79.9%67.1%82.9%83.7%gpt-5.6-terraornith-1.5-9b-mlx-full — 步驟 0 59.3%, 步驟 1 50.8%, 步驟 2 59.6%, 步驟 3 65.4%; 各組皆測試 508 封郵件59.3%50.8%59.6%65.4%ornith-1.5-9b-mlx-fullqwen3.6-35b-a3b-mxfp4 — 步驟 0 75.0%, 步驟 1 65.0%, 步驟 2 73.4%, 步驟 3 79.7%; 各組皆測試 508 封郵件75.0%65.0%73.4%79.7%qwen3.6-35b-a3b-mxfp4

OpenAI 16

  • gpt-5.6-luna
  • gpt-5.6-sol
  • gpt-5.6-terra
  • gpt-5.5
  • gpt-5.4
  • gpt-5.4-mini
  • gpt-5.4-nano
  • gpt-5.2
  • gpt-5.1
  • gpt-5
  • gpt-5-mini
  • gpt-5-nano
  • gpt-4.1
  • gpt-4.1-mini
  • gpt-4.1-nano
  • gpt-4o-mini

Anthropic 11

  • claude-opus-5
  • claude-opus-4-8
  • claude-opus-4-7
  • claude-opus-4-6
  • claude-opus-4-5-20251101
  • claude-fable-5-1
  • claude-fable-5
  • claude-sonnet-5
  • claude-sonnet-4-6
  • claude-sonnet-4-5-20250929
  • claude-haiku-4-5-20251001

自行託管 5

  • qwen3.6-35b-a3b-mxfp4
  • ornith-1.5-9b-mlx-full
  • ornith-1.5-9b-mlx-6bit
  • gemma-4-E4B-it-qat-4bit
  • apple-fm-on-device
圖 2。第 0 步不加執行框架,直接請每個模型從標註者使用的四種分類中選一個,再依需不需要回覆為這個答案評分。接著三輪逐步修改流程,每次都用相同的 508 封郵件測試全部 32 個模型。五個被劃掉的模型未超過 64.8%,也就是全部回答不需回覆的成績,因此不畫出折線。自行託管模型加入引文核對後,提高了 8.5 個百分點;再限定請求須出自寄件者本人的話,提高了 6.3 個百分點。虛線標示 64.8% 的比較基準。將滑鼠移到折線上、用鍵盤選取或點選折線,即可檢視單一模型的變化。

第 0 步不加任何執行框架,直接向每個模型提問。模型讀完一封信,從兩位標註者使用的四種類別中選一種,我們再用全文一致的標準評分:這個答案代表需不需要回覆。32 個模型的中位數是 77.0%,也就是有一半模型的成績高於這個數字;有 29 個超過比較基準,表示模型本身已能處理大部分判斷。但光給一個分類,還不能成為產品:它沒有告訴你該向誰追蹤,沒有準備草稿,也沒有在看板上安排下一步。

第 1 步,我們首次要求模型填完整份表格,成績反而下滑。模型一旦需要填滿各個欄位,就開始替你安排原本不存在的工作。例如,同事只是寄來修訂稿,沒提出任何要求,系統卻建議「回覆意見或核准」。中位數降到 65.0%,幾乎只剩最基本的水準,也只剩 17 個模型超過比較基準。與直接回答問題相比,32 個模型中有 28 個因為加了框架而退步。這次問題出在我們設計的流程。

第 2 步就是針對這個問題修改。模型要判定你需要回信,就必須引用要求回覆的原文;程式還會到郵件中核對,確認這段話確實存在。找不到引用,就不能判定需要回覆。中位數因此提高到 81.3%,24 個模型超過比較基準,32 個中有 23 個在框架內的表現不比直接回答問題差。這是第一次,多數模型都沒有因為這套流程而退步。

第 3 步的修改,來自我們重新檢查第 2 步採用的引文。其中有五分之一其實出自郵件下方附帶的舊對話,而非這次寄來的新內容。寄件者正在回答先前收到的問題,系統卻把那個舊問題誤認為他現在對你提出的要求。其他誤判還包括結尾的客套話,以及需要列入待辦、但不用回信的工作交接。因此,我們進一步限制:請求必須出自目前這封郵件,而且是寄件者親自寫的內容。中位數提高到 82.5%,27 個模型超過比較基準,最高分是 85.0%;32 個中有 25 個,在框架內的表現優於直接回答問題。

第 3 步對使用者最有意義,卻是圖 2 中最不容易看出差別的一輪。我們在自有硬體上執行的模型,因此提高了 6.3 個百分點,與其他模型的差距從 7.9 個百分點縮小到 2.8 個百分點。這表示判斷品質也來自 Pingbo 自己的流程;即使更換底層模型,這些改進仍然有用,不必完全仰賴當下最強的模型。

但規則更嚴格也有代價,只是代價和單看一個數字想像的不一樣。同一個模型上,該回的信有多少拿到待回覆卡片,從 68.2% 降到 62.0%;待回覆卡片裡有多少真的需要回覆,則從 61.6% 提高到 76.6%。少掉待回覆卡片的那 19 封該回郵件,有 18 封改列為待處理卡片,仍然留在清單上,最後真正進到等待中的,反而從 13 封減少到 10 封。每一輪修改都有這樣的取捨,所以我們每次都重測三項指標,確認改善了什麼、又犧牲了什麼。執行框架也不是對每個模型都有幫助:32 個模型中仍有七個直接回答問題反而表現較好,其中多數是規模最小或壓縮幅度最大的模型。因此,Pingbo 選模型時權衡的是成本與實測表現,不能只看價格。Apple 的裝置端模型最能說明這個限制。直接提問時,準確率有 70.1%,高於比較基準;放進執行框架後,每一步都低於比較基準。第 3 步中,它連同 Pingbo 的指令一次最多只能讀 4,096 個 token,大約是 3,000 個英文單字,508 封郵件裡有 153 封放不進去;其餘 355 封中,有 306 封在它最先判斷郵件該歸到哪裡時,就被規則退回。沒有一封郵件成為事項,自然也沒寫出任何回覆草稿。模型要先撐得起執行框架,框架才幫得上忙。

第 3 步就是 Pingbo 目前採用的處理流程。接下來要決定的,是這套流程該用什麼設定,才適合你。

選擇漏掉信件,還是減少打擾次數

同一套流程可以偏向減少提醒,也可以偏向盡量找出所有該處理的郵件。圖 3 列出每個模型在不同設定下的表現。

列出全部 508 封40030022020%40%60%80%100%50%60%70%80%90%100%精確率:列出的郵件中,真正需要回覆的比例召回率:179 封該回郵件中,成功找出的比例claude-fable-5 — 待回覆 65/88%, +待處理 86/55%, +再次獨立判讀 92/56%65/88%86/55%92/56%claude-fable-5claude-fable-5-1 — 待回覆 64/85%, +待處理 83/62%, +再次獨立判讀 88/61%64/85%83/62%88/61%claude-fable-5-1claude-haiku-4-5-20251001 — 待回覆 59/83%, +待處理 83/53%, +再次獨立判讀 96/47%59/83%83/53%96/47%claude-haiku-4-5-20251001claude-opus-4-5-20251101 — 待回覆 56/94%, +待處理 75/65%, +再次獨立判讀 88/61%56/94%75/65%88/61%claude-opus-4-5-20251101claude-opus-4-6 — 待回覆 60/86%, +待處理 80/55%, +再次獨立判讀 92/53%60/86%80/55%92/53%claude-opus-4-6claude-opus-4-7 — 待回覆 59/89%, +待處理 84/54%, +再次獨立判讀 93/53%59/89%84/54%93/53%claude-opus-4-7claude-opus-4-8 — 待回覆 63/91%, +待處理 82/65%, +再次獨立判讀 90/62%63/91%82/65%90/62%claude-opus-4-8claude-opus-5 — 待回覆 64/93%, +待處理 84/55%, +再次獨立判讀 92/55%64/93%84/55%92/55%claude-opus-5claude-sonnet-4-5-20250929 — 待回覆 58/87%, +待處理 72/62%, +再次獨立判讀 92/53%58/87%72/62%92/53%claude-sonnet-4-5-20250929claude-sonnet-4-6 — 待回覆 63/84%, +待處理 83/60%, +再次獨立判讀 90/58%63/84%83/60%90/58%claude-sonnet-4-6claude-sonnet-5 — 待回覆 64/88%, +待處理 83/58%, +再次獨立判讀 93/55%64/88%83/58%93/55%claude-sonnet-5gemma-4-E4B-it-qat-4bit — 待回覆 75/66%, +待處理 83/55%, +再次獨立判讀 96/50%75/66%83/55%96/50%gemma-4-E4B-it-qat-4bitgpt-4.1 — 待回覆 63/86%, +待處理 87/57%, +再次獨立判讀 94/55%63/86%87/57%94/55%gpt-4.1gpt-4.1-mini — 待回覆 77/63%, +待處理 89/47%, +再次獨立判讀 96/45%77/63%89/47%96/45%gpt-4.1-minigpt-4o-mini — 待回覆 60/71%, +待處理 73/53%, +再次獨立判讀 93/52%60/71%73/53%93/52%gpt-4o-minigpt-5 — 待回覆 70/74%, +待處理 86/51%, +再次獨立判讀 94/50%70/74%86/51%94/50%gpt-5gpt-5-mini — 待回覆 70/72%, +待處理 85/45%, +再次獨立判讀 96/45%70/72%85/45%96/45%gpt-5-minigpt-5.1 — 待回覆 59/87%, +待處理 86/54%, +再次獨立判讀 94/52%59/87%86/54%94/52%gpt-5.1gpt-5.2 — 待回覆 65/85%, +待處理 87/55%, +再次獨立判讀 94/52%65/85%87/55%94/52%gpt-5.2gpt-5.4 — 待回覆 56/93%, +待處理 77/64%, +再次獨立判讀 93/63%56/93%77/64%93/63%gpt-5.4gpt-5.4-mini — 待回覆 54/82%, +待處理 83/56%, +再次獨立判讀 96/50%54/82%83/56%96/50%gpt-5.4-minigpt-5.5 — 待回覆 66/89%, +待處理 84/62%, +再次獨立判讀 89/60%66/89%84/62%89/60%gpt-5.5gpt-5.6-luna — 待回覆 64/89%, +待處理 84/56%, +再次獨立判讀 96/50%64/89%84/56%96/50%gpt-5.6-lunagpt-5.6-sol — 待回覆 61/89%, +待處理 81/65%, +再次獨立判讀 88/64%61/89%81/65%88/64%gpt-5.6-solgpt-5.6-terra — 待回覆 63/88%, +待處理 83/61%, +再次獨立判讀 94/59%63/88%83/61%94/59%gpt-5.6-terraornith-1.5-9b-mlx-full — 待回覆 56/61%, +待處理 71/45%, +再次獨立判讀 98/45%56/61%71/45%98/45%ornith-1.5-9b-mlx-fullqwen3.6-35b-a3b-mxfp4 — 待回覆 62/77%, +待處理 80/53%, +再次獨立判讀 92/51%62/77%80/53%92/51%qwen3.6-35b-a3b-mxfp4

OpenAI 16

  • gpt-5.6-luna
  • gpt-5.6-sol
  • gpt-5.6-terra
  • gpt-5.5
  • gpt-5.4
  • gpt-5.4-mini
  • gpt-5.4-nano
  • gpt-5.2
  • gpt-5.1
  • gpt-5
  • gpt-5-mini
  • gpt-5-nano
  • gpt-4.1
  • gpt-4.1-mini
  • gpt-4.1-nano
  • gpt-4o-mini

Anthropic 11

  • claude-opus-5
  • claude-opus-4-8
  • claude-opus-4-7
  • claude-opus-4-6
  • claude-opus-4-5-20251101
  • claude-fable-5-1
  • claude-fable-5
  • claude-sonnet-5
  • claude-sonnet-4-6
  • claude-sonnet-4-5-20250929
  • claude-haiku-4-5-20251001

自行託管 5

  • qwen3.6-35b-a3b-mxfp4
  • ornith-1.5-9b-mlx-full
  • ornith-1.5-9b-mlx-6bit
  • gemma-4-E4B-it-qat-4bit
  • apple-fm-on-device
圖 3。32 個模型在「需要你」三種設定下的表現。全部回答不需回覆,就有 64.8% 的準確率。五個模型未超過這個基準,因此劃掉名稱,不畫出曲線。位置越高,找出的該回郵件越多;越靠左,列出的郵件中,不需要回覆的比例越高。斜虛線上的各點,列出的郵件數量相同,從 220 封到全部 508 封。在同一條斜線上,召回率與精確率一起提高,代表列出相同數量的郵件,卻找對更多封。斜線越陡,列出的郵件越多;在相同召回率下,精確率會較低,在相同精確率下,召回率則會較高。將滑鼠移到模型名稱或曲線上,或點選它們,即可檢視該模型的結果。
需要你列入哪些卡片找出幾封需要回覆的信(共 179 封)列出的信中,需要回覆的比例列出的郵件總數
只列待回覆119 (66%)89%133
加入待處理:Pingbo 的預設設定150 (84%)62%241
再加一次獨立判讀159 (89%)60%265

表 1。在實測表現最好的 gpt-5.5 上,以三種設定建立需要你清單。三列都採用第 3 步的流程,只是設定不同。最後一列找出最多該回的信,但也會列出超過一半的收件匣郵件。

表 1 第一列只列出待回覆卡片。第二列加入待處理,也是 Pingbo 的預設設定。第三列則再讓模型對每個事項獨立判讀一次。

兩位標註者只記錄了郵件是否需要回覆。需要你的範圍更廣,還包括要求你採取其他行動的郵件,但資料集沒有標記這一類。第二列顯示 241 封,第一列是 133 封,多了 108 封。其中 31 封,兩位標註者都認為需要回覆,因此找出的該回郵件從 119 封增加到 150 封。剩下 77 封在評分時被算成錯誤,卻不能因此認定 Pingbo 不該把它們列出來,因為資料集根本沒有「需要採取行動」這個標記。有些正是需要你應該列出的工作,有些才是誤判;現有資料無法區分,我們也就不替它們下結論。這正是表格中間那欄從 89% 降到 62% 的原因。

Pingbo 沒有列出來的信,同樣需要衡量。在 Pingbo 的預設設定,也就是表 1 第二列中,gpt-5.5 列出 241 封,其餘 267 封沒有進入需要你。179 封該回的信找出了 150 封,表示仍有 29 封該回卻沒被列出;其餘 238 封則被標註為不需要回覆。接下來要做的,是減少那 29 封遺漏。

這 267 封並不是都歸到同一個地方,標籤也沒有說這些信不需要任何處理。其中 46 封 Pingbo 歸到等待中,124 封歸到完成;95 封根本沒有成為事項,而是留在閱讀或已篩選;還有兩封是模型呼叫失敗。標註者記錄的只有一件事:這封信需不需要回覆。所以這裡沒有任何數字能說明,那些信是不是還有事情等著你處理。

在這個模型、這組設定下,這兩項指標無法同時做到最好:想少漏掉幾封該回的信,就得接受多看幾封不需要處理的信;如何取捨,還是得由人決定。但這不是通則。32 個模型裡有五個在再加一次獨立判讀之後,兩項指標一起提高,claude-opus-5 就是其中之一,因為這次判讀找回了這些模型原本漏掉的郵件,清單卻沒有因此擴大太多。而兩種錯誤的代價並不相同:漏掉一封需要你的郵件,對方可能一直等不到回覆,你甚至不知道這件事;多列出一封不需要你的郵件,通常只花你一秒確認。

Pingbo 現在能做到什麼

在這次的評測中,我們統計了 Pingbo 找出了多少該回的信,以及有多少沒被列進需要你。這 508 封郵件雖然可以幫助我們找出適合多數人的做法,卻無法告訴我們什麼適合個別使用者。例如新創公司的創辦人可能希望看見投資人的每一封回信,再短也不能漏;公司主管整天收到副本郵件,卻可能只想看到少數真正需要自己處理的郵件。同一個標準,無法同時滿足兩種需求。

這份資料集本身也不完美,附錄有詳細說明。即使只問「需不需要回覆」,兩位標註者的一致率仍只有 70%。到了某個程度,再追求更高分,反映的可能只是模型更符合標註答案,未必是 Pingbo 更好用了。實際郵件的情況往往更複雜:對話更長、參與的人更多,要求也可能藏在轉寄內容裡。我們希望 Pingbo 能依照使用者本人的需要判斷,並在持續學習中,逐步接近 99.99% 的正確率。不管再多仔細檢查、收集新的資料集,也不可能單靠使用標準資料集達成這個目標。

只有使用者自己知道,郵件該怎麼處理。所以 Pingbo 會為每位使用者設定判斷標準,並持續調整:初次設定時會先問你幾個問題,之後再從你的日常操作中學習。你回覆了一封沒列進需要你的信,不管它原本被放到哪裡,都是它讀得到的訊號,但不等於它判斷錯誤,因為並不是每封信都非回不可;你沒回覆就把一封信移出需要你,同樣是訊號,一樣不能確定它判斷錯了,因為你可能已經把對方要求的事處理完了。這些訊號要合起來看、長期累積,才會慢慢改變它為你設定的判斷標準。如此一來,表 1 中的取捨就能隨你的需要持續調整。

Pingbo 會持續學習你重視什麼,並依此調整處理郵件的方式。當它說有事需要你,會用寄件者的原文說明是誰、要求什麼、為什麼需要處理,並事先準備好回覆內容;當它跟你說這事可以等,你就能安心先將它放一旁。如此一來,你就可以把時間和心力放在真正需要你注意力的事項上。

附錄:這份評測有多可信

Sappelli 等人的資料集不是為 Pingbo 設計的:它把郵件分成四類,Pingbo 則要判斷一封信該放進需要你還是等待中。本文的每個數字都以這份資料集為標準,所以在用它評測 Pingbo 之前,我們先檢查了兩件事:四分類標籤可以相信到什麼程度,以及 Pingbo 實際評分所用的二選一問題相比之下如何。兩個人答案相同,不代表答案一定正確。況且在原本的四分類中,兩位標註者只對 1,145 封中的 508 封取得共識,一致率是 44%。而在這些標籤有爭議的地方,第三位讀者多半不站在標籤這一邊。改問二選一問題,同樣這兩位標註者的一致率就高得多,他們給的標籤也和收件人實際有沒有回信對得上。這兩項檢查都無法告訴我們,個別郵件的答案究竟是什麼。以下說明我們是怎麼檢查的。

一開始,有些看似模型答錯的結果讓我們起了疑心。我們請 32 個模型依照原研究的四種類別,替同一批 508 封信分類。其中最接近資料集答案的八個模型,任兩個模型平均有 78% 的信分類相同,但每個模型與資料集答案相符的比例平均只有 63%。如果只是模型能力不足,錯誤通常會比較分散:它與其他模型、與標註者的分歧應該差不多。但這八個模型卻反覆給出相同答案,而標註者認為那些答案是錯的。模型意見一致,不代表它們就是對的,它們也可能犯同樣的錯;但這已經足以讓我們回頭重新檢查那些標籤。

我們因此找出八個模型全都與資料集答案不同的 57 封郵件,重新進行盲評。所有答案都隱去來源,並混入 43 封模型與資料集原本就一致的郵件。負責評分的模型也在這 32 個模型之中。那 43 封是對照組,可以看出它確實讀過評分表,而不是隨機作答;但無法證明它沒有偏袒模型,因為在那 43 封上,模型和資料集的答案本來就相同。直到 100 封全部評完,才揭露答案來源。圖 A1 是結果。

答案有分歧的 57 封郵件4557若評分沒有偏向,選擇其中一方的 50 封郵件應大致這樣分布2525評分模型認同其他模型評分模型認同資料集評分模型兩者都不認同答案原本一致的 43 封:對照組43沒有偏向時,50 封應約為 25 比 25;實際結果是 45 比 5。擲硬幣 50 次,同樣或更懸殊的結果約 2.4 億次才會出現一次。43 封全部答對;但兩邊本來就一致,看不出是否偏袒模型。
圖 A1。對有爭議的答案重新進行盲評。所有答案都隱去來源,直到 100 封郵件全部評完才揭露。中間的長條表示:如果評分只受隨機因素影響,選擇其中一方的 50 封郵件應如何分布。評分模型也在受測的 32 個模型之中。43 封對照郵件顯示它確實讀過評分表,而不是隨機作答;但無法證明它沒有偏袒模型。

在有爭議的郵件中,評分模型有 45 次認同其他模型,5 次認同資料集,7 次兩邊都不認同;在沒有爭議的 43 封中,則全部認同資料集。45 比 5 有多懸殊?如果擲一枚公平硬幣 50 次,出現同樣或更懸殊的結果,大約 2.4 億次才會遇到一次。統計學把這種機率稱為 p 值。這次二項檢定的結果是 4.2e-9,遠低於常用門檻 0.05。不過有兩點要注意。這 57 封是分歧最大的例子,並非隨機抽樣,因此這個結果只能指出兩邊分歧最深的地方,既不能推算其他郵件上兩邊各自錯了多少,也不能斷定哪一邊才是對的。另外,評分表上的郵件內文超過 4,000 個字元就會截斷,100 封裡有六封超過,因此這六封信,評分模型讀到的內容比其他模型少。

所以問題不在於資料集完全不能用,而是四種分類分得太細,連標註者自己也很難取得共識。1,145 封信中,兩人都給了分類的有 1,115 封,其中 607 封意見不同。這 607 封裡,有 138 封是兩人都認為需要回覆,只是對現在回或晚點回看法不同;另外 134 封則都認為不用回覆,只是對需不需要閱讀有不同判斷。這 272 封雖然被分進不同類別,但在「需不需要回覆」上,兩人其實看法一致。只問需不需要回覆時,兩人在 1,115 封中有 780 封看法一致,一致率是 70%。

當然,兩個人看法一致,也不代表一定正確。因此我們找了一個和標註者無關的事實來核對二選一標籤:收件人到底有沒有回信。Enron 郵件檔案保留了每封信之後往來的郵件,只要收件人在 30 天內再寄出的信主旨相同,或引用了原信,就算作回覆。這個判斷方式並不精細:檔案裡沒有記錄回覆的對話串關係,收件人把信轉寄給其他人也會被算成回覆,而我們找到的 115 封回覆中,有 72 封只憑主旨相同就成立。另外,如果收件人自己寄出的信根本沒收進檔案,我們就看不到收件人有沒有回信,沒有回信也就不能當成證據。所以我們先只看收件人列在檔案本身員工名單上的 209 封。

如果標籤和實際回信毫無關係,標為需要回覆和不需要回覆的兩組信,收到回覆的比例應該差不多,差距會接近零。結果並非如此:資料集標為需要回覆的信,有 51.8% 真的收到回覆,其餘只有 24.8%,相差 26.9 個百分點。由於只根據有限的信估計,這個差距的 95% 信賴區間是 12.3 到 42.1 個百分點,下限仍然大於零。如果把在檔案中寄過任何郵件的收件人都算進來,共 491 封,差距縮小到 14.3 個百分點,信賴區間是 6.2 到 22.4 個百分點,下限同樣大於零。換句話說,被標為需要回覆的信確實比較常收到回覆。這是整批信件呈現的關聯,不能證明其中任何一封的標籤一定正確。

第三種計算方式把所有看得到回覆的信都算進來,共 257 封,差距擴大到 33.6 個百分點。我們放在最後才提,因為這組信怎麼挑,有一部分取決於我們正在檢驗的答案。在同一批信上,八個模型的多數決答案差距比較小:209 封是 14.8 個百分點,257 封是 23.0,491 封是 5.5。兩邊的信賴區間互相重疊,光看區間無法斷定哪一邊的差距比較大,所以我們改成逐封比對兩邊的答案。三組信上,資料集的差距都比較大,分別多出 12.1、10.6 和 8.8 個百分點,而這三個差值的信賴區間下限也都大於零:491 封是 3.0 到 14.7 個百分點,209 封和 257 封則分別是 0.6 到 24.2 和 0.3 到 21.2,下限只比零高一點。有關聯也不等於每一封都對:標籤記錄的是寄件者希望收到回覆,收件人卻可能太忙而沒回,所以一封沒人回的信,不代表它標錯了。

二選一的標籤也不是毫無瑕疵。重新盲評的 100 封裡,有 24 封改用評分模型的答案後,連需不需要回覆都會跟著改變。有幾封郵件在這批資料裡出現不只一次,所以這 24 封對應到評分所用的 508 筆資料中的 26 筆,是其中的 5.1%。它們是我們實際查出有疑問的郵件數量,不是標籤錯誤率的估計值:這 100 封是針對分歧挑出來的,負責評分的又是另一個模型,其餘 395 封郵件也沒有再看過一次。它們能說明的是:在這份資料集上接近滿分的成績,不宜看作精確數字。

那麼,這份資料集到底能不能拿來當評測的標準?就四分類標籤來說,答案是不行,本文也沒有任何分數是按四分類評的:資料集自己的兩位標註者只對其中 44% 取得共識,而在他們分歧最深的那些郵件上,第三位讀者以 45 比 5 站在模型這一邊。至於本文每個分數實際採用的二選一問題,也就是改問「需不需要回覆」,檢查的結果就反過來了。同樣這兩位標註者,在這個問題上的一致率是 70%。這些標籤也和收件人實際有沒有回信對得上,三種計算方式都是如此。而且比八個模型自己的多數決答案對得更準,這才是真正關鍵的比較:標籤沒有比模型可靠,就不能用來替模型打分數。

這些檢查都不能保證某一封信的標籤就是對的,本文裡也沒有任何檢查做得到:證據都是間接的,重新盲評的那 100 封又是特地挑分歧最大的,其餘 395 封也沒有再看過一次。能確定的只有一件事:這份資料集站得住腳,可以拿來測量,只是解析度只到幾封信,而不是一封信。508 筆裡有 26 筆有疑問,所以一個模型只比另一個多對一兩封,根本算不上領先。本文的每一個數字,都應該照這個尺度來理解。

安靜持續地多線推進事項

Pingbo 還在 Beta 階段,我們會挑選第一批早期使用者。

你現在用什麼 可複選
你最初是從哪裡知道 Pingbo 的? 選填 · 單選

如果你入選其中一批,我們會把安裝說明寄給你,包含 Apple 官方的測試版。