北極星日報 · 試刊

2026 年 10 月 4 日(週日)

涵蓋台北時間 10/3 07:00 ~ 10/4 07:00 發布的消息補做(製作日 2026-10-04)

讀法:沒有標示的句子=有來源的事實。〔推論〕是我們的判斷;〔廠商宣稱〕是廠商自己說、還沒有第三方驗證;〔未驗證〕是還沒查實。每則底下可以點「展開」看證據與限制。

今天最值得知道的事:在一份合成的商業流程評測裡,12 個模型共同題組中沒通過檢查的試驗,約有三分之二是正常結束、呼叫過改資料的工具、也沒有回報最終工具錯誤的。驗收 AI 的工作,要看實際結果,不要只看它的自述。〔推論〕

#1Agent 說它完成了,資料庫不同意

主軸 ① 能力 · ③ 協作

發生什麼

Microsoft 與 Hugging Face 10/3 發布聯名文章介紹 ThinkingBox 評測,並宣布可以透過 Hugging Face 使用;相關論文 8 月已發表,資料集 8 月也已公開。這個評測有 507 個合成重建、會改動資料的商業工作流程,18 個模型各跑 20 次;評分主要看後端資料庫的最終狀態與副作用,而不是模型呼叫了哪些工具(507 題中有 30 題另外評分回覆內容)。

在 12 個模型的共同題組裡,121,680 次有效試驗中有 79,853 次沒通過檢查。這些失敗裡,有 67.24% 是「正常結束、呼叫過改資料的工具、也沒有回報最終工具錯誤」。從外表看,這些失敗很像成功。〔推論〕作者把執行過程比作一份「宣稱」,並寫道:“Database state is the evidence.”

為什麼重要

以 Kimi-K3 為例,93.89% 的題目至少成功過一次,但 20 次全對的只有 13.41%。Claude Opus 5.5 的 pass@1(只跑一次就成功的比例)是 67.16%,20 次全對的有 241 題。

作者也把成本換算成「每可靠完成一題」:單次成功成本最低的 GPT-5.6 Sol,每次成功約 0.127 美元,換算後卻要 9.76 美元,比 GPT-5.4(6.80)、GPT-6 Astra(7.45)和 Claude Opus 5.5(7.80)都高。

挑模型如果只看單次成功率和單價,可能同時高估了可靠度、低估了成本。〔推論〕

可以怎麼用

驗收 AI 做的事,可以去查實際結果(資料、檔案、系統狀態)而不是只看它說「完成」,評估模型時同一題多跑幾次、看「每次都對」的比例,會改資料又無法復原的步驟則加一個人工核准。〔推論〕

展開:證據與限制
  • 來源是 Microsoft 與 Hugging Face 的聯名文章(10/3),屬發布機構自己的評測。
  • 任務是合成重建的商業流程,客戶不是真實的。
  • 成本是用 OpenRouter(模型轉售平台)的牌價估算,不是實際帳單。
  • 作者的建議:送出前檢查最終狀態、先把錯誤分類再重試、縮小給 agent 的工具範圍、無法復原的變更要人工核准。作者明說沒有量測這些建議的實際效果。
  • 文章在本期截止後約 10 分鐘有過修改,我們拿不到修改前的版本;本則所有數字都以修改後版本為準,無法確認截止前是否相同。

來源:Hugging Face 部落格:The Agent Said It Was Done. The Database Disagreed.(一手·發布機構)

#2Aleph Alpha 發布「主權」開放權重模型,宣稱資料裡沒有答案時會說不知道

主軸 ① 能力

發生什麼

德國 Aleph Alpha 10/3 發布開放權重模型 Kolibri:英德雙語、混合專家架構(MoE,每次只啟動一部分參數),總參數 780 億、每次啟動 30 億,上下文最長 100 萬 token(模型計算文字量的單位),以 Apache-2.0 授權把權重放上 Hugging Face。它的定位是公部門、工業、航太等受監管產業,可以在自家機房部署。

Aleph Alpha 說,他們用特定的訓練方法,讓模型在「答案不在提供的資料裡」時回答不知道。〔廠商宣稱〕實際表現還沒有看到獨立測試。

為什麼重要

對資料不能離開自家環境的組織來說,一個能在本地跑、而且若實測確實會在沒有依據時說不知道的模型,可能比排行榜分數更重要;可在自家環境部署的開放權重模型選項也正在變多。〔推論〕

可以怎麼用

如果工作有資料主權或法規限制,可以把這類能在自家環境部署的開放權重模型列入評估,測試時特別看它在「資料裡沒有答案」時的表現。〔推論〕

展開:證據與限制
  • 來源是 Aleph Alpha 官方部落格(10/3)。
  • 「與活躍參數多到 4 倍的模型表現相當」等說法是自家評測。〔廠商宣稱〕 技術報告我們沒有讀。
  • 德文佔預訓練資料的 21.3%。
  • 「開放權重」指權重以 Apache-2.0 授權公開;訓練資料與程式是否全部公開,頁面上我們沒有看到。
  • 還不知道:中文表現如何,頁面沒有提。

來源:Aleph Alpha:Kolibri Has Landed(一手·官方)

今天的工程思維

週末消息少,今天兩則的共同點是「可信度要看得見」:agent 說完成,不代表資料是對的;模型被設計成會說「不知道」,也還要自己測過才算數。跟 AI 協作越深,越需要會自動執行的檢查,去查實際的結果。〔推論〕

來源清單

  1. The Agent Said It Was Done. The Database Disagreed.(Microsoft/Hugging Face,10/3)
  2. Kolibri Has Landed: A Sovereign Open-Weight Model(Aleph Alpha,10/3)