北極星日報 · 試刊

2026 年 10 月 7 日(週三)

涵蓋台北時間 10/6 07:00 ~ 10/7 07:00 發布的消息

讀法:沒有標示的句子=有來源的事實。〔推論〕是我們的判斷;〔廠商宣稱〕是廠商自己說、還沒有第三方驗證;〔媒體報導〕是媒體自己的報導內容,本刊核對的是媒體確實這樣寫,不代表事件已被證實;〔消息人士〕是報導引述未具名人士;〔未驗證〕是還沒查實。每則底下可以點「展開」看證據與限制。

今天最值得知道的事:一篇 arXiv 論文發現,換用不同的 coding agent 外層框架,準確度差距不大,但每題成本最多差 3 倍。

#1論文:換 agent 框架,準確度差不多,成本最多差 3 倍

主軸 ③ 協作

發生什麼

arXiv 上一篇論文(作者 Yangze Liu、Zhongyi Han)比較了多種 coding agent 的 harness,也就是包在模型外面、負責呼叫工具與管理對話內容的程式框架。

論文指出,在 447 個任務上,最重的 Claude Code 與最輕的 mini-SWE-agent 成績相差在 5 分以內。

論文指出,在同模型、同任務下,每題成本在不同 harness 之間最多差 3 倍,主因是 system prompt 的長度與每一步送出的工具定義(tool schema)大小。

論文指出,OpenCode 最多落後 9 分,其中約一半來自輸出被截斷。

作者估計,只有 45 題的評測,約只有一半機率偵測到 13 分的差距;要穩定偵測 5 分的差距需要 447 題。

為什麼重要

挑 harness 時,成本差距可能比準確度差距更實在,而題數少的評測多半分不出 harness 的好壞。〔推論〕

可以怎麼用

比較 agent 框架時,先在同一模型、同一批任務下量每題的 token 成本,並用足夠的題數再談準確度。〔推論〕

展開:證據與限制
  • 這是 arXiv 預印本,尚未經同儕審查;結論限於作者選用的模型、任務與 harness。
  • arXiv 頁面標示的提交日是 10/3;本刊以它在 arXiv 新論文清單公開的時間收錄。
  • 仍不知道的:換成其他類型的任務(例如非程式任務)是否得到同樣結論。

來源:What Does a Harness Buy? Tokens, Mostly(一手·論文)

#2SWE-CC:功能正確的 agent 修補,仍違反約 43% 的專案規範

主軸 ① 能力

發生什麼

一篇 arXiv 論文提出 SWE-CC 基準,作者把 12 個開源專案的文件轉成 823 條可由機器檢查的專案規範。

作者用 500 個貢獻任務測試四個 LLM agent。

論文指出,功能正確的修補仍違反 43.1% 適用的專案規範。

論文指出,近半數的違規發生在中間執行步驟,而不是最終成品。

為什麼重要

測試通過不等於可以合併,agent 寫對程式之後,還有「守不守專案規矩」這一關。〔推論〕

可以怎麼用

把專案的貢獻規範寫成可自動檢查的規則,並把 agent 的中間步驟也納入審查,而不只看最後的 diff。〔推論〕

展開:證據與限制
  • 這是 arXiv 預印本,尚未經同儕審查;結果限於 12 個開源專案與四個受測 agent。
  • arXiv 頁面標示的提交日是 10/5;本刊以它在 arXiv 新論文清單公開的時間收錄。
  • 仍不知道的:在公司內部、規範較少成文的專案裡,違規比例會是多少。

來源:Correct Code, Broken Contributions? SWE-CC(一手·論文)

#3UndoBench:agent 做得完事,出錯後卻常收拾不好

主軸 ① 能力

發生什麼

一篇 arXiv 論文提出 UndoBench,把使用工具的 AI agent「完成任務」與「出錯後復原」的能力分開測量。

論文指出,受測情境中任務完成率為 83.54%,但復原成功率只有 46.72%。

論文指出,單純重試在 53.33% 的情況下造成外部副作用重複發生。

為什麼重要

會做事和出錯後收得了尾是兩種不同的能力,後者目前明顯較弱。〔推論〕

可以怎麼用

對寄信、付款、寫資料庫這類有外部副作用的動作,不要把自動重試當預設,先設計可確認、可撤銷的步驟。〔推論〕

展開:證據與限制
  • 這是 arXiv 預印本,尚未經同儕審查;數字來自作者設計的故障情境,不代表一般使用時的比例。
  • arXiv 頁面標示的提交日是 10/4;本刊以它在 arXiv 新論文清單公開的時間收錄。
  • 仍不知道的:不同模型之間復原能力的差距有多大。

來源:UndoBench(一手·論文)

#4Anthropic 擴大資安驗證計畫,三個等級開放 Opus 5.5、Sonnet 5.5、Mythos 5.1

主軸 ① 能力

發生什麼

Anthropic 宣布把 Project Glasswing 與原有的 Cyber Verification Program(Anthropic 針對資安用途的模型存取計畫)合併,分成 Defense、Red Team、Specialized 三個等級。

可用的模型包括 Claude Opus 5.5、Sonnet 5.5、Mythos 5.1 及後續模型。

Specialized 等級需經美國政府協作核准,Glasswing 成員會自動轉入。

Anthropic 稱,Glasswing 夥伴在 4~7 月找出超過 129,000 個已驗證的漏洞,其中超過 33,000 個屬 critical 或 high 等級。〔廠商宣稱〕

Anthropic 同日發布的客戶案例中,文中描述 Comcast 用 Mythos Preview 在 258 個關鍵系統、約 1.7 億行程式碼中找出一個關鍵的認證漏洞。〔廠商宣稱〕

同一篇案例中,Comcast 方面表示,驗證大量的發現已成為新的瓶頸。〔廠商宣稱〕

為什麼重要

前沿模型找漏洞的能力已經需要分級管理存取,而瓶頸正從「找得到」移到「人驗證得完」。〔推論〕

可以怎麼用

資安團隊若考慮申請這類存取,先評估自己驗證與修補大量發現的人力是否跟得上。〔推論〕

展開:證據與限制
  • 漏洞數量與客戶成果都出自 Anthropic 自己的文章,沒有第三方驗證。
  • 兩篇文章只標日期、沒有精確時間,日期為美國時間 10/6。
  • 仍不知道的:各等級的審核標準與申請所需時間。

來源:Expanding the Cyber Verification Program(一手·官方);How Comcast and Booz Allen use Claude Mythos(一手·廠商客戶案例)

今天的工程思維

今天幾則研究指向同一件事:agent 的難處正從「做不做得到」轉向成本、守規矩、出錯後的復原,以及人能不能驗證得完。〔推論〕

來源清單

  1. What Does a Harness Buy? Tokens, Mostly(arXiv,10/6)
  2. Correct Code, Broken Contributions? SWE-CC(arXiv,10/6)
  3. UndoBench(arXiv,10/6)
  4. Expanding the Cyber Verification Program(Anthropic,美國時間 10/6)
  5. How Comcast and Booz Allen use Claude Mythos(Anthropic,美國時間 10/6)

今天最值得知道的事:據 TechCrunch,Mistral 推出 1 兆參數的 Mistral Large 4,並計畫在三週內開放權重。〔媒體報導〕

#5據 TechCrunch,Mistral 推出 1 兆參數的 Large 4,計畫三週內開放權重〔媒體報導〕

產業 b 產品與市場競爭

發生什麼

據 TechCrunch 報導,AI 公司 Mistral 推出 1 兆參數的多模態模型 Mistral Large 4。〔媒體報導〕

據 TechCrunch 報導,Mistral 科學副總裁 Pierre Stock 表示,這個模型用 4,000 張 Nvidia GPU 訓練,比中國競爭者少 2~3 倍。〔媒體報導〕〔廠商宣稱〕

據 TechCrunch 報導,模型目前只能透過設有防護機制(guardrail)的公開端點使用,Mistral 計畫在安全測試後三週內開放權重。〔媒體報導〕

開放權重是指公開模型參數,讓外界可以下載後自行部署。

為什麼重要

若如期開放,企業在美國閉源模型與中國開放模型之外,多了一個可自行部署的大型模型選項。〔推論〕

接下來值得留意

三週後權重是否如期釋出,以及獨立評測的成績如何。〔推論〕

展開:證據與限制
  • 來源是 TechCrunch 的原創報導,含對 Pierre Stock 的訪談。
  • GPU 數量與「比中國競爭者少 2~3 倍」是 Mistral 的說法,沒有獨立驗證。
  • 仍不知道的:獨立評測成績,以及開放權重採用的授權條款。

來源:Mistral's new 1T model aims to leapfrog closed and open rivals(TechCrunch·媒體報導)

#6據 Crunchbase News,今年 AI 新創併購已達 195 件,超過去年全年〔媒體報導〕

產業 a 公司與資金

發生什麼

據 Crunchbase News 依自家資料統計,截至 9/29,今年已完成 195 件 AI 新創併購,比 2025 全年多 14%。〔媒體報導〕

據 Crunchbase News 報導,67 個重複出手的買家占近三年交易約 42%。〔媒體報導〕

據 Crunchbase News 報導,OpenAI 以 20 件收購居首,其中 10 件在 2026 年。〔媒體報導〕

據 Crunchbase News 報導,今年最大的案子之一是 Nscale 以 16.5 億美元收購 Anyscale。〔媒體報導〕

為什麼重要

資金充足的 AI 公司正用連續收購補人才與產品,產業整併的速度在加快。〔推論〕

接下來值得留意

監管機關是否開始審視這類金額不大、但頻繁發生的連續收購。〔推論〕

展開:證據與限制
  • 數字出自 Crunchbase 自家資料庫,統計範圍與分類方式由 Crunchbase 決定。
  • 未公開金額的交易可能沒有完整收錄。
  • 仍不知道的:這些收購中有多少是以人才為主的收購。

來源:AI's Most Active Startups Are Becoming Serial Acquirers(Crunchbase News·媒體報導)

#7據中央社,台電稱台積電「包電廠」仍屬概念討論,未進入政策研議〔媒體報導〕

產業 d 算力與供應鏈

發生什麼

據中央社報導,針對外界傳出擬請台積電「包電廠」的說法,台電表示相關議題仍屬概念討論,尚未形成具體方案,也未進入政策研議或協商程序。〔媒體報導〕

據中央社報導,台電董事長曾文生先前已澄清未提出差別電價。〔媒體報導〕

據中央社報導,台電表示將與主管機關及高科技業交換意見後再共同決定。〔媒體報導〕

為什麼重要

AI 與先進製程帶動用電成長,電力成本怎麼分攤是台灣半導體供應鏈的關鍵變數。〔推論〕

接下來值得留意

主管機關與高科技業後續是否提出具體的電力分攤方案。〔推論〕

展開:證據與限制
  • 來源是中央社報導,內容為台電的官方回應。
  • 報導未說明「包電廠」的具體設計。
  • 仍不知道的:傳聞的最初出處,以及台積電方面的回應。

來源:傳擬請台積電包電廠 台電:未進入政策研議程序(中央社·媒體報導)

今天的產業觀察

今天的產業消息分別落在模型、資金與電力三層:開放模型的競爭、資本的整併,以及支撐算力的電力,都在同時推進。〔推論〕

來源清單

  1. Mistral's new 1T model aims to leapfrog closed and open rivals(TechCrunch,10/6)
  2. AI's Most Active Startups Are Becoming Serial Acquirers(Crunchbase News,10/6)
  3. 傳擬請台積電包電廠 台電:未進入政策研議程序(中央社,10/6)