今天最值得知道的事:GitHub 讓 Copilot 的本機沙盒正式上線,並上架 Anthropic 的新小模型 Claude Haiku 5.5。代理的執行邊界與分工用的小模型,正在變成開發工具內建的選項。〔推論〕
#1GitHub Copilot 上架 Anthropic 新小模型 Claude Haiku 5.5
此則連結
主軸 ③ 協作
發生什麼
GitHub 宣布,Anthropic 的小型模型 Claude Haiku 5.5 已可在 Copilot 的 Pro、Pro+、Max、Business、Enterprise 方案中使用,定位是子代理(subagent,由主代理分派小任務的輔助代理)、快速編輯與終端機任務,依用量照供應商牌價計費。
GitHub 文中描述,早期測試中 Haiku 5.5 在許多程式任務上與 Claude Sonnet 5 表現相當,且用的 token 明顯較少。〔廠商宣稱〕
據 Simon Willison 的部落格整理,Haiku 5.5 在 10 萬 token 以內的價格為每百萬 token 0.10 美元/0.50 美元,超過 10 萬 token 為 0.50 美元/2.50 美元。〔未驗證〕
Willison 也指出,Haiku 5.5 使用新的分詞器(tokenizer,把文字切成 token 的元件),他以一段長提示測得 token 數約為 Haiku 4.5 的 1.25 倍。〔未驗證〕
為什麼重要
子代理用的小模型一換代,多代理分工的成本結構就跟著變;分詞器改變也代表牌價下降不一定等於帳單同比例下降。〔推論〕
可以怎麼用
把現有的子代理任務用 Haiku 5.5 跑一輪,以實際 token 用量而非牌價比較成本後再決定是否切換。〔推論〕
來源:GitHub Changelog:Claude Haiku 5.5 in GitHub Copilot(一手·官方);Simon Willison:Claude Haiku 5.5(個人部落格)
展開:證據與限制
- 來源原文性質:Copilot 上架與定位出自 GitHub 官方公告;價格與分詞器數字只出自 Willison 的整理,本期未能讀取 Anthropic 的官方公告頁,數字以官方公告為準。
- 反方:「與 Sonnet 5 相當」是 GitHub 早期測試的說法,文中沒有公布測試題目與方法。
- 仍不知道的:在長任務或需要深度推理的工作上,Haiku 5.5 與較大模型的差距有多大。
#2GitHub Copilot 本機沙盒正式上線
此則連結
主軸 ③ 協作
發生什麼
GitHub 宣布,Copilot 的本機沙盒(sandbox,把代理的動作限制在隔離環境中的機制)正式上線,涵蓋 Copilot CLI、Copilot app 與 VS Code 的 Agent Host 工作階段。
沙盒以 Microsoft eXecution Container(MXC)在 Windows、macOS、Linux 上統一套用政策,可限制檔案、網路、憑證與 Git 存取,範圍包含 MCP(讓模型連接外部工具的協定)與 language server,並支援企業集中強制設定;不另外收費。
GitHub 另外宣布,Copilot CLI 1.0.94-0 的 /model 可以找到並選用在 Ollama(在自己電腦上執行開源模型的工具)上執行的本機模型;模型須支援工具呼叫與串流,而且選用本機模型不等於離線,要另外設定 COPILOT_OFFLINE=true。
為什麼重要
讓代理自主做更多事的前提是明確的執行邊界;主流工具把沙盒做成正式功能,降低了團隊放手讓代理執行指令的門檻。〔推論〕
可以怎麼用
先在一個專案開啟沙盒、只開放必要的網路與憑證,觀察代理被擋下哪些動作,再決定要放寬什麼。〔推論〕
來源:GitHub Changelog:Local sandboxing for GitHub Copilot now generally available(一手·官方);GitHub Changelog:Local models in GitHub Copilot CLI(一手·官方)
展開:證據與限制
- 來源原文性質:兩則都是 GitHub 自己的公告;沙盒實際能擋下哪些手法,文中沒有第三方測試。
- 適用條件:本機模型須支援工具呼叫與串流;文中預告的本機模型智慧路由尚未推出。
#3Cloudflare 公開資安代理系統的設計:先蒐證、後推論
此則連結
主軸 ② 思維
發生什麼
Cloudflare 在官方部落格說明,它為資安調查打造的代理系統把確定性的證據蒐集與 AI 推論分開:先跑固定的偵察流程,再把證據交給模型判斷。
系統用四個平行的專職代理分別處理流量分析、客戶脈絡、全球遙測與威脅情報,再由一個彙整代理統合,取代單一的通用代理。
Cloudflare 表示,這樣分工是為了減少幻覺與範圍漂移。〔廠商宣稱〕
應用程式碼會驗證模型引用的每項證據確實存在、屬於這次調查、而且支持所附的主張;另有輕量的分流模型先篩出很可能是誤報的告警,讓它們不進入專職代理的分析。
文中也區分「從未檢查」、「檢查無結果」、「確認不存在」三種狀態,避免把沒查過當成沒問題。
為什麼重要
這是把「證據由程式碼取得並驗證、模型只負責判斷」做進早期 beta 服務的具體示範,也說明多個窄範圍代理可以比一個萬用代理更容易控管。〔推論〕
可以怎麼用
在自己的代理流程裡先讓程式蒐集證據、要求模型的每個結論附上證據出處,再用程式檢查引用是否存在。〔推論〕
來源:Cloudflare Blog:Building an evidence-grounded agentic security operations harness on Cloudflare(一手·官方)
展開:證據與限制
- 來源原文性質:廠商自述的設計,文中沒有量化的效能數字,也沒有失敗案例。
- 適用條件:服務目前是 Managed Defense 的早期 beta;資安調查的證據來源可以事先列舉,開放式任務是否同樣適用,文中沒有談。
- 仍不知道的:分流模型濾掉誤報時,漏掉真實威脅的比例。
今天的工程思維
今天三則指向同一個方向:讓模型負責判斷,但把它能碰到的檔案、網路與證據交給程式碼劃界和檢查;換用更便宜的模型時,也要用實際用量而不是牌價來算帳。〔推論〕
今天最值得知道的事:NVIDIA 與 Microsoft 推出 RTX Spark 平台的 Windows 電腦。AI PC 的競爭因此多了一家主要晶片廠。〔推論〕
#4NVIDIA 與 Microsoft 推出 RTX Spark AI PC
此則連結
產業 b 產品與市場競爭
發生什麼
NVIDIA 在官方部落格宣布與 Microsoft 推出 RTX Spark 平台的 Windows 電腦:筆電即日起預購、10/16 上市,最高 128GB 統一記憶體;緊湊型桌機 11 月上市,合作廠商包括 Acer、ASUS、Dell、HP、Lenovo、MSI、Gigabyte。
NVIDIA 文中描述,RTX Spark 提供最高約 1 petaflop(每秒一千兆次浮點運算,FP4 精度)的 AI 算力。〔廠商宣稱〕
據 TechCrunch 報導,Microsoft 的 Surface RTX Spark Dev Box 起價 6,000 美元,Dell XPS 16 Creator Edition 售價 3,800 美元。〔媒體報導〕
為什麼重要
NVIDIA 把自家平台帶進主流 Windows 電腦,AI PC 的競爭格局會因此改變。〔推論〕
接下來值得留意
10/16 上市後的實際售價與銷量,會顯示高價 AI PC 的需求有多大。〔推論〕
來源:NVIDIA Blog(一手·官方);TechCrunch(媒體報導)
展開:證據與限制
- 來源原文性質:規格與上市時程出自 NVIDIA 官方;售價出自 TechCrunch 報導。
- 反方:1 petaflop 是廠商標示的峰值算力,實際執行大模型的速度未見第三方測試。
#5據中央社,廣達第 3 季營收創單季新高,Vera Rubin 第 4 季小量出貨〔媒體報導〕
此則連結
產業 d 算力與供應鏈
發生什麼
據中央社報導,廣達 9 月營收約新台幣 3,253 億元,月減 23.3%、年增 76.7%;第 3 季營收 1.1155 兆元,季增 7.6%、年增 125%,創單季新高。〔媒體報導〕
據中央社報導,廣達表示,NVIDIA 下一代的 Vera Rubin 平台第 4 季小量出貨、明年第 1 季放量,GB300 出貨穩定。〔媒體報導〕〔廠商宣稱〕
為什麼重要
台灣伺服器代工廠的營收與出貨時程,是 AI 資料中心建置速度的直接供應鏈指標。〔推論〕
接下來值得留意
Vera Rubin 平台明年第 1 季能否如廣達所說放量。〔推論〕
來源:中央社(媒體報導)
展開:證據與限制
- 來源原文性質:中央社報導,營收數字來自公司公告,出貨時程是公司說法。
- 仍不知道的:9 月營收月減的原因,報導中未見說明。
#6據 TechCrunch,Nous Research 證實估值 15 億美元〔媒體報導〕
此則連結
產業 a 公司與資金
發生什麼
據 TechCrunch 報導,開發開源 AI 代理的 Nous Research 證實完成 9,000 萬美元 B 輪、估值 15 億美元,累計募資 1.58 億美元;由 Robot Ventures 領投,NVIDIA、USV、Menlo、Samsung、1789 Capital 參與。〔媒體報導〕
據 TechCrunch 報導,Nous Research 估計,旗下開源的 Hermes Agent 已被複製逾 2,400 萬次、約占全球 AI token 用量 2.5%。〔媒體報導〕〔廠商宣稱〕
為什麼重要
開源代理公司也能拿到十億美元以上的估值,顯示資金不只流向封閉模型的實驗室。〔推論〕
接下來值得留意
開源代理的高使用量能否轉成企業客戶的付費收入。〔推論〕
來源:TechCrunch(媒體報導)
展開:證據與限制
- 來源原文性質:TechCrunch 報導;token 占比是公司自己的估計,未見獨立驗證。
- 仍不知道的:token 占比的計算方式與資料來源。
今天的產業觀察
資金與硬體同時往代理靠攏:NVIDIA 把高 AI 算力帶進 Windows 電腦,開源代理公司拿到高估值,資料中心伺服器的季營收仍在成長。〔推論〕