北極星日報 · 試刊
往期列表
-
做 AI agent,多數功夫花在評測與驗證,而不是寫出第一版。〔推論〕
-
讓 AI 自己執行指令之前設好的權限界線,要確認它真的有效。〔推論〕
-
在一份合成的商業流程評測裡,12 個模型共同題組中沒通過檢查的試驗,約有三分之二是正常結束、呼叫過改資料的工具、也沒有回報最終工具錯誤的。驗收 AI 的工作,要看實際結果,不要只看它的自述。〔推論〕
-
OpenAI 的官方選型指南引述其開發者體驗團隊成員的話:模型更懂細微與模糊之處了,過度具體的指示現在可能反而有害。跟新模型協作的寫法可能正在改變:少教步驟,多講邊界和「怎樣算完成」。〔推論〕
-
同一個模型換一套「外殼」,排名就可能反過來。挑 AI 工具時,該比的是「模型+外殼+任務」的組合,不是模型的名字。〔推論〕