給觀察者2026.07.27

AI 技術週報:模型成本、存取邊界與權重配送成為新競爭點

這週最重要的變化,不是單一旗艦模型再拿下一個榜首,而是 AI 規模化的成本被拆成四個可操作問題:通用模型的每任務成本、專用模型的存取邊界、雲端加速器選擇,以及模型權重在叢集內的搬運時間。

  • Gemini 3.6 Flash 與 3.5 Flash-Lite 已正式上線,但模型遷移不只是換 ID,部分取樣參數與對話格式也要調整。
  • Gemini 3.5 Flash Cyber 顯示專用模型可以用較小模型換取高頻掃描,但能力越敏感,提供方式越可能受限。
  • Microsoft、AMD 與 NVIDIA 的新動作都在處理同一件事:推論成本不只由 GPU 算力決定,資料準備、權重配送與啟動時間也會進入帳單。

Gemini 3.6 Flash 與 3.5 Flash-Lite 把成本競爭拉到「每個任務」

發生什麼事

Google 在 7 月 21 日讓 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 正式上線。Gemini API release notes 把兩者標為一般可用(GA)與可供正式環境使用,而不是 preview。3.6 Flash 的 API 價格是每百萬輸入 token 1.50 美元、輸出 token 7.50 美元;3.5 Flash-Lite 則是 0.30 與 2.50 美元。

已確認的事實

Google 開發者文件列出兩個穩定 model ID,兩者都支援 100 萬 token context window、最高 64K 輸出、thinking 與 Computer Use。3.6 Flash 的輸入價格與 3.5 Flash 相同,輸出價格由每百萬 token 9 美元降到 7.50 美元。Google 同時要求遷移者移除已棄用的 temperaturetop_ptop_k 與預填 model turn;因此這不是完全無痛的端點替換。

Google 發布文中的 DeepSWE、OSWorld 與 MLE Bench 數字,是 Google 整理或引用的測試結果,不能直接當成每個團隊都會得到的成本或品質提升。

為什麼值得關注

真正影響 Agent 帳單的,是單價乘上輸出長度、推理回合與工具呼叫次數。Google 把「較低輸出單價」與「較少 token、較少執行迴圈」放在一起,代表競爭開始轉向每任務成本。團隊應用自己的長任務與工具呼叫 trace,比較成功率、總 token、延遲及失敗重試。

目前仍不知道什麼

目前沒有跨供應商、跨工作負載的獨立正式環境結果,能證明官方 benchmark 改善會等比例反映在總帳單。文件也提醒,3.6 Flash 在簡單前端工作可能增加探索步驟,部分視覺排版仍是舊模型較受偏好。最佳點仍要由實際任務決定。

Gemini 3.5 Flash Cyber 把「能力更強」與「誰能用」綁在一起

發生什麼事

Google DeepMind 同日公開 Gemini 3.5 Flash Cyber。這是一個從 3.5 Flash 微調而來的資安專用模型,設計目標是尋找、驗證與修補漏洞,並由 CodeMender 以多個子 Agent 反覆掃描程式碼路徑後整合報告。

已確認的事實

這個模型尚未對一般開發者上線。Google 的原文狀態是「soon」,只會先透過 CodeMender 提供給政府與可信任合作夥伴的 limited-access pilot。Google 公布 CyberGym、Big Sleep 與 Chrome production commit scanning 的測試,也自述模型在兩小時內找到遠端程式碼執行與記憶體損毀漏洞;這些都是供應商測試與案例,不是獨立重現的普遍結果。

為什麼值得關注

這項發布的重點不是又多一個資安模型,而是專用小模型配合多次呼叫,可能比單次昂貴的大模型更適合搜尋龐大的漏洞空間。它同時揭露另一個採用條件:當模型能產生可用 exploit,產品可用性不再只由技術成熟度決定,也會被雙重用途風險、客戶資格與部署治理限制。

目前仍不知道什麼

Google 沒有公布一般可用日期、公開 API、價格或完整准入標準。外部團隊也無法用相同環境重現未公開漏洞測試。現階段能確認的是架構方向與受限試點,不能寫成「資安模型已普及」或「已能自動保護所有程式庫」。

Microsoft 與 AMD 把 Azure AI 基礎設施擴成異質選擇

發生什麼事

Microsoft 在 7 月 20 日宣布三個 upcoming Azure 方案:面向資料處理的 HDv2、面向晶片設計與技術運算的 HXv2,以及採用 AMD Helios rack-scale 平台、面向大型推論的 ND MI455X v7。AMD 的同步公告則確認 Helios 整合 MI455X GPU、EPYC「Venice」CPU、Pensando 網路與 ROCm 軟體。

已確認的事實

Microsoft 公告使用的是「upcoming」與「designed to」,沒有宣稱三種 VM 已可訂購。AMD 表示 Helios 預計在 2026 年下半年開始出貨給包含 Microsoft 在內的客戶。HDv2、HXv2 公布了核心數、記憶體與網路規格;ND MI455X v7 則沒有公開價格、區域、一般可用日期或可比較的推論 benchmark。

為什麼值得關注

雲端 AI 成本正從「選哪張 GPU」變成工作負載配對問題。資料準備、搜尋與 Agent 協調可能先卡在 CPU、記憶體與網路;推論才進入加速器。異質選擇可能降低供應風險,也會增加 ROCm、框架相容性與效能驗證成本。

目前仍不知道什麼

目前沒有價格、可用區域、實際上線日與第三方性價比測試,因此不能推論 AMD 方案已比既有 Azure GPU 更便宜或更快。這是一個已確認的部署承諾,不是已完成的客戶可用服務。

ModelExpress 把模型啟動瓶頸從儲存下載改成權重配送

發生什麼事

NVIDIA 在 7 月 24 日公開 ModelExpress。它會先尋找叢集中已載入相容權重的 serving peer,再透過 NIXL 與 P2P RDMA 把權重直接從 GPU 傳到 GPU;找不到 peer 時,才依環境改走 object storage 串流、GPUDirect Storage 或傳統載入路徑。

已確認的事實

官方 GitHub repository採 Apache 2.0 授權,列出 vLLM、SGLang、TensorRT-LLM 與 NVIDIA Dynamo 整合。NVIDIA 在 8×B200、ConnectX-7、vLLM 0.23.0 與 DeepSeek-V4-Pro 的指定環境中,測得 P2P 權重載入 11 秒;搭配相容的 JIT kernel cache 後,從程序啟動到 API ready 由 8 分 1 秒降到 1 分 44 秒。這些數字是 NVIDIA 的單一環境測試,不是跨硬體的獨立結論。

為什麼值得關注

當 checkpoint 達數百 GB,autoscaling、rolling update 與 post-training 都會重複搬運權重。ModelExpress 把已載入的 GPU 視為可重用來源,將「每個 replica 各自冷啟動」改成「先載入一次,再向叢集內 fan-out」。若能重現,等待時間、外部 ingress 與重複 warm-up 都可能下降。

目前仍不知道什麼

repository 已公開,但沒有穩定 release 清單,也列出 GDS 在 tensor parallel 場景可能讀取完整 checkpoint、反而降低預期收益的 known issue;RL refit、預測式預熱與多層快取仍在 roadmap。它現在是可測試的開源元件,不等於所有 Kubernetes 或雲端叢集都能直接取得相同倍數。

我的判斷:AI 採用門檻正在從模型選擇變成整條成本鏈

我認為這週的共同訊號,是「更強模型」已不足以解釋採用速度。通用模型要看每個成功任務花多少錢;專用模型要看誰能取得;雲端要看不同工作負載如何配 CPU、GPU、記憶體與網路;開源部署還要看權重與 kernel artifact 如何移動。這四個問題分屬不同層,卻會一起決定產品能否從測試進入穩定營運。

下週值得繼續觀察三個訊號:Gemini 新模型的外部正式環境成本、Flash Cyber 的試點准入與公開介面、以及 ModelExpress 是否出現穩定 release 與非 NVIDIA 團隊的重現結果。Microsoft 與 AMD 方面,則要等 Azure 公布區域、價格與可用日期,才有足夠資料比較採購價值。


主要來源:Google Gemini 發布文Gemini API release notesGoogle DeepMind Flash CyberMicrosoft Azure 與 AMD 公告NVIDIA ModelExpress

相關文章

給觀察者
AI 技術週報:Agent 進入長時間執行,產品、安全與硬體開始一起改寫
2026.07.26
給觀察者
Box 創辦人 Aaron Levie 訪談心得:人為什麼還在 AI workflow 頭尾、企業 AI 導入為什麼比矽谷想的慢
2026.05.20
給觀察者
NVIDIA OpenShell:讓自主 AI Agent 安全執行的三層架構
2026.03.22
給觀察者
GTC 2026 重點整理:NVIDIA 從賣 GPU 轉型為賣 AI 工廠
2026.03.21