跳到主要內容

Gemini 3.6 Flash 實戰選型:AI Agent 該比較能力、速度還是 Token 成本?

新的 AI 模型發布時,大家通常先看 benchmark 排名。但 production Agent 最常失敗的原因,不是模型少了兩分,而是成本、延遲與輸出長度在流量放大後失控。

Google 在同一波更新推出 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite,定位非常清楚:前者在複雜 Agent 與多模態任務之間平衡能力與速度;後者則針對高吞吐、低延遲與低成本工作。

X 上最有價值的訊號,不是官方宣傳,而是大量開發者在發布後二十四小時內回報真實工作負載的差異。

先看價格,再看模型名稱

Google 官方列出的標準價格如下:

  • Gemini 3.6 Flash:每百萬 input tokens 1.50 美元,output tokens 7.50 美元。
  • Gemini 3.5 Flash-Lite:每百萬 input tokens 0.30 美元,output tokens 2.50 美元。

兩者都支援 1M context、最高 64K output、thinking 與 Computer Use 等內建工具。差異不在「能不能做 Agent」,而在每一層工作該用多少能力。

3.5 Flash-Lite 的官方定位是每秒約 350 output tokens,適合大量、短回應、結構明確的工作;3.6 Flash 則更適合需要多步判斷、coding、多模態理解與 master-agent orchestration 的任務。

不要用一個模型處理整條 Agent pipeline

最常見的成本錯誤,是從分類到最終決策全部呼叫同一個高階模型。

Loading diagram...

例如文件處理 Agent 可以先由 Flash-Lite 做 OCR 後分類、欄位抽取與格式驗證;只有遇到矛盾資料、跨文件推理或需要工具操作時,才升級到 3.6 Flash。

這種 routing 能同時降低三種浪費:

  • 簡單任務使用過度推理。
  • 大量輸出由昂貴模型產生。
  • 所有請求都等待較慢的規劃流程。

官方說減少 token,為什麼仍要自己量

Google 表示 3.6 Flash 相較 3.5 Flash 平均減少約 17% output token,在部分 coding benchmark 上降幅更高。這很重要,因為 Agent 成本不只由單價決定,也由模型產生多少思考與中間文字決定。

但 benchmark 的 token reduction 不會自動等於你的帳單下降。實際結果仍受到以下因素影響:

  • system prompt 與工具 schema 長度。
  • thinking level。
  • 是否反覆把完整歷史送回模型。
  • 工具失敗後的重試次數。
  • context cache 是否命中。
  • 回應是否要求冗長解釋。

因此,選型時應記錄「完成一個任務的總成本」,而不是只記每百萬 token 的牌價。

用四個指標測試真實工作負載

建立一組五十到一百個真實任務,對兩款模型記錄:

任務完成率。 最終結果是否通過驗證,而不是模型是否回覆。

端到端延遲。 從請求開始到工具執行與最終輸出完成的時間。

總 token 與總成本。 包含重試、thinking、tool result 與 context。

人工介入量。 人需要修正幾次、修改多少內容,才能交付。

如果 Flash-Lite 便宜三倍,卻讓人工修正時間增加五倍,它就不是較省的選擇。相反地,如果文件抽取的成功率已足夠,高階模型多出的推理能力也不會創造價值。

Computer Use 讓風險跟著能力增加

兩款模型都能搭配 Computer Use,這讓高吞吐 Agent 可以直接操作介面,也讓錯誤更容易造成外部影響。

模型選型不能與權限設計分開。Flash-Lite 適合大量執行,不代表應直接擁有付款、刪除或 production deployment 權限;3.6 Flash 判斷能力較強,也不代表它可以跳過人工核准。

較安全的做法是:

  1. 讓低成本模型產生結構化計畫或候選動作。
  2. 用 deterministic policy 檢查目標與參數。
  3. 高風險操作要求人工確認。
  4. 保存可回放的 tool log。

遷移時注意 model ID 與 thinking 預設值

官方文件列出的 model IDs 為 gemini-3.6-flashgemini-3.5-flash-lite。兩者預設 thinking level 不同:3.6 Flash 為 medium,Flash-Lite 為 minimal。

如果團隊只替換 model ID,沒有固定 thinking、timeout 與輸出限制,測試結果很容易失真。遷移前應把這些參數納入版本控制,並保留舊模型的回退路徑。

結論

Gemini 3.6 Flash 與 3.5 Flash-Lite 不是單純的高低階版本,而是適合不同 Agent 階段的兩種工具。

Flash-Lite 適合大量分類、抽取、轉換與低延遲任務;3.6 Flash 適合複雜規劃、coding、多模態理解與需要較高判斷品質的工作。

真正有效的選型,不是問哪個模型最強,而是把一條 Agent pipeline 拆成不同風險與複雜度,再用完成率、總成本、延遲和人工介入量做 routing。

延伸閱讀