Gemini 3.6 Flash 與 3.5 Flash-Lite 是什麼?Google 最新 AI 模型的效率升級與定位解析
Google 在 2026 年 7 月 21 日一次發布了三款新模型,分別是 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及專門面向資安領域的 Gemini 3.5 Flash Cyber。其中前兩款是面向一般開發者與企業的主力模型,本文聚焦在這兩款的分析。
Gemini 3.6 Flash 定位為「主力工作模型(workhorse model)」,承接 3.5 Flash 的位置,主攻程式開發與代理任務;Gemini 3.5 Flash-Lite 則是速度最快、成本最低的選項,適合大量自動化與子代理(sub-agent)的呼叫。
可以把這兩款模型想成同一間公司的兩種員工:3.6 Flash 是能獨立處理複雜任務的資深工程師,3.5 Flash-Lite 是跑量最快的行政助理。
一句話重點
Gemini 3.6 Flash 在程式撰寫與多模態能力上超越前代,同時讓輸出 Token 減少約 17%;Gemini 3.5 Flash-Lite 則以每秒 350 個 Token 的輸出速度,提供最低成本的高速 AI 處理。
它們解決什麼問題?
在 AI 代理系統(AI agent system)日漸普及的今天,一個任務往往不只呼叫模型一次,而是由多個子代理串聯執行數十、甚至數百次 API 呼叫。這帶來兩個痛點:
- 成本快速累積:每次呼叫都要計費,輸出的 Token 越多,費用越高。
- 延遲影響體驗:代理任務若每步驟都要等待幾秒鐘,整體執行時間會顯著拉長。
Google 這次更新的重點,正是針對這兩個問題:3.6 Flash 透過更精簡的輸出降低每次呼叫成本;3.5 Flash-Lite 則將速度推向極限,讓高流量場景的延遲降到最低。
核心特色
1. Gemini 3.6 Flash:主力模型的全面升級
3.6 Flash 是目前 Gemini Flash 系列中能力最強的版本。它在以下幾個面向有明顯改善:
- 程式撰寫能力:在 DeepSWE(軟體工程評測)與 MLE Bench(機器學習研究評測)等基準測試中有顯著進步,適合需要持續寫程式或維護程式庫的開發流程。
- 多模態理解:在處理圖片、文件與影片等非純文字內容時,效果比前一代更穩定。
- Token 效率提升:相比 3.5 Flash,輸出 Token 用量減少約 17%,意味著相同任務的費用更低,且在多步驟任務中也能以更少的工具呼叫完成目標。
2. Gemini 3.5 Flash-Lite:極速低成本的大量呼叫首選
3.5 Flash-Lite 的設計出發點不是「最強」,而是「最快且夠用」。
- 輸出速度達每秒 350 個 Token:這相當於一秒鐘內可以輸出大約一頁半的文字,對即時處理或串流(streaming)應用而言非常有優勢。
- 適合子代理任務:在多代理架構中,負責跑量的子代理往往不需要最強的推理能力,只需要快速、穩定且便宜。3.5 Flash-Lite 正是為此設計。
- 文件與資料處理:大批量的 OCR(光學字元辨識)、摘要生成、資料萃取等任務,使用 Flash-Lite 可以大幅降低成本。
3. 共同規格:超長脈絡視窗
兩款模型都繼承了 Gemini 系列的超長脈絡視窗(context window):
- 輸入上限:1,048,576 個 Token(約等於 75 萬字,可以塞入一本厚重小說)。
- 輸出上限:65,536 個 Token。
這讓它們都能處理超長文件、程式庫,或是累積多輪的複雜對話。
兩款模型的差異比較
| 比較項目 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| 定位 | 主力工作模型 | 極速低成本模型 |
| 主要強項 | 程式開發、多模態、複雜推理 | 高速輸出、大量自動化、子代理 |
| 輸出速度 | 未特別強調 | 每秒 350 個 Token |
| 輸入費用 | $1.50 / 1M Token | $0.30 / 1M Token |
| 輸出費用 | $7.50 / 1M Token | $2.50 / 1M Token |
| 脈絡視窗 | 1,048,576 Token | 1,048,576 Token |
| 適合場景 | 程式開發、知識工作、代理規劃 | 文件處理、資料萃取、子代理呼叫 |
[!NOTE] 以上費用為 API 公開定價,實際費用可能因使用量、地區或合約而有所不同。建議在 Google AI Studio 實際試用後再評估成本。
非工程背景的人需要知道什麼?
對一般使用者或管理者來說,這次更新有幾個值得注意的趨勢:
AI 模型的「價格戰」正在加速。 3.5 Flash-Lite 的輸入費用只要 $0.30 / 1M Token,比過去主力模型的定價低了許多。這意味著使用 AI 的門檻持續下降,中小型團隊也能承擔更大規模的 AI 應用。
「代理系統」成為主流開發架構。 這兩款模型的定位,都明確圍繞著 AI agent 設計。這說明 Google 的策略是把 Gemini 推向自動化流程的核心,而不只是聊天機器人。
Token 效率是新的競爭維度。 輸出 Token 減少 17% 看似小數字,但在高頻呼叫的代理任務中,累積起來的成本節省相當可觀。這是廠商在效能之外,新的差異化競爭點。
適合誰使用?
- 開發者與工程師:Gemini 3.6 Flash 適合用於 Copilot 整合、程式審查、自動化測試生成等開發流程。
- 資料工程師:Gemini 3.5 Flash-Lite 適合大批量的文件分類、資料萃取與摘要作業。
- AI agent 系統設計者:需要多層代理架構時,可以讓頂層的「規劃代理」使用 3.6 Flash,讓執行大量任務的「子代理」使用 3.5 Flash-Lite,達到效能與成本的平衡。
- 新創公司與個人開發者:Flash-Lite 的低定價讓小規模產品也能快速驗證想法。
可能不適合誰?
- 需要最高推理深度的任務:若任務需要非常複雜的多步驟推理,Flash 系列可能不如同家族中尚在測試的 Pro 等級模型。
- 對資安或隱私有高度合規要求的場景:需要確認自身資料是否符合 Google 的服務條款與資料處理協議,才適合使用 API 介接。
目前可以怎麼開始?
兩款模型目前均可透過以下管道取用:
- 登入 Google AI Studio,可直接在 Playground 試用。
- 透過 Gemini API 呼叫,模型代碼分別為
gemini-3.6-flash與gemini-3.5-flash-lite。 - 在 Vertex AI 上佈署企業級應用。
# 使用 curl 呼叫 Gemini 3.6 Flash(需替換 YOUR_API_KEY)
curl -s https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent?key=YOUR_API_KEY \
-H "Content-Type: application/json" \
-d '{"contents":[{"parts":[{"text":"你好,請介紹你自己"}]}]}'
[!IMPORTANT] 若你目前使用的是 Gemini 2.5 Flash-Lite,Google 已宣告該模型於 2026 年 7 月 22 日正式停用(deprecated)。請盡速將 API 呼叫更新至
gemini-3.5-flash-lite,以避免服務中斷。
我們的觀察
這次 Google 一口氣發布三款模型,並刻意突出「代理效率」作為核心賣點,這個訊號值得注意。
過去,AI 模型的競爭主要圍繞在「誰更聰明」,也就是基準測試分數的比拚。但現在的競爭已經開始轉向「誰更省、誰更快、誰更適合跑自動化任務」。Gemini 3.6 Flash 靠著 Token 效率的提升降低實際使用成本,3.5 Flash-Lite 靠著極速輸出搶攻高頻呼叫的場景,這兩個方向都是針對企業落地的痛點在設計。
另外值得一提的是,Gemini 3.6 Flash 已整合進 GitHub Copilot,代表 Google 正在積極把 Gemini 推進開發者的日常工作流,不再只侷限於自家的 Google AI Studio 生態系。這對微軟陣營形成了直接競爭。
整體而言,這批更新代表 Gemini 的 Flash 系列正在走向成熟,不再是試驗性功能,而是可以穩定用於生產環境(production)的選項。
來源
- 官方公告:Google Blog
- 官方文件:Google AI for Developers
- 查閱日期:2026-07-22