AI 科技資訊人工智慧的新知入口
首頁 / Gemini 3.6 Flash 與 3.5 Flash-Lite 是什麼?Google 最新 AI 模型的效率升級與定位解析

Gemini 3.6 Flash 與 3.5 Flash-Lite 是什麼?Google 最新 AI 模型的效率升級與定位解析

Google 在 2026 年 7 月 21 日一次發布了三款新模型,分別是 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及專門面向資安領域的 Gemini 3.5 Flash Cyber。其中前兩款是面向一般開發者與企業的主力模型,本文聚焦在這兩款的分析。

Gemini 3.6 Flash 定位為「主力工作模型(workhorse model)」,承接 3.5 Flash 的位置,主攻程式開發與代理任務;Gemini 3.5 Flash-Lite 則是速度最快、成本最低的選項,適合大量自動化與子代理(sub-agent)的呼叫。

可以把這兩款模型想成同一間公司的兩種員工:3.6 Flash 是能獨立處理複雜任務的資深工程師,3.5 Flash-Lite 是跑量最快的行政助理。

一句話重點

Gemini 3.6 Flash 在程式撰寫與多模態能力上超越前代,同時讓輸出 Token 減少約 17%;Gemini 3.5 Flash-Lite 則以每秒 350 個 Token 的輸出速度,提供最低成本的高速 AI 處理。

它們解決什麼問題?

在 AI 代理系統(AI agent system)日漸普及的今天,一個任務往往不只呼叫模型一次,而是由多個子代理串聯執行數十、甚至數百次 API 呼叫。這帶來兩個痛點:

  • 成本快速累積:每次呼叫都要計費,輸出的 Token 越多,費用越高。
  • 延遲影響體驗:代理任務若每步驟都要等待幾秒鐘,整體執行時間會顯著拉長。

Google 這次更新的重點,正是針對這兩個問題:3.6 Flash 透過更精簡的輸出降低每次呼叫成本;3.5 Flash-Lite 則將速度推向極限,讓高流量場景的延遲降到最低。

核心特色

1. Gemini 3.6 Flash:主力模型的全面升級

3.6 Flash 是目前 Gemini Flash 系列中能力最強的版本。它在以下幾個面向有明顯改善:

  • 程式撰寫能力:在 DeepSWE(軟體工程評測)與 MLE Bench(機器學習研究評測)等基準測試中有顯著進步,適合需要持續寫程式或維護程式庫的開發流程。
  • 多模態理解:在處理圖片、文件與影片等非純文字內容時,效果比前一代更穩定。
  • Token 效率提升:相比 3.5 Flash,輸出 Token 用量減少約 17%,意味著相同任務的費用更低,且在多步驟任務中也能以更少的工具呼叫完成目標。

2. Gemini 3.5 Flash-Lite:極速低成本的大量呼叫首選

3.5 Flash-Lite 的設計出發點不是「最強」,而是「最快且夠用」。

  • 輸出速度達每秒 350 個 Token:這相當於一秒鐘內可以輸出大約一頁半的文字,對即時處理或串流(streaming)應用而言非常有優勢。
  • 適合子代理任務:在多代理架構中,負責跑量的子代理往往不需要最強的推理能力,只需要快速、穩定且便宜。3.5 Flash-Lite 正是為此設計。
  • 文件與資料處理:大批量的 OCR(光學字元辨識)、摘要生成、資料萃取等任務,使用 Flash-Lite 可以大幅降低成本。

3. 共同規格:超長脈絡視窗

兩款模型都繼承了 Gemini 系列的超長脈絡視窗(context window):

  • 輸入上限:1,048,576 個 Token(約等於 75 萬字,可以塞入一本厚重小說)。
  • 輸出上限:65,536 個 Token。

這讓它們都能處理超長文件、程式庫,或是累積多輪的複雜對話。

兩款模型的差異比較

比較項目 Gemini 3.6 Flash Gemini 3.5 Flash-Lite
定位 主力工作模型 極速低成本模型
主要強項 程式開發、多模態、複雜推理 高速輸出、大量自動化、子代理
輸出速度 未特別強調 每秒 350 個 Token
輸入費用 $1.50 / 1M Token $0.30 / 1M Token
輸出費用 $7.50 / 1M Token $2.50 / 1M Token
脈絡視窗 1,048,576 Token 1,048,576 Token
適合場景 程式開發、知識工作、代理規劃 文件處理、資料萃取、子代理呼叫

[!NOTE] 以上費用為 API 公開定價,實際費用可能因使用量、地區或合約而有所不同。建議在 Google AI Studio 實際試用後再評估成本。

非工程背景的人需要知道什麼?

對一般使用者或管理者來說,這次更新有幾個值得注意的趨勢:

AI 模型的「價格戰」正在加速。 3.5 Flash-Lite 的輸入費用只要 $0.30 / 1M Token,比過去主力模型的定價低了許多。這意味著使用 AI 的門檻持續下降,中小型團隊也能承擔更大規模的 AI 應用。

「代理系統」成為主流開發架構。 這兩款模型的定位,都明確圍繞著 AI agent 設計。這說明 Google 的策略是把 Gemini 推向自動化流程的核心,而不只是聊天機器人。

Token 效率是新的競爭維度。 輸出 Token 減少 17% 看似小數字,但在高頻呼叫的代理任務中,累積起來的成本節省相當可觀。這是廠商在效能之外,新的差異化競爭點。

適合誰使用?

  • 開發者與工程師:Gemini 3.6 Flash 適合用於 Copilot 整合、程式審查、自動化測試生成等開發流程。
  • 資料工程師:Gemini 3.5 Flash-Lite 適合大批量的文件分類、資料萃取與摘要作業。
  • AI agent 系統設計者:需要多層代理架構時,可以讓頂層的「規劃代理」使用 3.6 Flash,讓執行大量任務的「子代理」使用 3.5 Flash-Lite,達到效能與成本的平衡。
  • 新創公司與個人開發者:Flash-Lite 的低定價讓小規模產品也能快速驗證想法。

可能不適合誰?

  • 需要最高推理深度的任務:若任務需要非常複雜的多步驟推理,Flash 系列可能不如同家族中尚在測試的 Pro 等級模型。
  • 對資安或隱私有高度合規要求的場景:需要確認自身資料是否符合 Google 的服務條款與資料處理協議,才適合使用 API 介接。

目前可以怎麼開始?

兩款模型目前均可透過以下管道取用:

  1. 登入 Google AI Studio,可直接在 Playground 試用。
  2. 透過 Gemini API 呼叫,模型代碼分別為 gemini-3.6-flashgemini-3.5-flash-lite
  3. 在 Vertex AI 上佈署企業級應用。
# 使用 curl 呼叫 Gemini 3.6 Flash(需替換 YOUR_API_KEY)
curl -s https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent?key=YOUR_API_KEY \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"parts":[{"text":"你好,請介紹你自己"}]}]}'

[!IMPORTANT] 若你目前使用的是 Gemini 2.5 Flash-Lite,Google 已宣告該模型於 2026 年 7 月 22 日正式停用(deprecated)。請盡速將 API 呼叫更新至 gemini-3.5-flash-lite,以避免服務中斷。

我們的觀察

這次 Google 一口氣發布三款模型,並刻意突出「代理效率」作為核心賣點,這個訊號值得注意。

過去,AI 模型的競爭主要圍繞在「誰更聰明」,也就是基準測試分數的比拚。但現在的競爭已經開始轉向「誰更省、誰更快、誰更適合跑自動化任務」。Gemini 3.6 Flash 靠著 Token 效率的提升降低實際使用成本,3.5 Flash-Lite 靠著極速輸出搶攻高頻呼叫的場景,這兩個方向都是針對企業落地的痛點在設計。

另外值得一提的是,Gemini 3.6 Flash 已整合進 GitHub Copilot,代表 Google 正在積極把 Gemini 推進開發者的日常工作流,不再只侷限於自家的 Google AI Studio 生態系。這對微軟陣營形成了直接競爭。

整體而言,這批更新代表 Gemini 的 Flash 系列正在走向成熟,不再是試驗性功能,而是可以穩定用於生產環境(production)的選項。

來源