tommypkm shared this post · 9h ago
HKEPC

【朱咪咪 3.6 Flash 🤪】原定 6 月推出的 Gemini 3.5 Pro 模型,目前已被證實無預警延後推出。然而,Google 並未因此放緩產品迭代節奏,在毫無預告的情況下,突然發布兩款主打極致效能與輕量化的新模型——Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite,在性能、速度及長文處理能力上都有明顯提升,但所需的 Token 輸出成本更低。

據 Google 指出,Gemini 3.6 Flash 定位為主力中量級模型,主打強大的多模態理解、複雜程式碼生成與長文本處理能力。在性能表現上,相較 Gemini 3.5 Flash 有著明顯提升,尤其在複雜編程、機器學習工程與超長文本檢索等方面的表現更為突出。

在複雜長流程工程測試 DeepSWE v1.1 中,3.6 Flash 的表現從前代的 37% 大幅拉升至 49%;在 MLE-Bench 機器學習工程測試中更展現了 63.9% 對比 49.7% 的顯著跨越,表現甚至超越了目前旗艦級的 Gemini 3.1 Pro。

在長 context(1M Tokens 視窗)的關鍵資訊檢索測試(GDM-MRCR v2)中,Gemini 3.6 Flash 的準確率由 26.6% 飆升至 54.0%,顯著改善了過往長文本模型容易遺漏資訊(Needle in a Haystack)的情況。

Gemini 3.5 Flash-Lite 則是 Gemini 家族中最輕量、成本最低的推論模型,專為大批量數據處理、自動化客服檢索及高頻 API 呼叫等價格敏感型場景而設計。儘管定價較上一代 3.1 Flash-Lite 略有調整,但在整體邏輯推理、自動化 Terminal 控制、電腦操作(Computer Use)及長 context 檢索等領域,均帶來了顯著的突破性進步。

相較於上一代 3.1 Flash-Lite,新模型在 Agent 與電腦操作能力上有顯著升級。在 GDPVal-AA v2 知識工作評測中,Elo 分數從 642 分暴增至 1140 分;在 OSWorld-Verified(電腦操作能力)測試中則達到 74.0% 的準確率,不僅相較前代的 54.3% 成長顯著,更一舉超越了 GPT-5.4 mini(72.1%)與 Claude Haiku 4.5(50.7%)。

在 128k 視窗長文本綜合檢索(GDM-MRCR v2)測試中,Gemini 3.5 Flash-Lite 取得了 72.2% 的優異成績;即使在 1M Tokens 的極限 context 視窗下,3.5 Flash-Lite 仍保有 21.3% 的檢索成功率。在低成本要求下,能確保企業在處理超長合約、大型文件或日誌分析時不致遺漏重要資訊。

據 Google 官方透露,旗艦級 Gemini 3.5 Pro 延宕是要針對複雜邏輯作出進一步的能力調校,以確保其在面對 GPT-5.6、Grok 4.5 與 Claude 5 等潛在競爭對手時具備絕對優勢。建議目前正在使用 Gemini 3.1 Pro 的用家,可以先使用 Gemini 3.6 Flash。同時,Google 內部已正式啟動下一代基座模型 Gemini 4 的前期研發與預訓練工作,具體發布時間將另行公佈。