Google 在 12 月 11 日發表了 Gemini 2.0,宣稱這是面向 AI 代理時代的模型,並開放了 Gemini 2.0 Flash 實驗版的試用。Flash 模型主打速度,但其表現卻令人驚艷,甚至超越了 Gemini 1.5 Pro。更令人振奮的是,Google 實現了先前在 Gemini 發布影片中展示的鏡頭即時互動功能,彎道超車 OpenAI,且這些功能都是免費使用的!本文將帶您深入了解 Gemini 2.0 Flash 的強大功能,並在後半段展示實際使用情況。
Google 的逆襲:Gemini 1.5 到 2.0 的進化
過去幾年,Google 在 AI 領域一直被 OpenAI 佔據上風,直到 Gemini 1.5 的推出才開始扭轉局面。Gemini 1.5 以其優異的文筆、超長的 1M Context Window 大小以及原生支援的多模態辨識能力,成功地整合到 NotebookLM 和搜尋引擎等功能中。
現在,Gemini 2.0 的推出更上一層樓,Google 執行長皮蔡表示,如果 Gemini 1.0 是關於組織和理解訊息,那麼 Gemini 2.0 就是讓資訊變得更加有用。Gemini 2.0 支援原生輸出聲音和圖像,原生支援工具使用,並可即時串流輸入聲音和影像做出回應。這意味著,與鏡頭畫面即時互動、即時讀取裝置螢幕畫面並提供遊戲建議等功能,都已成為現實。
Gemini 2.0 Flash:速度與精度的完美結合
目前公開可用的版本是 Gemini 2.0 Flash 實驗版。雖然 Flash 模型在 Gemini 系列中偏向低延遲、精度較低的模型,但它在 MMLU-Pro、Natural2Code、LiveCodeBench、MATH 等多個測試資料集上,都贏過了 Gemini 1.5 Pro,僅在長文閱讀和音檔理解能力上略遜一籌。
在語言模型競技場的排名中,Gemini 2.0 Flash 實驗版也躍升至第三名,僅次於 Gemini EXP 1206 和最新版的 GPT-4o。
AI 代理時代的來臨:Project Astra、Mariner 和 Jules
Google 強調 Gemini 2.0 的 Agent 功能,並介紹了三款 Agent:AI 助理 Project Astra、可操控瀏覽器並執行複雜任務的 Project Mariner,以及程式設計 Agent Jules。這些專案顯示 Gemini 2.0 在工具使用方面具有相當大的潛力。
Project Astra 介紹片
Project Mariner 介紹片
Jules 介紹片
Gemini 2.0 Flash 實測:即時互動、圖像辨識和程式生成
接下來,我們將實際測試 Gemini 2.0 Flash 的能力。YT嵌入影片的皆已經標註時間戳,點開就是測試的片段
即時互動測試
透過 Google AI Studio 的 Stream Realtime 頁面,我們可以使用麥克風或相機進行即時輸入。
即時互動開啟 Grounding 進行網路搜尋測試
看起來再開啟 Grounding 功能後,即時語音功能能夠搜尋網路獲取資訊
即時鏡頭輸入測試
這部分因為我的電腦沒有鏡頭,所以我將手機畫面投射到電腦上,用手機境頭測試 Gemini 2.0 Flash 辨識拍到的畫面。
結果看起來 Gemini 2.0 Flash 確實可以即時獲取畫面中的資訊。
螢幕畫面互動測試
讓 Gemini 2.0 Flash 辨識螢幕畫面中的內容,並回答相關問題。
程式生成測試
使用 VSCode 和 Cline 插件,測試 Gemini 2.0 Flash 的程式生成能力。
個人感覺 Gemini 2.0 Flash 在程式能力方面扔然稍顯不足,即便給了參考範例,依舊有很高的機率寫錯;並且如果直接回報遇到的問題而不提到相關可能的原因,Gemini 2.0 Flash 很可能會瞎改,完全找不到方向。
總結:Gemini 2.0 Flash 的潛力與挑戰
Gemini 2.0 Flash 在即時互動和鏡頭畫面辨識方面表現出色,成功實現了先前宣傳片中的即時互動功能。雖然程式生成能力仍有待提升,但其輕巧快速的特性以及免費使用的優勢,使其成為一個值得關注的 AI 模型。我個人相當期待 Gemini 2.0 Pro 的推出,能帶來更強大的程式設計和問題解決能力.