Google 正式釋出 Gemma 4 12B-it 多模態模型適合本地部署



Google DeepMind 於 2026 年 6 月 3 日正式在 Hugging Face 釋出 Gemma 4 12B-it(Unified 版本),這是 Gemma 4 系列中備受期待的中型多模態模型。該模型採用 encoder-free(無編碼器)統一架構,能直接處理文字、圖像與音頻,具備 256K 超長上下文,並在多項基準測試中展現強勁實力,特別適合本地部署與開發者使用。


Gemma 4 12B-it 主要特色

  • 參數規模:11.95B(約 120 億)參數
  • 多模態能力:原生支援文字、圖像、音頻(Audio),可處理可變長寬比與解析度的圖像,以及音頻波形
  • 統一架構:捨棄傳統獨立編碼器,直接將圖像 patch 與音頻波形透過輕量線性層投影至模型嵌入空間,大幅降低延遲並提升整合性
  • 上下文長度:最高支援 256K tokens
  • 多語言支援:超過 140 種語言
  • 授權方式:Apache 2.0(商業友好)

根據官方基準測試,Gemma 4 12B-it 在多項重要評測中表現出色:

  • GPQA Diamond:78.8%
  • MMMU Pro(多模態推理):69.0%
  • LiveCodeBench v6(程式碼能力):72.0%
  • AIME 2026(數學):77.5%
  • 長上下文測試(128K 8-needle):43.4%

整體效能已逼近更大規模的模型,特別在程式碼生成與多模態理解上表現優異。

適合本地部署的設計
Gemma 4 12B 被定位為「工作站級」甜蜜點模型。量化後(Q4_K_M)檔案大小僅約 6.7 GB,適合具備 16GB 以上記憶體的筆電或工作站運行。這也讓它成為目前最強大的「可本地高效運行」的多模態開源模型之一。
使用方式

開發者可透過 Transformers 輕鬆載入:

from transformers import AutoProcessor, AutoModelForMultimodalLM 
model_id = "google/gemma-4-12B-it" 
processor = AutoProcessor.from_pretrained(model_id) 
model = AutoModelForMultimodalLM.from_pretrained(model_id, device_map="auto") 

目前已支援 Ollama、LM Studio 等本地工具,可快速體驗。

Gemma 4 12B-it 的推出,顯示 Google 持續推動開源多模態模型的民主化策略。它在效能、效率與易用性之間取得良好平衡,尤其適合開發者、研究人員與企業在本地環境部署多模態 AI 應用。


相關文章:

Google 發布三款 Gemini Flash 新模型,聚焦效率與成本優化  [7/22/2026]
Google 開發專用 AI 晶片 Frozen v2 優化 Gemini 模型  [7/21/2026]
Google NotebookLM 正式更名為 Gemini Notebook,強化 AI 產品整合  [7/17/2026]
Google 旗下 Gemini 3.5 Pro 旗艦模型的發布再度延後,據傳已全面重建基礎架構,目  [7/14/2026]
Claude Fable 5 與 OpenAI GPT-5.6 領先群倫 Google Gemini  [7/10/2026]
[「擇法善思林之蘭室藏津」的緣起]
吳翔震意外露2點 粉絲激動敲碗想看這個
食安問題一連串 李四川:民進黨政府應該好好重視
福壽公司陷致癌油風暴 今天廠區又火災 網友熱議:盧市長快來看
桃園擴大家戶太陽光電補助 汰舊換新、自發自用也納入獎勵
謝祖武分享「起點低不是結局」 高雄青年局8月加碼5場企業職場體驗
桌球》台灣球迷好熱情!6881名觀眾創下T聯賽歷史新高紀錄
台股重挫近1200點 投顧估本週落在42500至45000點
前電視台女主播二度大鬧士林夜市 這次是吃鐵板燒沒錢付
高雄捷運大東站聯開施工 鳳山轉運站11條公車路線調整
「貓裏紅」連奪國際金獎 英國茶藝評審訪苗栗
後龍山邊媽祖婆建廟 今天動土祈福
高雄小港騎士閃黑狗自摔送醫 犬隻受傷逃離現場
橋梁安全2-1》新北逾千座橋梁每2年健檢 今年194座待修繕
台中西區兒童運動中心8/28開業 主打兒童技擊運動特色
高雄市待售新成屋逼近1.6萬宅 楠梓和鳳山最多
[擇法善思林之蘭室藏津]