Google 正式釋出 Gemma 4 12B-it 多模態模型適合本地部署



Google DeepMind 於 2026 年 6 月 3 日正式在 Hugging Face 釋出 Gemma 4 12B-it(Unified 版本),這是 Gemma 4 系列中備受期待的中型多模態模型。該模型採用 encoder-free(無編碼器)統一架構,能直接處理文字、圖像與音頻,具備 256K 超長上下文,並在多項基準測試中展現強勁實力,特別適合本地部署與開發者使用。


Gemma 4 12B-it 主要特色

  • 參數規模:11.95B(約 120 億)參數
  • 多模態能力:原生支援文字、圖像、音頻(Audio),可處理可變長寬比與解析度的圖像,以及音頻波形
  • 統一架構:捨棄傳統獨立編碼器,直接將圖像 patch 與音頻波形透過輕量線性層投影至模型嵌入空間,大幅降低延遲並提升整合性
  • 上下文長度:最高支援 256K tokens
  • 多語言支援:超過 140 種語言
  • 授權方式:Apache 2.0(商業友好)

根據官方基準測試,Gemma 4 12B-it 在多項重要評測中表現出色:

  • GPQA Diamond:78.8%
  • MMMU Pro(多模態推理):69.0%
  • LiveCodeBench v6(程式碼能力):72.0%
  • AIME 2026(數學):77.5%
  • 長上下文測試(128K 8-needle):43.4%

整體效能已逼近更大規模的模型,特別在程式碼生成與多模態理解上表現優異。

適合本地部署的設計
Gemma 4 12B 被定位為「工作站級」甜蜜點模型。量化後(Q4_K_M)檔案大小僅約 6.7 GB,適合具備 16GB 以上記憶體的筆電或工作站運行。這也讓它成為目前最強大的「可本地高效運行」的多模態開源模型之一。
使用方式

開發者可透過 Transformers 輕鬆載入:

from transformers import AutoProcessor, AutoModelForMultimodalLM 
model_id = "google/gemma-4-12B-it" 
processor = AutoProcessor.from_pretrained(model_id) 
model = AutoModelForMultimodalLM.from_pretrained(model_id, device_map="auto") 

目前已支援 Ollama、LM Studio 等本地工具,可快速體驗。

Gemma 4 12B-it 的推出,顯示 Google 持續推動開源多模態模型的民主化策略。它在效能、效率與易用性之間取得良好平衡,尤其適合開發者、研究人員與企業在本地環境部署多模態 AI 應用。


相關文章:

Google Gemini 3.7 Flash 登場,強化編碼與 Agent 能力,同步調降價格  [8/14/2026]
Google Gemini Notebook 升級雲端電腦環境,實測支援生成原生可編輯 PPTX 簡  [8/5/2026]
Google Earth整合 AI生成功能引發深偽造假疑慮,上線不到24小時緊急撤回  [8/3/2026]
Google Gemini Spark 個人 AI 代理助理在台開放  [7/30/2026]
Google 發布三款 Gemini Flash 新模型,聚焦效率與成本優化  [7/22/2026]
[「擇法善思林之蘭室藏津」的緣起]
杭州亞運圍棋金牌教練遭撤銷資格、錯失100萬國光獎金 告錯人敗訴確定
中職》「大家都說兄弟打擊變好了」 平野惠一卻有不同觀點
賴清德主持台南新火車站揭牌 拚10/18地下化通車
(影)「資生堂千金」懷孕7週照樣踩飛輪 親揭身體變化
桃園藝術亮點新書發表 選出桃園10大領域最具特色藝術家
藍白轟「200萬綠酬庸」!林國漳競辦指「實際砍半」:不排除提告
龍岡全民運動館啟用 耗資4.78億元、溫水泳池導入AI防護
高金「大帳房」逃亡有人接應!檢警再追出幫派份子提供車輛
美網》女雙球后組合送蛋擊敗小薇搭檔 湯森預約生涯全滿貫
選戰倒數79天!直擊蘇巧慧、李四川競總 月底前對外開放
創世基金會中秋文旦義賣 建商連7年相挺
高金大帳房南逃爆「藏鏡人」!幫派男奉命交車聲押禁見
中國統戰片《澎湖海戰》遲未上映 梁文傑酸:看它何時宣布死亡
北市民權東路二段建案損鄰地基塌陷 屋主驚恐:砰兩聲就坍了
桃園A7產專區住戶無法納入污水系統 民代要求市府解決
[擇法善思林之蘭室藏津]