騰訊「混元圖像3.0」打贏盲測擂台 評分超Google nano-banana 成世界第一

騰訊 (00700) AI開源模型「混元圖像3.0(HunyuanImage 3.0)」在發布1星期後,在權威的LMArena.ai盲測平台,打贏Google(美:GOOG)的gemini-2.5-flash-image-preview (nano-banana),在26個模型中排名世界第一。

LMArena.ai盲測雷台網址:https://lmarena.ai/

據LMArena.ai網站介紹,LMArena 由加州大學柏克萊分校的研究人員創建,是一個開放平台,讓每個人都能輕鬆訪問、探索,並與全球領先的 AI 模型互動。通過比較模型並對更好的回應進行投票,讓社群協助打造公開的排行榜,使 AI 進展更加透明,並基於真實世界的應用。

LMArena.ai採用盲測的方式,用戶登入帳號後,在測試平台選擇更好的答案,而用戶在投票前,不會知道是什麼牌子的模型,要在投票後才會知道。

LMArena.ai的排名榜除了「文生圖」,亦有「文字生成」、「Web 開發」、「視覺處理」、「編輯圖像」、「搜尋」、「文字生成視頻」、「圖像轉視像」、「AI編碼」等,更新時期不定時,視乎所收到的回應數目。

騰訊於微信公眾號指,「這個排名沒有任何“演算法濾鏡”,靠的是全球用戶兩兩對比投票選出,每一票都藏著用戶的真實體驗和偏好。」

騰訊稱,混元圖像3.0能接住來自全球的認可,靠的是三個「硬本事」:(1)會「思考」,不是簡單畫圖,而是能用世界知識推理,會把原理邏輯藏進畫面裏。(2)畫「精準」,中英文長文本渲染不模糊,從海報標語到細節註解,文字都能精準落地。(3)有審美,複雜指令能讀透,生成的圖既有真實質感,又能踩中審美點,不用反覆調整就能出效果。

騰訊指,騰訊混元已搭起覆蓋語言、圖像、視頻、3D 模型的多尺寸、多模態開源矩陣,給出的開源基座能直逼商業模型,光社區圖像、視頻衍生模型就超過3000個。未來,混元圖生圖、圖像編輯、多輪交互等版本也將持續上綫。

據騰訊早前發布,「混元圖像3.0」號稱是首個工業級原生多模態生圖模型,參數規模800億,是測評效果最好、參數量最大的開源生圖模型,效果可對標業界頭部閉源模型。

團隊續指,「混元圖像3.0」以Hunyuan-A13B為基礎,基於50億量級的圖文對、視頻幀、圖文交織數據和6T的語料數據進行了多模態生成、理解和LLM的混合訓練,使得模型能夠充分融合多任務效果,實現超強的語義理解能力,能夠響應複雜的長文本,生成長文本,同時具有LLM(大語言模型)的世界推理。