Gemma 4:一款能跑的小型视觉模型,颠覆你的认知!

在科技发展的浪潮中,谷歌于2025年4月2日深夜悄然发布了全新的Gemma 4开源大模型,尤其引人注目的是其31B(310亿参数)版本,在多项基准测试中竟然击败了参数量大其20倍的巨型对手。这一惊人表现不仅仅是“小而强”的证明,更是开源界的一次“超凡进化”。Gemma 4的发布是一个值得关注的里程碑,采用Apache 2.0协议,用户可以完全免费商用,彻底消除了法律风险。

Gemma 4并不是对Gemma 3的简单升级,而是一次架构上的飞跃。传统观念认为“大模型=大参数”,但Gemma 4打破了这一认知,展现出强大的多模态支持能力,不仅能进行文本交互,还具备“看图说话”的能力,处理音频也不在话下。它的上下文支持最高可达256K tokens,能够轻松应对整本手册或大型代码库的处理。而其独特的MoE(混合专家)架构设计则实现了“激活参数少,智能水平高”的极致效率,让这一切不再仅限于数据中心,用户可以将其安装在自己的电脑或手机上,真正实现本地化使用。

在我的实测中,选用的是由unsloth发布的gemma-4-26B-A4B-it-UD-Q5_K_M.gguf版本。该模型基于MoE架构,参数量达到252亿,适合在消费级显卡上运行,具有极高的可用性。经过测试,我的主力机配置为Intel i5-13600K和NVIDIA GeForce RTX 4070 Ti SUPER,搭配64GB内存和Windows 11 Pro系统,运行Gemma 4表现相当出色。

为了验证其视觉理解和代码生成能力,我设计了一个较为复杂的任务,利用微信的Openclaw插件界面截图进行测试。结果令人惊喜,Gemma 4不仅准确识别了所有文字内容,还完美还原了细微的设计元素,甚至包括CSS技巧的应用。整体输出速度也相当可观,显示出其在消费级显卡上优于人工完成设计的潜力。

在与千问(Qwen 3.5)进行对比时,虽然Qwen 3.5在细节还原上表现更好,但其输出速度却明显逊色,生成3268 tokens耗时长达26分钟,显然在高性能显卡的用户面前,Gemma 4更具吸引力。对于那些没有高性能显卡的用户,Gemma 4的表现无疑是一种鼓舞。

然而,虽然小模型(如E2B、E4B)在视觉处理上有所欠缺,但其在文本理解和代码生成能力上并不逊色。这表明,表达能力在AI使用中的重要性愈发凸显,如何有效地描述任务已经成为AI用户的核心技能。在AI时代,文科生的就业前景也因此被普遍看好,展现出新的希望。

总的来说,Gemma 4的视觉能力和代码生成表现都非常出色,尤其是在本地运行的情况下,其高质量的视觉理解能力将为用户提供极大的便利。未来,我们期待Gemma 4能够在更多领域展现其强大的潜力。