iPhone 17 Pro 端侧 AI 大考:8GB 小模型跑分出炉,谁才是真正的“最强大脑”?
随着端侧大模型技术的飞速发展,智能手机早已不再仅仅是“能运行 AI”的设备,而是正在进化为真正的个人智能助理。8 月 24 日,知名 AI 评测机构 Artificial Analysis 与 Liquid AI 强强联手,正式发布了一项专为手机端本地 AI 打造的全新性能基准测试。
本次测试将目光聚焦于苹果 iPhone 17 Pro,旨在揭示各类轻量化模型在真实移动设备上的极限表现。
明确分工:多维度考量端侧 AI 实力
为了确保评测的全面性与专业性,两家机构进行了明确的分工:Artificial Analysis 主导模型的“智能水平”测试,而 Liquid AI 则专注于“推理性能”的考量。
测试精选了五大核心维度:函数调用、指令遵循、知识认知、高难问答以及数学能力。在模型选择上,评测严格设定了门槛——所有参测模型均经过 4 bit 量化,且体积控制在 8GB 以内,以确保它们能够真正在智能手机端侧流畅运行(如 Gemma 4 E2B 与 LFM2-2.6B-Exp 等)。
跑分榜单揭晓:小模型爆发大能量
在限制上下文长度为 16K tokens 的测试场景中,端侧小模型展现出了令人瞩目的智力水平。其中,由南北阁实验室推出的 Nanbeige4.2-3B 与 Liquid AI 的 LFM2.5-2.6B 表现最为优异,斩获了平均得分的最高荣誉。
然而,手机端的 AI 体验不仅取决于“智商”,还受制于“响应速度”。当测试条件增加“响应时间必须在 1 分钟内”的严苛限制后,榜单迎来了洗牌:
1. LFM2.5-8B-A1B 凭借出色的速度与智力平衡成功登顶;
2. 紧随其后的是 LFM2-2.6B-Exp、Gemma 4 E4B 以及 Granite 4.1 8B。
技术亮点:Nanbeige4.2-3B 的架构巧思
在本次跑分中表现抢眼的 Nanbeige4.2-3B 值得特别关注。该模型由 BOSS 直聘旗下的南北阁实验室研发,其非嵌入参数仅为 30 亿。
为了在不增加模型体积的前提下提升性能,研发团队巧妙地引入了 Looped Transformer 架构。通过循环复用网络层,该模型有效提升了计算深度,从而以极小的参数代价实现了比肩更大体量模型的得分表现。这一技术突破,充分证明了端侧小模型在智能上限上仍有巨大的挖掘空间。
结语:从“能跑”到“好用”的体验跃迁
此次 Artificial Analysis 与 Liquid AI 联合发布的基准测试,不仅是一份简单的跑分榜单,更是手机端本地 AI 发展现状的一面镜子。
它清晰地表明,移动端的 AI 竞赛已经跨越了“能不能在手机上跑起来”的初级阶段,全面进入了“跑得快、答得准、体验好”的深水区。未来,随着更多如 Nanbeige4.2-3B 这样架构创新的轻量化模型涌现,我们的智能手机必将变得更加聪明与贴心。