论坛
BBS
默认
简体中文
繁體中文
登录
全球主机MJJ交流论坛
»
论坛
›
主机交流
›
VPS综合讨论
›
这个 1.3B 多模态端侧模型的能力,被严重低估了。 ...
返回列表
发新帖
查看:
5
|
回复:
0
这个 1.3B 多模态端侧模型的能力,被严重低估了。
[复制链接]
hlx
hlx
当前离线
积分
58935
1万
主题
0
回帖
5万
积分
论坛元老
论坛元老, 积分 58935, 距离下一级还需 9941064 积分
论坛元老, 积分 58935, 距离下一级还需 9941064 积分
积分
58935
关注TA
发消息
发表于 2026-5-25 14:47:26
|
显示全部楼层
|
阅读模式
之前在高黎贡山徒步,没信号,同行的人指着树上一株植物问:"这是个啥植物?"
即便用手机拍了照也没法查,毕竟在深山里面连个信号都没有,带着一脸困惑我当时想的是:手机为什么不能离线认这个?
不过,现在可以了。
刚刚,面壁智能刚发的 MiniCPM-V 4.6,1.3B 参数,系列里最小。
这个号称「小钢炮」的端侧模型,甚至在实测能力超过了阿里的 Qwen3.5-0.8B 和 Google 的 Gemma4-E2B-it。
我同样我把之前高黎贡山的这个图放到这个模型里面一测,整体回答的已经大差不差了。
这个MiniCPM-V 4.6 1.3B的模型,支持直接在手机本地能离线跑多模态的,注意它是支持图片和视频的。
正好这几天空气中都是弥漫着香香的味道,也不知道是什么品种的花,对着路边树上的花拍了一张。
值得注意的是,MiniCPM-V 4.6 作为一款 1B 参数的端侧模型,其核心优势在于高效的视觉指令遵循和通用场景理解,而非百科全书式的细粒度物种分类。
在测试中,当面对「柚子花」这一特定物种时,模型并未强行给出具体的物种名称,从而避免潜在的幻觉风险。
而是精准地捕捉到了其「白色簇生小花」、「柑橘类叶片特征」等关键视觉元素,并将其归类为「柑橘属植物」。
我后来一查还真是这么回事。
没联网,图片也没离开手机。
不仅如此,这个端侧模型甚至能够直接看懂视频,并且能够根据我的视频给我出分镜脚本。
那么,我们来看看它的实际模型数据怎么样。
MiniCPM-V 4.6 1.3B 打赢 Qwen3.5-0.8B,从参数上看还多了一半,赢了其实不稀奇,那为什么我还是觉得非常强?
先看榜单,大部分指标已经追平 Qwen3.5-2B,也就是说 MiniCPM-V 4.6 1.3B 干了 2B 能干的活。
如果只是这样,我会觉得"还行,参数多嘛"。
光看榜单可能没感觉,我跑了几个实际场景。
我直接找了一张中英文混合的菜单图,来测测看这个1.3B模型在实际生活场景中的用途。
让它给我生成一个生成一个中英文对照的版本,可以看见整个在文本识别效果上,以及最终的翻译结果上相对来说比较精准。
同样的,对于手写体的识别,这个端侧模型整体效果表现也一样很出色。
AA 评测也正是验证了上面实测的一些场景,MiniCPM-V 4.6 比 Qwen3.5-0.8B 少用了40 倍的 token 量就超过了它,答得更准,消耗居然还不到对方的零头。
这让我想起面壁 2024 年发在 Nature 子刊上的「密度定律」,当时看觉得是理论推演,现在看来他们确实在按这条路走。
这次我觉得速度是让我觉得这个模型非常够用的原因。
据官方信息,在高并发吞吐上,单卡可达 2624 token/s、14.3 张/s 的 1344² 图片处理能力(输出长度为200token时),是 Qwen3.5-0.8B 的 1.5 倍,意味着同样的硬件可以承载数倍的线上流量。
参数多了 50%,速度反而快了一倍多??我一开始以为是测试条件不一样,反复看了几遍,数据没问题。
这个处理速度体感是真的很明显,我试了连续拍几张不同场景的照片,模型基本是即时响应,没有那种「等一下,我在想」的感觉。
MiniCPM-V 4.6 参数比 Qwen3.5-0.8B 大,速度反而更快,听起来反常识,其实道理很朴素。
打个比方,我们开了一家快递站,每天要处理一万件包裹,这次 MiniCPM-V 4.6 有两种提速办法。
第一个方法,它用到的是 ViT 编码器,我们可以理解为在快递站着把分拣台往前挪。
以前包裹要先搬到仓库最里面,分拣完再搬出来。现在把分拣台搬到仓库门口,包裹一到就开始分拣,后面的搬运量直接少了一大半。
MiniCPM-V 4.6 干的就是这件事,面壁和清华合作的 LLaVA-UHD v4,把「看图」这一步从流程末尾挪到了前面。
模型拿到一张图,不是先完整编码一遍再压缩,是编码到一半就开始压缩,后面要处理的信息量直接砍掉 55.8%,别的模型还在读图,它已经开始回答了。
说人话:同样一张照片,别的模型还在编码,它已经出结果了。
第二个办法是,压缩率。
可以理解我们分拣包裹的时候,有些包裹标签很清楚,往哪个区一目了然,粗分就行,快。
有些包裹标签模糊,得仔细看地址才能分对。
大多数多模态模型只有一种分拣精度:要么全粗分(快但容易出错),要么全细分(准但太慢)。
MiniCPM-V 4.6 两种都支持,简单的图走 16 倍压缩,一眼就能认出来的不用细看,复杂的图自动切到 4 倍压缩,该细看的地方细看。
从 2024 年开始面壁就在做 16 倍压缩,但之前精度和速度只能二选一,这次合到一起了。
这不是实验室里的东西。快手的推荐系统用的就是这套压缩技术。快手 2025 年上线了 OneRec 推荐大模型,要同时处理字幕、OCR 文字、标签、封面图。
用 MiniCPM-V 系列的 16 倍压缩跑起来,上线后扛住了快手推荐主场景 25% 的请求,几亿日活在用。
快手OneRec技术报告链接:https://arxiv.org/abs/2502.18965
MiniCPM-V 4.6 做的事,就是把快手验证过的这套东西,塞进了一个 1.3B 参数的端侧模型里。
不过呢,我作为开发者真正在意的其实就一个问题:我能不能自己训?
1.3B 参数意味着什么?
一块 4090 显卡,就是很多人已经装在自己电脑里打游戏那张,就能跑通全量微调,不用租集群,不用排三天队等机器。
自己的卡,自己的数据,跑完就拿到模型。
工具链也不用自己搭。
想微调,ms-swift 和 LLaMA-Factory 都直接支持,装上就能跑,想部署,vLLM、sglang、llama.cpp、Ollama 这些常见的推理框架全部兼容。
我自己的判断是,1.3B 真正的甜区不在通用场景。
通用场景比不过大模型,参数量摆在那里,1.3B 的优势在那些数据量小、需求具体、要快速出结果的垂直领域。
比如一个工厂要识别二十种零件缺陷,训练数据可能就几千张图,用大模型太浪费,用 1.3B 刚刚好。
训得快、跑得动、效果够用。
我还特意去翻了一下这个「小钢炮」系列的历史,挺有意思的。
MiniCPM-V 这条线,方向一直没变,开源社区累计下载超 2000 万次,从 2.0 到 4.6,两年时间,参数从 2.8B 压到 1.3B,能力反而翻了好几倍。
每一代都是在叙述说着同一个故事:参数变少,能力变多。
面壁智能说的「密度定律」,看下来不像是事后包装,确实是在按这条路走。
实际上三星、华为、荣耀、联想、吉利、大众、宝马都已经在用,覆盖手机、PC、汽车、智能家居。
这个趋势如果继续下去,以后可能真的不需要联网就能在手机上完成大部分视觉理解任务。
回到开头那个问题,如果现在再回高黎贡山,在没有信号的地方,我不会再对着看不懂的植物犹豫了。
掏出手机,拍一张,两秒出结果。
不用联网,图片也不用离开手机。
回复
使用道具
举报
返回列表
发新帖
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖并转播
回帖后跳转到最后一页
浏览过的版块
水池
Archiver
|
手机版
|
小黑屋
|
全球主机MJJ交流论坛
Powered by
Discuz!
X5.0
© 2001-2026
Discuz! Team
.
在本版发帖
返回顶部
快速回复
返回顶部
返回列表