我前些日子正在寻找这种,目的是给我京东的订单评价赚京豆,几十个订单自己评价又太麻烦了,还需要传图片
@MasterCai 自动化测试用的最多是本地化视觉模型,对于简单的导航够用。对于能零 skill 配置就导航各种常用 app ,还需要调用最先进的大语言视觉模型。
@fzuccq #68
越复杂的项目,越有护城河。
而且你真的商业化了,就可以自己部署模型了,边界成本低。
你的视频演示用的是什么模型啊?
我自己之前用 qwen3.7 这个多模态来做过 windows 上面的模拟 computer use ,让它下国际象棋,识别然后输出点击操作、拖动棋的操作挺快的,有两个很大的问题:
1. 靠 llm 多模态识别出来的 x,y 不精准,很多次无法正确拖动棋子。
2. 靠 llm 本身的聪明程度,后面复杂了会乱下棋,实际上并不懂国际象棋规则,为了让上下文利用起来,最好的方式是每次都新开上下文下棋。
@printdarling 我最近也在寻找能本地部署的开源模型,感谢分享,我回去测试一下 AutoGLM 性能,看能不能集成到本地。如果本地开源模型能驱动 agent ,那 token 成本一下子就可以忽略了。
我感兴趣。 有成品卖吗?
我的想法是接入 https://midscenejs.com/ , 做自动化测试
这个感觉和 agent 关系不大啊,识图的方案不需要 agent 吧
之前已经找到一个 也接入了我的 harness 工具,在我的本地安装一个 runner app ,通过拿节点树和截图辅助一起定位操作我的本机 ipone ,实现帮我使用购物 app 来获取 BOM 信息(做些小玩具的时候),不过体感是太慢了也不稳定,也还没优化,晚点再看看你这个
@loveumozart 我演示视频用的是 sonnet-5 ,但 kimi-k2.6, k3 性能也都不错。不能让多模态模型直接看图像输出 x,y bbox ,那样会漂移。我的做法是,在本地先对图片进行 OCR 和 ICON 检测,获取都 bbox 列表,和原图一起,发给大模型。让大模型从 bbox 列表选择,这样输出坐标就很稳定了。
太慢,token 太贵
建议重点优化高价值场景:崩老头
我说真的