zhangshaohan 发表于 昨天 16:27

我前些日子正在寻找这种,目的是给我京东的订单评价赚京豆,几十个订单自己评价又太麻烦了,还需要传图片

fzuccq 发表于 昨天 16:28

@MasterCai 自动化测试用的最多是本地化视觉模型,对于简单的导航够用。对于能零 skill 配置就导航各种常用 app ,还需要调用最先进的大语言视觉模型。

evilHa 发表于 昨天 16:29

@fzuccq #68
越复杂的项目,越有护城河。

而且你真的商业化了,就可以自己部署模型了,边界成本低。

loveumozart 发表于 昨天 16:29

你的视频演示用的是什么模型啊?
我自己之前用 qwen3.7 这个多模态来做过 windows 上面的模拟 computer use ,让它下国际象棋,识别然后输出点击操作、拖动棋的操作挺快的,有两个很大的问题:
1. 靠 llm 多模态识别出来的 x,y 不精准,很多次无法正确拖动棋子。
2. 靠 llm 本身的聪明程度,后面复杂了会乱下棋,实际上并不懂国际象棋规则,为了让上下文利用起来,最好的方式是每次都新开上下文下棋。

fzuccq 发表于 昨天 16:30

@printdarling 我最近也在寻找能本地部署的开源模型,感谢分享,我回去测试一下 AutoGLM 性能,看能不能集成到本地。如果本地开源模型能驱动 agent ,那 token 成本一下子就可以忽略了。

DiamondYuan 发表于 昨天 16:30

我感兴趣。 有成品卖吗?

我的想法是接入 https://midscenejs.com/ , 做自动化测试

Vipcw95 发表于 昨天 16:30

这个感觉和 agent 关系不大啊,识图的方案不需要 agent 吧

silencil 发表于 昨天 16:34

之前已经找到一个 也接入了我的 harness 工具,在我的本地安装一个 runner app ,通过拿节点树和截图辅助一起定位操作我的本机 ipone ,实现帮我使用购物 app 来获取 BOM 信息(做些小玩具的时候),不过体感是太慢了也不稳定,也还没优化,晚点再看看你这个

fzuccq 发表于 昨天 16:35

@loveumozart 我演示视频用的是 sonnet-5 ,但 kimi-k2.6, k3 性能也都不错。不能让多模态模型直接看图像输出 x,y bbox ,那样会漂移。我的做法是,在本地先对图片进行 OCR 和 ICON 检测,获取都 bbox 列表,和原图一起,发给大模型。让大模型从 bbox 列表选择,这样输出坐标就很稳定了。

xiaomushen 发表于 昨天 16:35

太慢,token 太贵

建议重点优化高价值场景:崩老头

我说真的
页: 1 2 3 4 5 6 7 [8] 9 10 11
查看完整版本: 个人业余项目,做了一个可以物理操作 iPhone 的 agent,不知道有商业前景吗?