fzuccq 发表于 昨天 16:36

@DiamondYuan 需要购买零件,DIY ,文档里有组装手册。

yohjisakamoto 发表于 昨天 16:38

默认坐标放在右下角是不是好一点,大部分交互设计都是放在屏幕下侧的。另外不是很懂机器人,但是感觉 xy 的复位不需要每次操作都复位一次吧,计算新 x 和 y 就当前点击位置的偏差,然后每 5 次复位一下会有影响吗。感觉可以快很多。另外我觉得你图片压缩上有很大搞头,只要能压缩到不丢失交互信息,费用能减少很多。

xiaomushen 发表于 昨天 16:38

@timethinker 可以用来抓淘宝京东,APP 端价格数据。这种方式,不违法

fzuccq 发表于 昨天 16:38

@xiaomushen 只针对特定场景,有固定操作流程,确实能做到低成本和快速响应。我想做的是,无需配置能操作大部分常用 app ,能应付各种 app 导航,这个场景要求确实 token 很贵。

DiamondYuan 发表于 昨天 16:38

@fzuccq

midscenejs 是基于纯视觉做自动化测试的,和你的场景几乎一样。

你可以参考他的模型选择

https://midscenejs.com/zh/model-strategy.html

千问和豆包的视觉模型应该不错。 然后成本应该是不高的。

jjtang11 发表于 昨天 16:39

我之前刷过不知道是不是你的,同一台机子操作十几台手机,如果不是的话说明市场早有跟成熟的方案了,你这个一机一控效率太低了

zhangli2946 发表于 昨天 16:45

通过物理手段构造的以信息终端为目标的输入, 本质上都是吃政策红利和做政策对抗。
信息终端必须由人类进行物理操作这一限定而产生。
限定被打破便是对这个行当颠覆性的外部条件变化。

fzuccq 发表于 昨天 16:45

@yohjisakamoto 手机正上方比较高的地方有摄像头,拍摄手机屏幕。把机械臂停靠在左上角,是为了不挡住摄像头观察操作结果。context 图片压缩,我已经做了极致优化,只保留最新的图片,历史图片都被 OCR 文本取代了。其实速度瓶颈不是机械运动,而是大模型 api 延迟太高,需要至少 20s 才能返回结果。

fzuccq 发表于 昨天 16:46

@jjtang11 这个 agent 的定位是个人助理,帮你操作需要在手机上做的事情,并不是要做手机自动化农场。

fzuccq 发表于 昨天 16:49

@zhangli2946 你这个论断太宏大了,我只不过想让 agent 能帮我做些琐事,好让我不必每天都操心这些必要而又无足轻重的事情。
页: 1 2 3 4 5 6 7 8 [9] 10 11
查看完整版本: 个人业余项目,做了一个可以物理操作 iPhone 的 agent,不知道有商业前景吗?