查看: 8|回复: 1

[经验分享] 搭建稳定先进的 AI 环境

[复制链接]

1

主题

1

回帖

5

积分

新手上路

积分
5
发表于 2026-7-13 12:19:34 | 显示全部楼层 |阅读模式
2026_0713_1128_v2ex 分享,AI 工具经验

写在前面

新人初来乍到,穷则独善其身,达则兼济天下。准备在 v 站输出一些对网络有益的信息。第一篇,不打算分享有主观成分的东西,就分享一个技术经验帖吧

本人作为互联网 8 年中登,主业全栈开发(先后就职过:老牌大厂、独角兽公司、资本充足的创业公司、草根创业团队),副业投机交易初入正轨。

26 年绝对是 AI 发展意义重大的一年,如果 25 年对 AI 工具还持有保留意见,可以暂且认为你这个人比较保守;如果到了 26 年还没有让 AI 工具融合到你的日常工作生活,那就开始有落后的嫌疑了。。。

本帖分享一些自己最近对 AI 工具的使用经验,希望能帮大家在探索 AI 的路上节约一些时间

正文

强调:本文以分享我个人使用 AI 工具的场景为主:学习科普、编程、投机交易。其他场景如图文、视频处理,不在我的主要工作范围内,本文参考意义可能有限。

大纲

AI 工具总览

Cursor:个人目前使用频率最高、最稳定、性价比最高的 AI 工具

Claude:前沿 AI 能力,处理复杂任务时使用

Gemini:Google Chrome 辅助使用

Paseo:一线 AI 用户们的玩法,信息来自硅谷圈子

AI 工具总览

claude 给出的 AI“六大主流模型”对比( 2026 年 7 月 13 日):

模型
优势
劣势
API 价格(输入/输出,每百万 token)
订阅价

GPT-5.6(OpenAI)
日常聊天与助理任务最佳,编程/生物/网安能力全面提升,生态最大
高强度使用成本高
Terra 档 $2.50/$15
Plus $20/月,Pro $100-200/月

Claude Opus 4.8(Anthropic)
长程 Agent 推理最强,结构化长文写作,综合智能指数登顶
不支持图像生成
$5/$25
Pro $20/月

Claude Fable 5(Anthropic)
编程能力断层第一(80.3% SWE-Bench Pro),超长自主任务表现最好
全场最贵,订阅计划不含,需按 API 单独付费
$10/$50
不含在订阅内

Gemini 3.5 Flash(Google)
闭源阵营性价比之王,多模态最强(视频/音频),100 万上下文
深度推理不如旗舰模型
$1.50/$9
Advanced $19.99/月

Grok 4.5(xAI)
编程性价比极高,Cursor 训练血统,实时 X 数据
综合智能排名第 4,SWE-Bench Pro(64.7%)低于 Opus
$2/$6
SuperGrok $30/月

DeepSeek V4(DeepSeek)
开源可自托管,性价比碾压级,MIT 协议,支持 100 万上下文的 Flash 版仅 $0.14/$0.28
需自建基础设施才能拿到最佳性价比,数据合规需自行评估
V4-Pro 约 $0.28,V4-Flash $0.14/$0.28
网页版免费

AI 模型的迭代速度非常快,尤其是进入 7 月后,大新闻不断:

Claude Fable 5 于 7 月 1 日恢复访问,重新夺回编程能力最强的位置(SWE-Bench Pro 80.3%,目前可用模型中最高)。

GPT-5.6 于 7 月 9 日成为 ChatGPT 新默认模型。

xAI 于 7 月 8 日发布 Grok 4.5,主打编程和高性价比。

Meta 于 7 月 9 日发布首个付费模型 Muse Spark 1.1 。

另外一个大新闻:
SpaceX 宣布以 600 亿美元全股票收购 Cursor 母公司 Anysphere,预计三季度完成,交易完成后 Cursor 将成为 SpaceX 子公司,能接入 xAI 的 Colossus 算力基础设施。

也就是昨天( 7 月 12 日)晚上,我发现 Cursor 的默认模型,在之前高性价比 auto 模式的基础上,并列多出了一个‘Cursor Grok 4.5 High Fast’。暂且认为是 SpaceX 收购后变得不差钱了,升级了之前的 auto 和 Composer2.5 。

Cursor:个人目前使用频率最高、最稳定、性价比最高的 AI 工具

最大的特点:
1 、不用翻墙就能正常使用(国内网络直连基本稳)

2 、性价比高:里面嵌入了几乎所有主流大模型(不过 Pro 版本 token 有限,重度 Agent 会烧得比较快,基本上 5 个非常深度的会话就用完了)

3 、工作流闭环完整:写代码、改代码、跑命令、读报错、提交 PR ,基本可以在一个窗口里完成

我的实际用法(按场景):
日常写代码 / 修 bug:Cursor 的写代码体验目前是我用下来觉得最丝滑的。默认用 Auto 或 Composer 2.5 (今天开始主要用 Cursor Grok 4.5 High Fast ),快、便宜、够用。80% 的任务到这一档就结束了。

复杂重构 / 跨多文件改动:切 Claude Opus 4.8 ,我一般先让它出 Plan ,再进 Agent 执行。

读陌生代码库:Ask / 只读模式先摸清结构,再动手。否则 Agent 很容易“很自信地改错地方”。

使用建议(踩坑后总结):
人做裁判,AI 跑闭环:现在真正耗时间的不是“会不会写”,而是“审美、核对、边界条件、是否可上线”。AI 越强,你越要会验收。

一次只给一个清晰目标:模糊需求 = 模糊交付。最好写清:输入、输出、约束、验收标准。

先小后大:先让它改一个文件 / 写一个函数验证方向,再放大到整模块。

Rules / Skills 很值钱:把你的项目约定、提交规范、常用工作流固化进去,比每次口头重复提示词高效得多。

别迷信“一次生成完美代码”:生成 → 跑 → 看报错 → 再修,这才是常态。Loop 本身就是生产力。

订阅建议:
如果主要做开发,Cursor Pro 几乎是当前性价比最高的入口之一。某宝有代充,我会用一个月的成品号,选了一家店,已经稳定用了七八个月了。

如果不做开发,日常用来做推理、科普、文案、数据类任务,我认为 Cursor 也完全够用。

Token 紧的时候:日常用 Grok / Auto 。

一句话概括:如果我只能选一个 AI 工具,那就是 Cursor 。

Claude:前沿 AI 能力,处理复杂任务时使用

定位:日常科普、搜索、思考工具;也是复杂问题、长上下文任务的“攻坚工具”。
长程推理、结构化长文、复杂 Agent 任务,目前仍是第一梯队。

编程能力上,Fable 5 重新把 SWE-Bench 顶上去之后,复杂工程任务优先考虑它。

Cursor 的高级大模型 token 用完后,我会在 Cursor 里装一个 Claude 插件,继续用高级模型。

使用心得:
做科普、辅助思考等相对重要的任务时,我会优先用 Claude 里最高级的模型。

Claude 适合“想清楚”,Cursor 适合“干完”。很多时候最优解是:Claude 出方案 → Cursor Agent 执行落地。

写提示词时尽量要求它输出:假设、风险、备选方案、验收清单。不然它容易给你一篇漂亮但难落地的长文。

订阅 Pro 够日常网页对话和中等强度使用;闲鱼上有代充的成品号,我找到一家也用了 4 个月了,稳定。

Gemini:Google Chrome 端辅助使用

定位:浏览器侧的轻量副驾驶,不是主力 IDE 。
主要是在 Chrome 里辅助看图、看页面、看视频摘要。

另外听说做开发时,用 Gemini 设计前端 UI 挺好用,这个我还没有探索(类似值得探索的还有 Claude 的 Design 模块,我也用得不够深,不妄作建议)。

“一边浏览网页一边问问题”这种场景非常舒服。

我的常用场景:
读英文文档 / 官方博客:让它边读边提炼要点和坑点

看图表、截图、PDF

对比多个网页信息:做初步汇总,再人工核对关键结论

Chrome 里临时问答:比切回 IDE 或专门开聊天页更快

注意点:
我目前 Gemini 没有充 Pro 会员,日常免费版就够用了。

谷歌在 AI 行业绝对是最前列的公司,也是少数能做到 AI 产业全链路闭环的公司之一。Gemini 绝对不输 Claude ,只是目前 Claude 够用了,所以我暂时没开 Gemini 会员;后续 Claude 吃紧,我会第一时间加上 Gemini 。

Paseo:一线 AI 用户们的玩法

我身边能接触到的硅谷 AI 研发领域的创业达人、超级个体,基本都是所有 AI 大模型都开最高级会员的。他们每天要做的事情很多,恨不得让 Agent 同时并行地给他跑几百个任务。这种场景下,就需要一个把所有 AI 大模型统一管理起来的工具;我见身边一个硅谷大佬用的,就是 Paseo 。
官网:https://paseo.sh/

它的特点:
在你自己的机器上跑 daemon ,把 Claude Code 、Codex 、Cursor 、OpenCode 等 coding agent 统一管起来。你可以用多个大模型并行地处理同一个问题。

它会自动帮你处理大模型中途的询问:你下达一个大型任务后,它会一路跑到底,而不是挂起等你回答中途的问题。

还可以在桌面、手机、终端之间丝滑地切换查看和继续任务。你可以用手机下达指令,它会在电脑上同步执行(比如编程环境在电脑端,下楼吃午饭的时候也能用手机给电脑下达指令继续写代码)。

当单模型能力接近后,差距会转移到:谁能把多个 Agent 跑起来、并行起来、远程盯盘、形成稳定 loop。

写在后面

如何选择 AI 工具:
对大多数人,先把 Cursor 用熟,收益最大。

当你开始同时跑多个 Agent 、并且“人只负责验收”时,Paseo 这类工具才会从玩具变成刚需。

小团队/个人开发者更现实的策略是:租能力,不自研模型;把精力放在知识投喂( RAG / prompt / rules )和验收闭环上。

AI 跑闭环,人做裁判
生成不难了,难的是品味、核对、取舍、对真实世界负责。

能建立“确定性检查”的人会越来越值钱:测试、lint 、类型、回放、人工抽检、llm-as-judge 。

Loop engineering 比单次 prompt 更重要
旧写法:写一个超长提示词,期待一次完美交付。

新写法:目标清晰 → 小步执行 → 自动验证 → 失败复盘 → 再进入下一轮。

不同模型有分工
日常执行:Cursor ( Auto / Composer / Grok )

复杂推理与长文:Claude

浏览器辅助:Gemini

把 AI 大模型发挥到极致:Paseo

成本敏感:DeepSeek / 豆包

AI 仍然有硬瓶颈
我之前看到过一个最好的回答:如果人类文明只发展到了“地球是平的,天圆地方”这个程度,那么 AI 不会坚定地告诉你“地球是圆的,地球围绕着太阳转”——它大概率只会顺着所处时代的共识来回答;真正突破认知边界,仍然要靠人。
回复

使用道具 举报

1

主题

1

回帖

5

积分

新手上路

积分
5
 楼主| 发表于 2026-7-13 12:25:59 | 显示全部楼层
claude 忘记补充环境了:想要降低封号概率,需要用 clash verge 的虚拟网卡模式开启代理(规则模式,而非全局模式下运行),然后用奶昔购买独立 ip ,配置好后开全局模式测试 ip 纯净度(最好控制在 20%以下)。长期在一个固定的节点上使用 Claude ,关闭代理的时候 Claude 也要记得同时关闭。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部