Antigravity 终于不难用了:/teamwork-preview 让一个协调者把任务分给几个专项 agent,/boost 动手前先深度核查一遍;Pro/Ultra 的配额也放宽了(具体以账号显示为准)。从「玩具」到能接日常轻工作,这道门槛算是过了。
A field guide · 2026 edition
从 prompt 到 agent,
一条清晰的路。
两年的 AI 使用笔记,整理给那些被信息淹没、还没找到入口的朋友 — 一条不绕弯的路径,加上路上的工具、感想和坑。
Start the trail没有匹配的笔记 — 换个词试试。
日常感想
Field notes · scroll sideways · share to X
Live 语音可以开着一直干活,但它是单独一个模型(GPT-Live-1),不是主模型在回答——我拿它派任务、做工作记录,不指望它一次做完复杂活。另外 Desktop 的 Work 语音单独计额度,不是真要操作电脑就别开。
Codex 不同 session 之间已经能互相交接:一个任务把部署安排同步给另一个,对方马上接上,还主动暂停自己的发布避免冲突。以后同时开几个任务,希望能少一点我在中间来回传话。
开始用 GPT 6,第一个感受是得盯着 token。Ultra 和多 agent 协作我不当日常默认——几个 agent 一起跑,消耗实在吃不消。先用低档位,真需要深挖再往上开:先看任务,再决定开多大。
Claude Code 跑了两周,最大的体感是:会写测试的人立刻拉开了不会写测试的人。Agent 写完,你只剩一件事 — 验证。验证靠测试。
Prompt 工程的本质不是“咒语”,是“把任务说清楚”。能用 Claude 写好 prompt 的人,写产品需求、写邮件、写技术文档也都会变好。
本地大模型不是为了省钱,是为了隐私和确定性。Ollama + 一个 70B 的 Q4 模型,能解决 60% 日常问题,剩下 40% 才需要云端。
新手最大的误区:把 AI 当成搜索引擎。它不是。它是一个有偏见的、健忘的、但表达流畅的同事。学会与这样的同事合作,是这个时代的核心技能。
Gemini 2.5 Pro 的 2M 上下文,我塞了一整本 800 页的合同进去问它,它真的能记住第 30 页的某条款。这件事五年前是科幻。
MCP 这个协议被低估了。一旦 agent 能标准化地调用任何工具,模型层的护城河就会被进一步抽空,留下来的是“工具 + 数据”的护城河。
先认几个词
Plain-English basics · 像给小学生解释一样
Token令牌
AI 读写文字的最小单位。像把句子剪成一小段一小段(一个词、半个词),AI 一次只“想”一小段,就叫一个 token。
LLM大语言模型
一个读过海量文字、学会“猜下一个词”的程序。你起个头,它接着往下写。GPT、Claude、Gemini 都是 LLM。
API接口
让两个软件互相说话的“插座”。你的程序按约定格式发请求,对方按格式把结果发回来。接入 AI 就是调它的 API。
MCPModel Context Protocol
给 AI 接工具的“万能插头标准”。有了它,AI 能统一地连上你的日历、文件、数据库,不用每样都单独造接口。
Skills技能包
提前给 AI 写好的“某件事怎么做”的说明书 + 资料。要做这件事时它打开对应 skill,就知道步骤和规范。(这个页面就是 AI 照着 skill 帮 Arthur 做的)
Agent智能体
能自己拆步骤、调工具、连着把一件事做完的 AI——不只是回你一句话,而是真去“干活”。
loop智能体循环
AI 干活的节奏:想一步 → 动手调个工具 → 看结果 → 再想下一步,这样一圈圈转到把事做完。这个循环就是一个 agent 的“心跳”。
trace运行轨迹
AI 一步步做了什么的完整流水账——想了什么、调了哪个工具、得到什么结果。出问题时照着它倒查,像行车记录仪。
embedding向量嵌入
把一段文字变成一串数字坐标,意思越接近、坐标离得越近。AI 靠它判断两段话像不像、从一大堆资料里挑出跟你问题最相关的那几段。
RAG检索增强生成
让 AI 回答前先去你的资料库里翻出相关段落,拿着它们再作答——这样它讲的是你的资料,而不是凭记忆瞎编(Retrieval-Augmented Generation,靠上面的 embedding 来找)。
prompt engineering提示词工程
琢磨怎么把话跟 AI 说清楚,好让它给出你要的结果。同一件事换个问法,效果天差地别——这门“怎么问”的功夫就是它。
context engineering上下文工程
比“怎么问”再进一步:管好每次喂给 AI 的那一整包信息——放哪些资料、什么顺序、塞多少、砍掉什么。它答得好不好,一大半看这个。
harness engineering脚手架工程
给模型搭一整套“外壳”——工具、上面那个 loop、权限、上下文怎么管——把一个只会聊天的模型,装成真能干活的 agent。这套外壳就叫 harness。
TTS文字转语音
把写好的文字用接近真人的嗓音念出来。有声书、导航报路、Siri 开口说话,背后都是它(Text-to-Speech)。
STT语音转文字
反过来,把你说的话变成文字。对着手机说一句自动打成字、开会自动出文字稿、语音输入,都是它(Speech-to-Text)。
GitHub代码协作平台
程序员存代码、一起改、看每次改动历史的网站。像代码界的 Google Docs + 网盘 + 修订记录。
HTML网页标记语言
写网页的“骨架”语言,规定一页上有哪些标题、段落、图片、按钮。你现在看的这一页就是 HTML。
初级必看 · 新手入门路径
The six steps · click a node to expand
01
理解 LLM 在干什么
Mental model
它不是去 Google 上帮你查答案。它更像一个超会接话的人——你起个头,它就猜“下一个词最可能是什么”,一路接下去。明白这点,后面就不迷糊了。
02
学会写 prompt
Prompt basics
跟它说清楚四件事就够了:① 背景是什么 ② 让它当谁 ③ 想要什么格式 ④ 给个例子。先把这四点做到,别急着学花招。
03
挑一个主力模型
Pick one
别挑花眼。先选一个(GPT 或 Claude 或 Gemini),老老实实用满三个月,再谈换不换。
04
把它接进工作流
Integrate
把它用在真事上:写邮件、改文档、读 PDF、看代码。让它变成你每天都用的工具,而不是偶尔玩一下。
05
动手做一个 mini 项目
Ship one
做个特别小的东西,100 行代码以内就行。亲手做完一个,你对 AI 的理解立刻上一个台阶。
06
进入 agent / 工具链
Agent layer
等前面五步都熟了,再玩进阶:让 AI 自己干活(agent)、连工具(MCP)、在自己电脑上跑模型。地基没打牢,别急着上这层。
Claude · GPT · Gemini · Grok · DeepSeek
Pick one. Use it for three months. Then reassess.
Claude Opus 5.5Arthur 首推
9 月 22 日发布 · 我的主力推荐 · Fable 5.1 级的表现,运行成本比 Opus 5 低 40%
Strengths
- 官方数据:大多数工作上达到 Claude Fable 5.1 的水平,运行成本却比 Opus 5 低 40%
- 编码、agent、电脑操作、知识工作是这一版的重点;输出速度比 Opus 5 快 30%
- 回答更直白:官方专门改了沟通方式,少绕弯、重点先说
- 写作语感 + 代码推理仍是招牌,Claude Code 是它的杀手级应用——我每天在用的就是这套
Weakness
- 网络安全、生物类的敏感请求会被安全机制转给 Opus 4.8 处理
- 原生生图仍弱于 GPT;同家族的 Sonnet 5.5 / Haiku 5.5 官方说还在后面
Best for · 写作、编程、长文档、agent——日常主力就用它;真正最难的题再叫 Fable
API $4 / $20 每百万 token(输入/输出,比 Opus 5 降 20%)· Pro / Max / Team / Enterprise 订阅可用GPT-6 家族
Astra 旗舰 · Sol 主力 · Luna 最快最省 · 9 月 29 日又出了 6.1 Sol
Strengths
- Astra(9 月 3 日起推出):OpenAI 目前最强,编码 / 科研 / 电脑操作全面跳级
- Sol(9 月 22 日):接日常编码和 agent 活;Luna:接摘要、抽取这类大批量例行活,两者价格都是上一代的一半
- GPT-6.1 Sol(9 月 29 日 DevDay):官方称在编码、电脑操作、专业工作上接近 Astra,价格只有 Astra 的五分之一
- ChatGPT Images 2.5 随 Astra 上线,生图与多轮改图仍是 GPT 的强项
Weakness
- Sol / Luna / 6.1 Sol 目前只在 ChatGPT Work 和 Codex 里,还没进普通 ChatGPT 聊天界面
- Astra 的新推理方式把思考过程藏了起来,可解释性变差
Best for · 要最强的编码 / 科研 / 电脑操作选 Astra;日常 agent 与编码用 Sol;大批量例行活用 Luna
API:Sol $2 / $10、Luna $0.10 / $0.50 每百万 token · ChatGPT Plus 及以上可在 Work / Codex 里用;Luna 桌面端对 Free / Go 开放Gemini 3.8 Flash
主打快 · 编码与 agent 是重点强化方向 · 谷歌生态
Strengths
- 目前最新最智能的“工作马”模型,主攻代码与 agent
- 推理内核算法升级,支持 agentic 视频理解
- 上市即降价:入门价是上一版 3.6 Flash 的一半
- 和 Gmail / Drive / Docs 打通,AI Studio 免费试模型拿 key
Weakness
- 版本迭代极快(3.6→3.7→3.8 只隔几周),信息容易过时
- 指令遵循偶尔松一点
Best for · 要快、处理巨型文档、Google 用户、开发者想白嫖 AI Studio
免费(含 AI Studio)+ 付费档Grok 4.7
9 月 21 日发布 · xAI 新旗舰 · 50 万上下文 · 与 4.6 同价
Strengths
- 专门为要跑好几个小时的难题训练:更大的底座、更长的强化学习、更强的自我校验和长上下文管理
- 据报道参数约 2.1 万亿,比 4.6 大 40%
- reasoning effort 四档可调:low / medium / high(默认)/ xhigh
- 已进 Grok App、Grok Build、Cursor 和 GitHub Copilot
Weakness
- 只吃文本 + 图片输入,输出仅文本
- 多家报道认为仍落后 Claude 和 GPT-6 一截;发布时间也被推迟过好几次
Best for · 长时间跑的 agent 任务、编码、知识工作,且想要比同级模型更便宜
API 20 万 token 内 $2 / $6,超出 $4 / $12 每百万(输入/输出)· SuperGrok $30/月起DeepSeek V4
开源开放权重 · App 完全免费 · 通用+推理二合一
Strengths
- V4 把通用(V 系列)和推理(R 系列)两条血统合并成一个模型
- Pro/Flash 双版本,权重开放、MIT 协议,能自己下载来跑
- 100 万 token 上下文,性价比拉满
- 官方 App / 网页聊天完全免费,没有 Plus/Pro 付费墙
Weakness
- API 计费分高峰/非高峰,高峰时段价格翻倍
- 开源部署 Pro 版对硬件要求高(1.6T 总参数)
Best for · 想要免费好用的日常对话、或想自己部署开源模型省成本的人
App/网页完全免费 · API 非高峰 $0.007/$0.22/$0.66 每百万 token,新账号送 500 万免费 tokenAI Coding 工具
Codex · Claude Code · Antigravity · Grok Build
Codex (OpenAI)
agentic Cloud / CLIOpenAI 官方编码 agent。云端跑,给一个 repo 和任务,它自己开 PR。
结论 · 适合:明确任务的批量修改、写测试。不适合:需要边想边改的探索性工作。
Claude Code
agentic TerminalAnthropic 出品的终端 coding agent。在你的本机 shell 里跑,能读文件、跑命令、跑测试。
结论 · 目前体感最强的本地 coding agent。前提是你愿意在终端里工作。
Antigravity
ide IDEGoogle 推出的 agent-native IDE,多 agent 并行做任务,自带 verification 流。
结论 · 新东西,值得跟。理念上是“IDE for agents”,不是“IDE with AI”。
Grok Build
agentic TerminalxAI 的编码 agent,终端里跑,能同时开到 8 个并行 agent,走 plan → search → build 三段式流程。
结论 · 本地优先,代码不传 xAI 服务器;Arena Mode 会先把候选方案自动打分排名,你再挑最好的。
其他 Agent 框架速查
Hermes Agent — Nous Research 出的开源自主 agent,装在自己服务器上 24/7 跑,接你自己选的模型;干完一个复杂任务会自动写成可复用的 skill,越用越熟练。
DeepSeek Harness — DeepSeek 开源的 agent 运行框架,“everything is a plugin”:模型、工具、界面都能自由换。它对 agent 的定义是 Model + Harness——呼应前面「harness engineering」那个词条。
Grok Bot — xAI 的“常驻 AI 队友”,每个 bot 配一台自己的云端电脑,登进你现有的工具里,你人不在也能不间断把多步任务做完。
Gemini Spark — Google 的 24/7 私人 agent,跑在 Gemini 3.5 上、用的正是前面 Coding 工具里那个 Antigravity harness,和 Gmail / Docs / Slides 深度打通。
Git / 协作术语速查
Git — 给代码拍快照、记录每次改动的工具,能随时回到任何一个旧版本。
repo — 仓库:一个项目全部代码 + 历史记录的文件夹。
commit — 存一次档:把这次改了什么记下来,配一句说明。像游戏存档点。
branch — 分支:在主线之外开一条岔路改东西,试好了再合回主线。
fork — 把别人的项目整个复制一份到自己名下,随便改也不影响原版。
PR — Pull Request:“我改好了,请你看看要不要合并进主线”的申请。
Prompt 库
Copy, fork, replace placeholders
你是我的写作搭档。我有一个粗糙的想法:「{IDEA}」。
请帮我:
1. 提炼这个想法的核心命题(一句话)
2. 给出三种可能的展开角度,每种用一段话说服我
3. 在我选定角度后,给出一个 5 段式的大纲 下面是我刚写的代码。请扮演一个 senior 工程师:
1. 先指出 3 个最值得改的问题(不超过 3 个)
2. 给出修改建议,注明权衡
3. 不要追求“完美”,追求“可维护”
```
{CODE}
``` 请用费曼方法给我讲「{TOPIC}」:
1. 先用我 12 岁能听懂的方式讲一遍
2. 然后用一个生活类比深化理解
3. 最后指出一个常见误解 我正在纠结一个决定:「{DECISION}」。
请帮我用 10/10/10 框架分析:
1. 10 分钟后我会后悔吗
2. 10 个月后呢
3. 10 年后呢
每条不超过两句话,不要鸡汤。 日常项目
Small things, shipped — not planned
挑选地产经纪 Skill
一个 vendor-neutral 的 Claude 技能:教安省买家/卖家怎么判断、面试、背调一个地产经纪 —— 从不推荐具体某个人(包括我自己)。开源可 clone。
Claude Skill · TRESA/RECO · MIT
邮件自动分类 Agent
一个跑在本地的小 agent,每天扫一遍邮箱,把邮件分成 5 类并打标签。两周省下我大约 4 小时。
Claude API · Python · Gmail API
本地 PDF 问答工具
把所有合同 PDF 喂进本地向量库,离线问答。不联网,律师朋友给了 5/5 评分。
Ollama · Llama 3.1 70B · LangChain
周报生成器
读 git commit 和 Slack 频道,每周五自动生成草稿。我只改 20%。
Claude Code · GitHub API · Slack
MCP 自建 server
把家里的 Synology NAS 暴露给 Claude,让它能读我的家庭照片元数据并组织相册。
TypeScript · MCP SDK
Agent 进阶
Cloud · Local LLM · Frameworks · Evals
云服务
- Vercel AI SDK — 最快接 OpenAI / Anthropic / Gemini 的方式
- Replicate / Fal — 跑开源模型的“按次付费”后端
- Modal / Beam — 给你的 agent 一个云上的执行环境
本地大模型
- Ollama — 一行命令跑本地模型,新手首选
- LM Studio — GUI,适合不爱终端的人
- vLLM — 自建推理服务器,吞吐量最高
- 硬件门槛:M-series Mac 32GB 起,或 24GB 显卡
Agent 框架
- MCP (Model Context Protocol) — Anthropic 推动的工具调用标准
- LangGraph — 状态机式 agent,可控性高
- Mastra — TypeScript-first,开发体验好
评估 / 监控
- Langfuse — 开源的 LLM observability
- Braintrust — 评估集 + 实验追踪
- 先写测试,再写 agent。不要反过来。
资源清单
No affiliates · no fluff
常见免费 App
可交给 Agent 的地产技能
What a realtor can hand to an AI agent
全自动=agent 跑完,你只看结果;AI 起草 · 人审=agent 出稿,你逐条过——发出去署你的名;准备全自动 · 执行留人=资料、清单、草稿都由 agent 备齐,签字、定价、按下发送那一下是你。不是机器够不着,是那一下不该交出去。
房源文案
Listing copy
给房源参数和卖点,产出中英文 listing 描述、社媒 caption、email blast。
怎么交 · Claude / GPT 套你的文案模板,批量跑。
营销设计
Marketing design
房源海报、社媒配图、成交卡片、视频封面,按品牌模板批量出图,几个版本任你挑。
怎么交 · 生图模型 + 锁死的品牌模板(颜色、字体、资质行固定),批量跑。
双语沟通
Bilingual comms
客户消息、邮件、文件的中英互译与润色,保留语气和专业度。
怎么交 · 任意大模型;长文件用 Gemini / Claude 长上下文。
社区资料
Neighbourhood briefs
学区、配套、通勤、交易历史汇编成一页客户简报。
怎么交 · 带联网检索的 agent,套统一模板。
CRM 录入
Data entry
把名片、表单、邮件里的联系人信息结构化进 CRM 并打标签。
怎么交 · agent + CRM API / Zapier,定时跑。
Lead 跟进
Lead nurture
起草首轮回复和培育序列,按客户阶段个性化。
怎么交 · CRM 触发 + LLM 起草,你过一眼再发。
多平台宣传
Multi-platform promotion
同一份素材改写成小红书、微信、IG、YouTube 各自的版本,连发布时间一起排好。
怎么交 · agent 出稿 + 排期,你过一眼,一键确认发出。
定价草稿
Pricing / CMA draft
拉可比房源做初步 CMA 草稿。数字和可比盘的取舍必须你核。
怎么交 · 数据接口 + LLM 汇总,人工定价。
预约协调
Scheduling
读邮件意图、提议时段、写进日历;时间冲突交给你拍板。
怎么交 · 日历 MCP + agent。
合同条款初审
Contract review
关键条款抽出来、待注意点列成清单、和模板逐条对照,全部由 agent 备齐。改不改、签不签,是你和律师的判断。
怎么交 · 长上下文模型 + 条款库出对照表,人逐条定。
合规核对
Compliance checklist
按 RECO / OREA / FINTRAC 流程把核对清单和要附的材料备齐,缺什么先标出来。最后打勾确认的是你。
怎么交 · agent 备清单、备材料,你来勾、你来签。
AI 是个有偏见的、健忘的、但表达流畅的同事 — 学会与这样的同事合作,是这个时代的核心技能。
— Arthur · 2026.09.29
12 年全职地产经纪 · Broker · FRI · SRS · ABR · MCNE · CLHMS & GUILD Elite · REAIS