A field guide · 2026 edition

从 prompt 到 agent,
一条清晰的路。

两年的 AI 使用笔记,整理给那些被信息淹没、还没找到入口的朋友 — 一条不绕弯的路径,加上路上的工具、感想和坑。

By Arthur 77 entries 10 sections Updated 2026.09.29

Start the trail
00

日常感想

Field notes · scroll sideways · share to X

09.24tool

Antigravity 终于不难用了:/teamwork-preview 让一个协调者把任务分给几个专项 agent,/boost 动手前先深度核查一遍;Pro/Ultra 的配额也放宽了(具体以账号显示为准)。从「玩具」到能接日常轻工作,这道门槛算是过了。

09.23voice

Live 语音可以开着一直干活,但它是单独一个模型(GPT-Live-1),不是主模型在回答——我拿它派任务、做工作记录,不指望它一次做完复杂活。另外 Desktop 的 Work 语音单独计额度,不是真要操作电脑就别开。

09.12agent

Codex 不同 session 之间已经能互相交接:一个任务把部署安排同步给另一个,对方马上接上,还主动暂停自己的发布避免冲突。以后同时开几个任务,希望能少一点我在中间来回传话。

09.11cost

开始用 GPT 6,第一个感受是得盯着 token。Ultra 和多 agent 协作我不当日常默认——几个 agent 一起跑,消耗实在吃不消。先用低档位,真需要深挖再往上开:先看任务,再决定开多大。

05.20agent

Claude Code 跑了两周,最大的体感是:会写测试的人立刻拉开了不会写测试的人。Agent 写完,你只剩一件事 — 验证。验证靠测试。

05.18prompt

Prompt 工程的本质不是“咒语”,是“把任务说清楚”。能用 Claude 写好 prompt 的人,写产品需求、写邮件、写技术文档也都会变好。

05.15local

本地大模型不是为了省钱,是为了隐私和确定性。Ollama + 一个 70B 的 Q4 模型,能解决 60% 日常问题,剩下 40% 才需要云端。

05.12mindset

新手最大的误区:把 AI 当成搜索引擎。它不是。它是一个有偏见的、健忘的、但表达流畅的同事。学会与这样的同事合作,是这个时代的核心技能。

05.10model

Gemini 2.5 Pro 的 2M 上下文,我塞了一整本 800 页的合同进去问它,它真的能记住第 30 页的某条款。这件事五年前是科幻。

05.07agent

MCP 这个协议被低估了。一旦 agent 能标准化地调用任何工具,模型层的护城河就会被进一步抽空,留下来的是“工具 + 数据”的护城河。

01

先认几个词

Plain-English basics · 像给小学生解释一样

Token令牌

AI 读写文字的最小单位。像把句子剪成一小段一小段(一个词、半个词),AI 一次只“想”一小段,就叫一个 token。

LLM大语言模型

一个读过海量文字、学会“猜下一个词”的程序。你起个头,它接着往下写。GPT、Claude、Gemini 都是 LLM。

API接口

让两个软件互相说话的“插座”。你的程序按约定格式发请求,对方按格式把结果发回来。接入 AI 就是调它的 API。

MCPModel Context Protocol

给 AI 接工具的“万能插头标准”。有了它,AI 能统一地连上你的日历、文件、数据库,不用每样都单独造接口。

Skills技能包

提前给 AI 写好的“某件事怎么做”的说明书 + 资料。要做这件事时它打开对应 skill,就知道步骤和规范。(这个页面就是 AI 照着 skill 帮 Arthur 做的)

Agent智能体

能自己拆步骤、调工具、连着把一件事做完的 AI——不只是回你一句话,而是真去“干活”。

loop智能体循环

AI 干活的节奏:想一步 → 动手调个工具 → 看结果 → 再想下一步,这样一圈圈转到把事做完。这个循环就是一个 agent 的“心跳”。

trace运行轨迹

AI 一步步做了什么的完整流水账——想了什么、调了哪个工具、得到什么结果。出问题时照着它倒查,像行车记录仪。

embedding向量嵌入

把一段文字变成一串数字坐标,意思越接近、坐标离得越近。AI 靠它判断两段话像不像、从一大堆资料里挑出跟你问题最相关的那几段。

RAG检索增强生成

让 AI 回答前先去你的资料库里翻出相关段落,拿着它们再作答——这样它讲的是你的资料,而不是凭记忆瞎编(Retrieval-Augmented Generation,靠上面的 embedding 来找)。

prompt engineering提示词工程

琢磨怎么把话跟 AI 说清楚,好让它给出你要的结果。同一件事换个问法,效果天差地别——这门“怎么问”的功夫就是它。

context engineering上下文工程

比“怎么问”再进一步:管好每次喂给 AI 的那一整包信息——放哪些资料、什么顺序、塞多少、砍掉什么。它答得好不好,一大半看这个。

harness engineering脚手架工程

给模型搭一整套“外壳”——工具、上面那个 loop、权限、上下文怎么管——把一个只会聊天的模型,装成真能干活的 agent。这套外壳就叫 harness。

TTS文字转语音

把写好的文字用接近真人的嗓音念出来。有声书、导航报路、Siri 开口说话,背后都是它(Text-to-Speech)。

STT语音转文字

反过来,把你说的话变成文字。对着手机说一句自动打成字、开会自动出文字稿、语音输入,都是它(Speech-to-Text)。

GitHub代码协作平台

程序员存代码、一起改、看每次改动历史的网站。像代码界的 Google Docs + 网盘 + 修订记录。

HTML网页标记语言

写网页的“骨架”语言,规定一页上有哪些标题、段落、图片、按钮。你现在看的这一页就是 HTML。

02

初级必看 · 新手入门路径

The six steps · click a node to expand

01 理解 LLM 在干什么 30 min 02 学会写 prompt 1 h 03 挑一个主力模型 — 04 把它接进工作流 1 week 05 动手做一个 mini 项目 1 weekend 06 进入 agent / 工具链 持续

Step 01 · 30 min

01

Mental model

理解 LLM 在干什么

Mental model

它不是去 Google 上帮你查答案。它更像一个超会接话的人——你起个头,它就猜“下一个词最可能是什么”,一路接下去。明白这点,后面就不迷糊了。

01 / 06
03

Claude · GPT · Gemini · Grok · DeepSeek

Pick one. Use it for three months. Then reassess.

Claude Opus 5.5Arthur 首推

9 月 22 日发布 · 我的主力推荐 · Fable 5.1 级的表现,运行成本比 Opus 5 低 40%

Strengths

  • 官方数据:大多数工作上达到 Claude Fable 5.1 的水平,运行成本却比 Opus 5 低 40%
  • 编码、agent、电脑操作、知识工作是这一版的重点;输出速度比 Opus 5 快 30%
  • 回答更直白:官方专门改了沟通方式,少绕弯、重点先说
  • 写作语感 + 代码推理仍是招牌,Claude Code 是它的杀手级应用——我每天在用的就是这套

Weakness

  • 网络安全、生物类的敏感请求会被安全机制转给 Opus 4.8 处理
  • 原生生图仍弱于 GPT;同家族的 Sonnet 5.5 / Haiku 5.5 官方说还在后面

Best for · 写作、编程、长文档、agent——日常主力就用它;真正最难的题再叫 Fable

API $4 / $20 每百万 token(输入/输出,比 Opus 5 降 20%)· Pro / Max / Team / Enterprise 订阅可用
04

AI Coding 工具

Codex · Claude Code · Antigravity · Grok Build

01

Codex (OpenAI)

agentic Cloud / CLI

OpenAI 官方编码 agent。云端跑,给一个 repo 和任务,它自己开 PR。

结论 · 适合:明确任务的批量修改、写测试。不适合:需要边想边改的探索性工作。

02

Claude Code

agentic Terminal

Anthropic 出品的终端 coding agent。在你的本机 shell 里跑,能读文件、跑命令、跑测试。

结论 · 目前体感最强的本地 coding agent。前提是你愿意在终端里工作。

03

Antigravity

ide IDE

Google 推出的 agent-native IDE,多 agent 并行做任务,自带 verification 流。

结论 · 新东西,值得跟。理念上是“IDE for agents”,不是“IDE with AI”。

04

Grok Build

agentic Terminal

xAI 的编码 agent,终端里跑,能同时开到 8 个并行 agent,走 plan → search → build 三段式流程。

结论 · 本地优先,代码不传 xAI 服务器;Arena Mode 会先把候选方案自动打分排名,你再挑最好的。

其他 Agent 框架速查

Hermes Agent — Nous Research 出的开源自主 agent,装在自己服务器上 24/7 跑,接你自己选的模型;干完一个复杂任务会自动写成可复用的 skill,越用越熟练。

DeepSeek Harness — DeepSeek 开源的 agent 运行框架,“everything is a plugin”:模型、工具、界面都能自由换。它对 agent 的定义是 Model + Harness——呼应前面「harness engineering」那个词条。

Grok Bot — xAI 的“常驻 AI 队友”,每个 bot 配一台自己的云端电脑,登进你现有的工具里,你人不在也能不间断把多步任务做完。

Gemini Spark — Google 的 24/7 私人 agent,跑在 Gemini 3.5 上、用的正是前面 Coding 工具里那个 Antigravity harness,和 Gmail / Docs / Slides 深度打通。

Git / 协作术语速查

Git — 给代码拍快照、记录每次改动的工具,能随时回到任何一个旧版本。

repo — 仓库:一个项目全部代码 + 历史记录的文件夹。

commit — 存一次档:把这次改了什么记下来,配一句说明。像游戏存档点。

branch — 分支:在主线之外开一条岔路改东西,试好了再合回主线。

fork — 把别人的项目整个复制一份到自己名下,随便改也不影响原版。

PR — Pull Request:“我改好了,请你看看要不要合并进主线”的申请。

05

Prompt 库

Copy, fork, replace placeholders

你是我的写作搭档。我有一个粗糙的想法:「{IDEA}」。
请帮我:
1. 提炼这个想法的核心命题(一句话)
2. 给出三种可能的展开角度,每种用一段话说服我
3. 在我选定角度后,给出一个 5 段式的大纲
下面是我刚写的代码。请扮演一个 senior 工程师:
1. 先指出 3 个最值得改的问题(不超过 3 个)
2. 给出修改建议,注明权衡
3. 不要追求“完美”,追求“可维护”

```
{CODE}
```
请用费曼方法给我讲「{TOPIC}」:
1. 先用我 12 岁能听懂的方式讲一遍
2. 然后用一个生活类比深化理解
3. 最后指出一个常见误解
我正在纠结一个决定:「{DECISION}」。
请帮我用 10/10/10 框架分析:
1. 10 分钟后我会后悔吗
2. 10 个月后呢
3. 10 年后呢
每条不超过两句话,不要鸡汤。
06

日常项目

Small things, shipped — not planned

01

挑选地产经纪 Skill

一个 vendor-neutral 的 Claude 技能:教安省买家/卖家怎么判断、面试、背调一个地产经纪 —— 从不推荐具体某个人(包括我自己)。开源可 clone。

Claude Skill · TRESA/RECO · MIT

02

邮件自动分类 Agent

一个跑在本地的小 agent,每天扫一遍邮箱,把邮件分成 5 类并打标签。两周省下我大约 4 小时。

Claude API · Python · Gmail API

03

本地 PDF 问答工具

把所有合同 PDF 喂进本地向量库,离线问答。不联网,律师朋友给了 5/5 评分。

Ollama · Llama 3.1 70B · LangChain

04

周报生成器

读 git commit 和 Slack 频道,每周五自动生成草稿。我只改 20%。

Claude Code · GitHub API · Slack

05

MCP 自建 server

把家里的 Synology NAS 暴露给 Claude,让它能读我的家庭照片元数据并组织相册。

TypeScript · MCP SDK

07

Agent 进阶

Cloud · Local LLM · Frameworks · Evals

云服务

  • Vercel AI SDK — 最快接 OpenAI / Anthropic / Gemini 的方式
  • Replicate / Fal — 跑开源模型的“按次付费”后端
  • Modal / Beam — 给你的 agent 一个云上的执行环境

本地大模型

  • Ollama — 一行命令跑本地模型,新手首选
  • LM Studio — GUI,适合不爱终端的人
  • vLLM — 自建推理服务器,吞吐量最高
  • 硬件门槛:M-series Mac 32GB 起,或 24GB 显卡

Agent 框架

  • MCP (Model Context Protocol) — Anthropic 推动的工具调用标准
  • LangGraph — 状态机式 agent,可控性高
  • Mastra — TypeScript-first,开发体验好

评估 / 监控

  • Langfuse — 开源的 LLM observability
  • Braintrust — 评估集 + 实验追踪
  • 先写测试,再写 agent。不要反过来。
08

资源清单

No affiliates · no fluff

常见免费 App

09

可交给 Agent 的地产技能

What a realtor can hand to an AI agent

全自动=agent 跑完,你只看结果;AI 起草 · 人审=agent 出稿,你逐条过——发出去署你的名;准备全自动 · 执行留人=资料、清单、草稿都由 agent 备齐,签字、定价、按下发送那一下是你。不是机器够不着,是那一下不该交出去。

全自动

房源文案

Listing copy

给房源参数和卖点,产出中英文 listing 描述、社媒 caption、email blast。

怎么交 · Claude / GPT 套你的文案模板,批量跑。

全自动

营销设计

Marketing design

房源海报、社媒配图、成交卡片、视频封面,按品牌模板批量出图,几个版本任你挑。

怎么交 · 生图模型 + 锁死的品牌模板(颜色、字体、资质行固定),批量跑。

全自动

双语沟通

Bilingual comms

客户消息、邮件、文件的中英互译与润色,保留语气和专业度。

怎么交 · 任意大模型;长文件用 Gemini / Claude 长上下文。

全自动

社区资料

Neighbourhood briefs

学区、配套、通勤、交易历史汇编成一页客户简报。

怎么交 · 带联网检索的 agent,套统一模板。

全自动

CRM 录入

Data entry

把名片、表单、邮件里的联系人信息结构化进 CRM 并打标签。

怎么交 · agent + CRM API / Zapier,定时跑。

AI 起草·人审

Lead 跟进

Lead nurture

起草首轮回复和培育序列,按客户阶段个性化。

怎么交 · CRM 触发 + LLM 起草,你过一眼再发。

AI 起草·人审

多平台宣传

Multi-platform promotion

同一份素材改写成小红书、微信、IG、YouTube 各自的版本,连发布时间一起排好。

怎么交 · agent 出稿 + 排期,你过一眼,一键确认发出。

AI 起草·人审

定价草稿

Pricing / CMA draft

拉可比房源做初步 CMA 草稿。数字和可比盘的取舍必须你核。

怎么交 · 数据接口 + LLM 汇总,人工定价。

AI 起草·人审

预约协调

Scheduling

读邮件意图、提议时段、写进日历;时间冲突交给你拍板。

怎么交 · 日历 MCP + agent。

执行留人

合同条款初审

Contract review

关键条款抽出来、待注意点列成清单、和模板逐条对照,全部由 agent 备齐。改不改、签不签,是你和律师的判断。

怎么交 · 长上下文模型 + 条款库出对照表,人逐条定。

执行留人

合规核对

Compliance checklist

按 RECO / OREA / FINTRAC 流程把核对清单和要附的材料备齐,缺什么先标出来。最后打勾确认的是你。

怎么交 · agent 备清单、备材料,你来勾、你来签。

想自己动手做一个 AI 地产 agent? 我写了一份从零开始的完整动手教程——也讲清楚它的能力边界,以及为什么仍然需要一个真人。 看教程 →
AI 是个有偏见的、健忘的、但表达流畅的同事 — 学会与这样的同事合作,是这个时代的核心技能。

— Arthur · 2026.09.29

12 年全职地产经纪 · Broker · FRI · SRS · ABR · MCNE · CLHMS & GUILD Elite · REAIS