Scaling!基于Hermes Agent的学术分身构建
引言
去年 2 月,我写过一篇推文《AAAR-使用AI加速学术研究的方法论与经验》,尝试把 AI 在社会科学中的应用分为 RA、Supervisor、Domain expert、Agent 和 Governance 五个层次。当时介绍的重点,主要是如何将 AI 作为研究助理、学术同行和专业工具纳入日常工作流;Agent 主要作为被动响应的导师或硅基样本出现。随着Claude code、Cursor等Coding Agent的兴起,以及Opus 4.5在Agent能力上的进步,我们的AI,终于可以稳定获取用户本地环境,发挥其规划和自主行动的能力,接管更多日常任务。
从Chatbot到Agent,AI跨越了一大步,它终于可以干生产力的活儿,狠狠冲击知识工作者了(让人退化为按Accept的工具,bushi)。
OpenClaw的作者Peter Steinberger较早探索了Opus 4.5模型的自主能力,搓出了小龙虾,在X上火了一阵子之后,春节期间又席卷中国。小龙虾主要解决的问题是,原来的 Claude Code、Cursor 这类工具,对大众来说还是有一些使用门槛的,它们大多需要在终端或 IDE 里操作,要配置环境,也要理解一些基本的使用方式。在交互上,OpenClaw 可以接入各种聊天软件和即时通信工具,方便很多,用户可以直接体验当老板的感觉。然而半年过去,一切归于沉寂,小龙虾仿佛上世纪的产物。
但这半年里,我自己还是用小龙虾干了不少活儿,包括聊天扯淡、远程修bug,给朋友们分享我的bot,让他们用上前沿模型等等。
因此,在这里,我还是想把我的经验分享给大家,我的主要用法是构建自己的学术分身,Scaling我自己,同时也有个镜像的自己,能有不一样的视角和我对话。本篇仅个人经验,大家如有相关意见建议,也欢迎和我联系。
为什么需要一个学术分身
我先介绍一些概念,和一些师友交流的时候,我发现人们对AI能力的偏置,常常来源于不清楚自己使用的是哪个层次的工具。
从 LLM 到 Agent
LLM、Chatbot 和 Agent 是三个不同层次的概念。LLM本质上是一组训练完成的权重,接收输入,进行计算,再输出文本或其他内容。它可以具有很强的知识与推理能力,但模型本身并没有文件、终端、浏览器和工作空间,也无法独立在真实环境中执行任务。Chatbot 则是在模型之上增加对话界面,使普通使用者能够通过自然语言与模型持续交互。ChatGPT 的重要意义,不仅来自 GPT 模型本身,也来自它将大模型转化为大众可直接使用的产品。
Agent这个词,有叫代理,有叫智能体,我更倾向叫智能体,它进一步为模型提供了自主规划、工具调用和环境交互能力。接到任务后,它可以读取指令和本地环境,规划下一步操作,调用文件、终端、浏览器等工具,再根据执行结果进行检查和修正,直至交付结果或请求人工介入。因此,Agent 的基本结构可以理解为一个循环:规划、执行、观察、调整。若将 LLM 或 Chatbot 比作一个只能在空房间中与人对话的知识工作者,那么 Agent 相当于为其提供电脑、资料、网络和工作空间,使其能够实际完成任务。

Harness:连接模型、工具与环境
Harness 原指马的挽具,在当前的 Agent 语境中,可以理解为连接模型、工具与环境的脚手架。模型能力决定基础智能水平,Harness 则决定模型能够获得什么上下文、使用哪些工具、如何执行动作、怎样检查结果以及在发生偏差时如何恢复。同一个模型置于不同 Harness 中,最终表现可能存在明显差异。例如,Claude 在 Claude Code 中的项目理解与工具调用方式,与其在其他 Agent 框架中的表现并不完全相同。
过去人们重视 prompt engineering,如今又开始讨论 context engineering 和 harness engineering。这些概念背后的共同问题,是如何为模型提供更合适的任务信息、工具与反馈机制。使用 Agent 与指导学生存在某种相似之处:了解其优势和不足之后,才能判断哪些任务可以简要交代,哪些要求必须明确写出,哪些操作需要严格限制。模型并不是决定结果的唯一因素,环境组织、权限设计与验收机制同样重要。

从会话工具到长期分身
ChatGPT的网页版已经可以完成很多任务,但我们不可能一直在窗口会话中复制粘贴或切来切去。Claude Code 和 Codex 更适合围绕具体代码仓库或项目开展工作,代码能力和项目执行能力很强;但如果希望 AI 长期驻留在一套稳定环境中,跨会话记住使用者与项目,并通过即时通讯软件随时接受任务,还需要另一种产品形态。
![]()
学术分身的关键不只是能力更强,而是协作关系发生变化。会话工具通常由使用者主动打开,围绕当前任务提供帮助,任务结束后关系也随之中止;分身则具有相对稳定的身份、资料、工作环境与长期记忆,可以持续推进任务并积累经验。与此同时,更强的能动性意味着更高的权限和更大的风险。使用者需要从“如何向模型提问”进一步转向“如何定义任务、设置边界、追踪执行并验收结果”。
Scaling Yourself
工业界长期讨论 Scaling Law,即通过增加模型参数、训练数据或测试时计算来提升能力。但我认为, Scaling 的对象不一定只能是模型,也可以是研究者本人。传统上,研究者扩大个人能力的方式之一是培养学生,将选题、数据、方法、写作和判断标准逐步传递给下一代。学生获得了导师的部分知识与方法,这可以视为一种缓慢而长期的人类知识蒸馏。
构建学术分身提供了另一条路径,将个人简历、研究资料、工作习惯、学术品味和方法论转化为可被 Agent 理解和执行的数字资产。理想状态下,一个研究者可以在参加会议或处理其他事务时,让多个分身分别阅读文献、执行分析、管理实验和修改草稿,使部分研究工作获得横向扩展。
这一过程的意义不仅在于提升产出,还在于促使研究者重新认识自己的工作方式。许多研究经验原本以默会知识的形式存在,例如怎样判断研究品味、哪些数据源更可靠、什么结果需要特别警惕、论文应当如何 framing。只有将这些判断显性化,才有可能进一步转化为具有复利的工作流。
为什么是现在
构建长期分身在两年前是比较困难的,主要是模型能力太拉垮,harness也不完善,但最近逐渐成熟了。首先,前沿模型的 coding 能力明显提升,使其能够更可靠地调用工具、访问环境并执行多步骤任务;其次,上下文、持久记忆和 Skills 机制逐渐成熟,Agent 可以跨会话积累对使用者和项目的认识;再次,飞书等消息渠道和定时任务使异步协作成为可能;最后,API 价格持续下降,较便宜的模型也能够承担大量日常任务。模型、记忆、工具、通信和成本几方面的变化,共同使个人长期运行 Agent 变得更加可行。
为什么选择 Hermes Agent
Hermes Agent 的定位
Hermes Agent 是 Nous Research 开源的通用 Agent,采用 MIT 许可证,支持多模型、CLI、消息 Gateway、持久记忆、Skills、定时任务和多种运行后端。它较为突出的特征是 self-improving:使用者在工作中纠正其行为、补充操作方法后,Agent 可以更新 memory,也可以将成功流程整理为可复用的 Skill。与一次性对话相比,这种机制更适合长期协作。从 OpenRouter 的 Agent 使用数据来看,Hermes 的使用量长期处于较高位置。
Hermes、OpenClaw 与 Codex
不同 Agent 的定位并不相同。Claude Code 和 Codex 主要面向代码仓库和具体项目,适合代码密集型研究;OpenClaw 更偏向多渠道个人助理,生态较为丰富,但整体系统和配置相对复杂;Hermes Agent 同样支持长期运行和消息交互,同时更强调多模型、持久记忆和 Skills 学习循环。
我目前运行了多个分身实例。主力是Hermes + Astra,搭配了OpenClaw + DS 4.1flash,用Hermes做主力主要是OpenClaw太容易炸了,经常一升级莫名其妙就挂了。但保险起见,也把OpenClaw装上,在网络有问题的时候,OpenClaw可以临时顶上,并且DeepSeek 4.1 flash又快又便宜。

如何制作一个学术分身
蒸馏自己
制作分身的第一步是蒸馏自己。
我的做法是整理一份较为完整的 CV,其中包括教育和工作经历、发表论文、研究方向及正在开展的项目,再将这些信息交给 Agent。此后,通过真实任务逐步补充项目状态、常用工具和稳定偏好。相比直接复制一份篇幅很长的通用人格提示词,这种基于真实资料和持续协作形成的身份与记忆通常更有针对性。
Hermes 会将身份、使用者信息、记忆、会话与 Skills 保存在工作目录中。不同版本的内部结构可能调整,但从使用者角度,可以将其理解为以下长期资产:
1 | |
给TA一间房子
研究生需要工位,分身同样需要稳定的运行环境。我使用的是一台独立的 MacBook Air,加上教育优惠和国补,成本约为 6500 元(我是今年上半年买的,现在涨了不少)。它平时保持开机,专门用于运行 Agent;即使短暂断电,也可以依靠电池继续工作。独立设备的首要价值是隔离,如果 Agent 在操作文件或配置环境时出现问题,不会直接影响主力电脑。
Hermes 本身对本地算力要求并不高。如果底层使用云端模型,闲置笔记本或低配置云服务器通常也可以承担运行环境。云服务器便于远程部署,但配置、升级和访问本地资料可能稍显复杂;独立电脑则更容易复制研究者原有的软件与目录结构。我个人更倾向于 Mac ,因为 Windows 的环境、路径和 PowerShell 可能增加额外配置成本,就不要强行让Astra大战PowerShell吧。
设备准备完成后,还需要配置 Python、Stata、R、LaTeX、Zotero 等研究工具,并尽量保持与主工作区相近的目录结构。这里,有人可能会说要装Stata MCP,其实不需要哈,跟Agent说好电脑里有Stata就行,模型可以直接通过Stata的Python接口进行调用的。
交互渠道
我主要通过飞书与Agent交互。飞书在很早期就做了小龙虾的适配,接入Hermes很方便。作为旗舰办公软件,飞书对文档、群消息、超链接、Markdown格式的支持,远好于微信,飞书cli也越来越强大。推荐大家用飞书,以及我认为,现代科层组织,都应该运行在飞书之上。
Hermes Agent 的部署与配置
官方目前提供桌面端和命令行版。在 macOS、Linux 或 WSL2 中,可以使用以下命令完成安装,再依次进行初始化、模型选择和环境检查:
1 | |
原生 Windows 可以在 PowerShell 中运行官方安装脚本:
1 | |
如果安装过程中出现仓库克隆或依赖下载失败,首先可以检查网络并重新运行安装命令,在大陆经常会出现网络不稳定导致的error,多试几次。安装后,会进入配置引导页面,可以配置模型、接入的即时通讯工具等等。
1 | |
Ps:如果安装有困难,可以直接让您的AI来装,或者B站有一些教程看看。
接入飞书
飞书接入可以通过 Gateway 向导完成。向导支持扫码创建应用,也可以手动输入飞书开放平台提供的 App ID 与 Secret:
1 | |
如果扫码流程不可用,也可以手动将凭证写入
~/.hermes/.env。下列内容仅为结构示例,真实 App Secret
不应写入公开文章、代码仓库或群聊:
1 | |
WebSocket 长连接不需要公网 IP,适合本地电脑与私有服务器。具体权限、事件订阅和环境变量应以飞书接入文档为准。第一次私聊可能需要 pairing,相关用户可以通过命令行审批或撤销:
1 | |
案例演示
接入飞书的情况
进入飞书开发者后台(open.feishu.cn),能看到自己的bot,如图:

我实际在用bot是徐长卿和林业平,其中林业平由Astra驱动,配的是Hermes,徐长卿则是OpenClaw + DeepSeek V4.1 Flash。
下面让林业平做个自我介绍:



政府数据开放DID
为了测试分身能否完成一条较为完整的社会科学工作流,我准备了一个练习性的 DID 题目:政府数据开放是否会影响居民的Political Trust?我之前提供过我的工作目录,其中包含地级市公共数据开放试点、微观调查个体数据,以及一部分不完整的 Stata 代码。我说明代码仅供参考,要求 Agent 自行检查数据并完成分析。
Agent 随后读取数据、合并面板并执行回归,使用我本地的latex,编译了一份较完整结果说明PDF。

读一下,结果还是相当可以的。您可以自己找一些项目试试。
安装经济学 Skills
网上有一些不错的econ skills,比如 AI Skills
for Economists ,我把GitHub 地址发送给
Agent,要求它检查并安装其中适用的 Skills。Agent 识别出 17 个标准的
SKILL.md,内容涉及使用 R 完成 IV、DID 与 RDD,使用 Python
处理面板数据,执行 Stata 回归,编写 LaTeX
经济学模型,以及开展文献综述和论文写作。
与只提供固定流程的科研网站相比,通用 Agent 的优势在于能力可以继续扩展。研究者既可以安装已有 Skill,也可以将自己的工作方法整理为新的 Skill。
生成完整论文意味着什么
另一个值得讨论的问题是:Agent 能否直接生成一篇完整 paper?答案是当然可以。我测试过一个较完整的任务,让 AI 编写一篇题为 Gig Economy and Crime: The Causal Effect of Food Delivery Platform Expansion on Urban Crime Rates in China 的英文论文。研究设想是:外卖平台扩张吸收了大量骑手,而就业可能影响犯罪,那么零工经济是否降低了城市犯罪率?我将研究问题、基本设定和材料交给 Cursor,当时用的是Opus 4.6,由其完成整篇草稿(使用模拟数据)。
整个过程约一小时,API 成本约 200 元(如果用国产模型,可能只要几块钱),最终得到 41 页内容,包括摘要、文献综述、理论机制、DID、安慰剂检验、稳健性分析与参考文献。

基于模拟数据的梦中情图:

程序开发领域曾流行 Talk is cheap, show me the code。随着前沿模型代码能力的提升,代码本身的生产成本开始下降,大家都在用AI编程,怎么正确给AI许愿变得重要,于是便有了 Code is cheap, show me the talk 。学术界过去也可以说 Idea is cheap, show me the paper ,因为把一个设想转化为完整论文需要长期执行;下一阶段可能会转向 Paper is cheap, show me the idea 。或许未来,研究会回到兴趣驱动。今年,计算机领域重要会议ICLR的投稿量,比以往所有年份加起来都要多,CS会议的DDoS攻击已经到来,社科领域由于付费墙和一些问题,这一天的到来会晚一些,但也只是时间问题。

学术分身的优势与局限
即时性、持续性与可追踪性
通过飞书分配任务较为自然,研究者不需要持续停留在电脑前,Agent 可以在收到任务后独立执行,完成后返回结果,出现问题时再根据反馈修改,体验一把当老板的感觉。执行过程通常会保留日志,因此研究者可以追踪其运行过哪些命令、读取过哪些文件。随着记忆和 Skills 的积累,Agent 也会逐渐熟悉项目背景与个人偏好,从临时工具转变为更稳定的协作者。
验证困难与信息消化
独立设备带来隔离,也增加了验收成本。如果 Agent 在另一台电脑上清洗数据、编写 Stata 代码,研究者未必会像本机操作那样随时看到中间数据和代码变化;分身越能自主执行,越需要提前设计日志、同步、抽查和回滚机制,否则执行环节节省的时间可能在验收阶段重新付出。
另一个问题是信息消化。AI 可以在短时间内生成长篇报告、筛选大量摘要和运行多组回归,但研究者未必有足够时间理解全部产出。陶哲轩所说的“证明的消化不良”,会成为一个大问题,不仅仅在数学领域。
号外
- 这篇推文有一部分是AI写的,我原本想手搓的,但实在是太难了,人懒了就回不去。现在终于明白为什么减肥难了,淦!
- 同时搭配两个Agent是有必要的,做好冗余设计,炸机的时候相互修;
- Mac平台推荐使用Amphetamine,一个免费好用的App,来让系统保持活跃,避免睡眠。