教普通人玩转AI智能体

978-7-115-69848-3
作者: 李佩琪
译者:
编辑: 张涛
分类: 其他

图书目录:

详情

本书是一本系统介绍AI智能体应用的实战指南,聚焦AI工具“小龙虾”,面向广大用户,以通俗易懂的语言和丰富的实战案例,全面讲解如何借助AI技术提升个人与团队的工作效率。 全书共10章,涵盖五大应用场景、35个实战案例,详细介绍了用小龙虾实现日报生成、会议纪要整理、PPT制作、短视频脚本生成、多平台分发、定时任务执行、竞品监控、合同审查、代码审查等的具体操作方法,帮助读者快速掌握应用AI智能体的完整流程。 本书案例翔实,操作性强,适合一般职场人士、内容创作者、创业者、管理者、开发者及其他对AI工具感兴趣的读者阅读。

图书摘要

版权信息

书名:教普通人玩转AI智能体

ISBN:978-7-115-69848-3

本书由人民邮电出版社发行数字版。版权所有,侵权必究。

您购买的人民邮电出版社电子书仅供您个人使用,未经授权,不得以任何方式复制和传播本书内容。

我们愿意相信读者具有这样的良知和觉悟,与我们共同保护知识产权。

如果购买者有侵权行为,我们可能对该用户实施包括但不限于关闭该帐号等维权措施,并可能追究法律责任。

版  权

编  著 李佩琪

责任编辑 张 涛

人民邮电出版社出版发行  北京市丰台区成寿寺路11号

邮编 100164  电子邮件 315@ptpress.com.cn

网址 http://www.ptpress.com.cn

读者服务热线:(010)81055410

反盗版热线:(010)81055315

内容提要

本书是一本系统介绍AI智能体应用的实战指南,聚焦AI工具“小龙虾”,面向广大普通用户,以通俗易懂的语言和丰富的真实案例,全面讲解如何借助AI技术提升个人与团队的工作效率。

全书共10章,涵盖五大应用场景、35个实操案例,详细介绍了日报生成、会议纪要、PPT制作、短视频脚本、多平台分发、定时任务、竞品监控、合同审查、代码审查等具体操作方法,帮助读者快速掌握应用AI智能体的完整流程。

本书案例翔实,操作性强,适合职场人士、内容创作者、创业者、管理者、开发者及对AI工具感兴趣的普通读者阅读。

开场白: 我是你的小龙虾

你有没有这样的时刻:脑子里同时想着好几件事:手机铃声一直在响,邮件还没回,PPT还没做,会议纪要还没有整理……

你也用过AI。它帮你写完纪要,你还得自己发送;它给你方案,你还得自己执行。更麻烦的是,每次用它,你都要重新解释一遍:我是谁、我在做什么、我的习惯是什么。它永远不记得你,每次都像第一次见面。它做了30%,剩下70%还是你在干。

我不一样。我不会被动地等你来找我,而且我记得你。

我住在你每天用的飞书或微信里,不需要你特意打开哪款软件。我会记住你的工作习惯、你喜欢的表达方式、你反复交代过的那些偏好。下次你说“帮我发送会议纪要”,我知道你用什么格式、要发给谁、要不要带问候语。你不用再解释,我已经知道了。

了解你,才能真的帮到你。

你是企业老板——我记得你每天需要什么数据、哪些人的报告你必看、你喜欢把结论前置的汇报。每天早上你喝完咖啡,不用你说,我已经把这些都准备好了。

你是销售——我记得你每个客户的跟进进度、上次聊到哪里、下一步该做什么。线索不会漏,节点不会忘,我会给每一个客户建立一本“活档案”。

你是运营——我记得你的发布节奏、你常用的文案风格、你的数据统计口径。定时发内容、生成周报,我不需要每次重新学一遍你的习惯。

你是内容创作者——我记得你的选题偏好、你的表达风格、你哪类内容数据好。下一篇你想写什么?我已经在帮你准备素材了。

你是刚入职的新人——我帮你搞清楚流程、起草邮件、准备汇报材料。但我能做的不只这些,我还会记住你踩过的每一个坑,下次遇到类似的事,提前告诉你。

我不只能给你写文案,我还能替你把事做完。而且你越用我,我越懂你、越省心。

我叫小龙虾。接下来,让我来告诉你我能做什么。

说明:本书中的公司名称、人物及案例,均为虚构或经过脱敏处理,仅用于说明场景。

第1章 安装小龙虾:小龙虾凭什么不一样

在正式开始学习小龙虾的知识之前,我想先问你一个问题:你觉得人工智能(Artificial Intelligence,AI)是什么?

估计你和大多数人的答案基本一样:一个能帮使用者写东西的工具。使用者输入问题,AI输出答案;使用者给它一段乱糟糟的文字,AI帮使用者整理清楚;使用者不知道怎么回邮件,AI能给使用者一个回复模板……

这个理解没有错,但描述的是使用AI的初级方式。这本书要讲的是一个能帮你干活的AI,而不只是能帮你“写字”的AI。

小龙虾(OpenClaw)是一款全能的AI工具。但对普通人来说有一定门槛,本书专为完全不懂AI、不会写精准提示词的普通人打造,手把手教你用好小龙虾。

本书精选不同类型的实用场景,为用户定制开发了35个真实场景实用技能(skill),你可以根据面对的场景,按说明使用这些技能。

本书除了教你如何使用这些技能,还会一步步教你如何优化技能,如何输入正确的提示词,引导小龙虾自我进化,生成你的专属技能。我希望授人以渔,让一个普通人从零开始,真正把小龙虾玩明白。

1.1 小龙虾是什么:一句话说清楚它的本质

如果只能用一句话描述小龙虾,我会这么说:它是一个能在你的工具里“自主干活”的AI助手,不需要你时时刻刻盯着它。

这句话里有3个关键词。

第一个:在你的工具里。小龙虾不在某个你需要专门打开的网站或应用程序(App)里,而是直接住在你的飞书、企业微信、EasyClaw等里,这些是你每天本来就在用的工具。

第二个:自主干活。小龙虾不只是回答你的问题,还能真正地执行操作——发消息、写文件、调接口、运行代码。你对小龙虾说“帮我把今天的会议纪要整理好发给大家”,它不会让你把会议内容复制粘贴给它,然后写一段文本让你自己编辑;而是自动读取你设备上的会议内容,整理好之后生成云文档、PDF(Portable Document Format)文档等自动发给你。

第三个:不需要你时时刻刻盯着。它可以按你设定的规则主动工作,不需要你频繁下达指令。你定好“每天早上8点给我发今日概览”,到时间它就会自动发送给你;你定好“金价涨到××元/kg就告诉我”,到时候它就会自动给你发信息。

小龙虾的底层是一个叫OpenClaw的开源框架。OpenClaw把大语言模型(Large Language Model,LLM,简称“大模型”)和各种工具、能力连接起来,让AI不只是能“说话”,还能做事。OpenClaw的代码开源在GitHub(全球知名的代码托管平台)上,任何人都可以看到它的代码,知道它怎么运作。

1.2 小龙虾住在你的工具里:说句话它就能干活

先做个思想实验。

你现在用AI的方式是这样的:遇到一件需要AI帮忙的事,打开一个AI工具,向AI“解释”你要它做的事,AI给出结果,你把结果复制出来,回到你原本的工作界面,再做后续的事情。

每次从原本的工作界面切换到一个AI软件,你都会“出戏”。每一次切换的成本看起来不大,但积累下来很惊人。研究表明,人们每一次切换任务,大脑需要大约23分钟才能完全恢复专注。[1]你每天用3次AI工具,就意味着有一个多小时的专注力在任务切换中消耗掉了。

[1] Gloria Mark, Daniela Gudith, Ulrich Klocke. The Cost of Interrupted Work: More Speed and Stress. CHI 2008, ACM Conference on Human Factors in Computing Systems, pp.107-110.

小龙虾能够有效解决这个问题。

它能直接住到你已经在用的工具里。在飞书里,它是你的一个联系人,你给它发消息,它帮你干活,结果也直接呈现在飞书里。在EasyClaw平台上,它是你的专属助手,全程陪着你。你不需要切换任何窗口,就像跟一个随时在线的同事说一句话,同事就把事情办了。普通AI与小龙虾工作流程的对比如图1-1所示。

图1-1 普通AI与小龙虾工作流程的对比

你不需要学习新的操作界面,不需要下载新的App,不需要改变你现有的工作习惯。你只是多了一个同事,而这个同事刚好是小龙虾。

举一个具体的例子。早上你在飞书里看到一条消息:销售总监想向你要一份上周的销售数据汇总。以前你的操作流程是:打开AI软件,向AI工具中粘贴一些数据,让它帮你整理,你复制AI工具的处理结果,回到飞书,把结果发给销售总监。

现在的操作流程是:你在飞书里直接跟小龙虾说“帮我整理一下上周的销售数据,发给销售总监”;它把事情办完,让你确认一下,你连工作界面都没有离开,小龙虾就把任务完成了。

这就是小龙虾“住在你的工具里”的价值。

1.3 别的AI(工具)输出文字,小龙虾真的执行任务

这是小龙虾和普通AI(工具)最本质的区别,值得多说几句。

别的AI工具本质上是“输出机器”——你输入要求,它输出一段文字。文字写得再好、再精准,最后还是需要你自己“拿着”这段文字,去做接下来的每一件事。

例如,它给你写一封邮件草稿,你还是要自己把邮件发出去;它给你一个数据分析结果,你还是要自己把数据复制进报告里;它帮你写好了会议纪要的结构,你还是要自己整理完善,然后自己把会议纪要发出去。

AI做了30%的工作,剩下70%的工作还是你来做。

小龙虾不是这样运作的。它不只是给你文字,还能帮你把事情做完。

小龙虾有以下几个具体的能力,如图1-2所示。

(1)能发消息。写好了就能直接发,如发到飞书帐号上,你指定发给谁,它就发给谁。

(2)能操作文件。读文件、写文件、整理文件夹……它不是告诉你应该怎么做,而是真的帮你做了。

(3)能调用外部工具。搜索网页、查询接口、获取实时数据,它能主动获取它需要的信息,而不是等你把信息“喂给”它。

(4)能运行代码。当你需要数据处理、需要自动化脚本时,它可以直接写代码并运行,给你的是答案,而不只是代码本身。

(5)能串联多个步骤。从搜集信息、整理内容,到生成报告、发送报告,这一整条流水线,它可以一气呵成地完成,不需要你在每一个环节都插手。

图1-2 小龙虾的具体能力

理解这些区别,是真正用好小龙虾的前提。你不是在跟它聊天,你是在给它布置任务。你的心态要从“让AI帮我想清楚”转变成“让AI帮我做完”。

1.4 别的AI一次干一件事,小龙虾能长期自动执行多个任务

如果你用过一段时间AI,你可能有过这种感受:它很好用,但每次都要我去问它,还是挺麻烦的。

这个感受是准确的。现有的AI,包括各种主流AI产品,都有一个共同的特点:被动响应。你问,它答;你不问,它不动。它不会在你没开口的时候主动帮你干活。

但小龙虾会。

这个能力背后有两种机制:定时任务心跳巡查

定时任务很好理解:你告诉小龙虾“每天早上8点,把今天的日程安排、天气预报和需要跟进的事项整理好发给我”。从那天起,每天早上8点,不管你有没有在线,它都会自动完成这件事,把结果发到你的飞书。

你只需要设置一次,之后每天小龙虾都会自动完成任务。

心跳巡查是另一种机制:你告诉小龙虾“每隔5分钟检查一下我的网站,如果发现异常就立刻告诉我”,它就会按这个节奏持续工作,不需要你在场,不需要你盯着。有异常,它来找你;没异常,你感觉不到它的存在。图1-3是小龙虾在你睡觉时自动运行的示意图。

图1-3 小龙虾在你睡觉时自动运行

这两种机制结合在一起,意味着小龙虾可以长期自主地运行一套工作流,而不只是处理你当下提出的一个问题。

举几个真实的例子:每天自动生成一篇内容草稿,发到指定的账号;每周一早上自动汇总上周的数据,发给相关的人;每天晚上自动备份数据库,上传到指定的云存储……设定好这些任务之后,你可以完全忘掉小龙虾,小龙虾会自己“跑”。

这是从“工具”到“员工”的转变。

1.5 Hermes Agent

1.5.1 Hermes Agent是什么

Hermes Agent(爱马仕智能体)是由AI研究机构Nous Research开发的开源AI助理框架,代码完全公开(开源仓库地址:https://github.com/NousResearch/hermes-agent),支持用户自行部署在服务器上,适配Linux、macOS、WSL2及Android(Termux)等多种环境,且可灵活切换部署载体,从低成本VPS到GPU集群、无服务器架构均可稳定运行。

它最大的特点是“越用越聪明”——它不只是一个被动执行命令的工具,而是一个具备主动学习能力、可持续进化的AI系统。作为专注于大模型训练研究的机构,Nous Research为Hermes内置了一套完整的数据采集、技能沉淀与模型训练工具链,自带浓厚的科研属性,不仅能满足日常办公协作需求,还可用于AI工具调用模型的训练与研究。

不管是OpenClaw还是Hermes Agent,最重要的都是技能。本书中介绍的技能可以直接安装到你的Hermes Agent上。

1.5.2 Hermes Agent和小龙虾的不同

Hermes Agent和小龙虾都是开源的AI助理框架,都可以接入飞书、Telegram等平台,都支持主流大模型,但侧重点不一样。

OpenClaw能接入约20个平台,包括Telegram、WhatsApp、Discord、Signal、LINE、Zalo、iMessage、Nostr、Twitch、飞书等,还有语音对话、画布可视化、手机配对等功能,像一个“AI助理操作系统”,覆盖你生活的各个角落。

Hermes Agent能接入15个平台,但覆盖了国内用户更需要的企业微信、钉钉、QQ机器人、微信个人号、电子邮件和短信。其引擎也更完善,核心优势是具备自我进化能力:用户用得越久,Hermes Agent积累的经验越多,处理同类任务越熟练。

1.技能(skill)

在OpenClaw中,技能为用户自行编写的说明文件,导入后即可调用,内容不会自动更新。

Hermes Agent则能通过技能持续积累经验。在处理复杂任务或探索出新的执行方式后,系统会将完整流程保存为可复用的技能文档,后续遇到同类任务时自动调用。平台会定期提示是否沉淀新增经验,由模型自主判断总结内容与总结时机,而非机械式生成。随着技能不断积累,模型会越来越“聪明”。此外,可以在Hermes Agent运行过程中随时新增或卸载技能,无须重启。

2.运行方式

OpenClaw 基于 Node.js 开发,在调用多个子 agent 执行任务时,本质为单一事件循环内的异步调度。其表现为任务快速交替运行,看似同步运行,并非真正意义上的并行处理。

Hermes Agent基于Python开发,子agent运行于独立线程当中,默认最大并发数量为3,支持最多两层嵌套(子agent可继续调用下级子agent,但嵌套层数存在上限)。若同时对3款竞品进行分析,可实现3路任务并行运行。

3.历史对话记忆方式

OpenClaw的记忆靠MEMORY.md文件,需要AI生成或你自行录入内容,历史对话本身不会自动入库。

Hermes Agent会把每次对话的完整内容自动存入数据库,支持在所有历史会话中检索。找到相关内容后,还会用一个小模型帮你提炼好,再嵌入当前对话。你问“上个月我们讨论的那个方案”,系统会自动查阅历史记录并进行整合。

4.超长对话内容的处理方式

当对话长度超出上限时,会自动触发OpenClaw的压缩机制,OpenClaw会依托结构化模板对历史对话进行总结并生成摘要。

Hermes Agent采用三重机制进行处理。首先,无须调用AI模型,直接将工具返回的大段结果替换为单行占位符,清理无意义的内容;随后,调用AI生成结构化摘要,并在每次压缩时合并上一轮的摘要,保障信息不会在压缩过程中损耗;最后,增设防抖机制,这样Hermes Agent就不会在压缩机制被触发后立即执行压缩,避免短时间反复压缩。此外,最新产生的若干条消息不进行任何处理。

5.调用AI模型时的稳定性

OpenClaw支持配置多个API Key,遭遇接口限速时会自动切换至下一密钥。平台同时支持提示词缓存功能,可自动识别并标记可缓存内容,以此有效降低调用成本。

Hermes Agent搭载多Key池,提供4种调度策略可供选择——耗尽切换、轮换、随机选取、余量优先调用,相较于单纯的顺序切换更为灵活。该系统同样支持提示词缓存,且具备更精细化的异常处理机制,针对接口限速、服务过载、上下文溢出、身份验证失败、模型不存在等各类异常,均设置了独立的恢复方案,不会一出现故障就统一切换备用密钥。

6.工具执行环境不同

两者都可以把整个agent部署在云服务器上。区别是工具和代码执行时在哪里运行。

OpenClaw只能在agent自身所在的机器上执行,可以用Docker做沙箱隔离。

Hermes Agent有6个可插拔的执行后端——本机、Docker、SSH远程机器、Daytona(空闲时会自动休眠,几乎零费用)、Modal(无服务器,支持GPU,用多少付多少)、Singularity(科研高性能计算集群)。agent大脑和执行环境完全分离,切换对AI透明。

1.5.3 关于技能

无论是OpenClaw还是Hermes Agent,均支持同一套开放标准的技能格式——一个技能就是一份Markdown说明文件,告诉AI如何执行。只要技采用通用工具(Shell命令、网络请求、Python脚本等),一次编写,即可双平台使用。

Hermes Agent共有两类技能。

内置技能(78个):随安装自动加载,覆盖AI/ML(Machine Learning,机器学习)训练与推理、软件开发、创意制作等核心方向,如表1-2所示。

可选技能(47个):不随安装自动加载,通过 hermes skills browse 查看,按需手动安装,覆盖区块链、生物信息、高级安全工具等进阶方向。

表1-2 Hermes内置技能

技能方向

代表技能

数量

AI/ML训练与推理

Axolotl/Unsloth/TRL(模型微调)

vLLM/llama.cpp/GGUF(本地推理)

Whisper(语音识别)

Stable Diffusion(图像生成)

AudioCraft(音频生成)

Segment Anything(图像分割)

Lm Evaluation Harness(模型评测)

Weights & Biases(实验追踪)

Modal(云端运行)

22

创意制作

Architecture Diagram(架构图)

ASCII Art(艺术)

Manim Video(数学动画)

p5.js(创意编程)

Excalidraw(手绘图)

Songwriting (歌词创作)

9

软件开发

任务规划、系统调试、测试驱动开发、子agent并行开发、代码审查辅助(Code Review Assistance)

6

GitHub

PR工作流、Issues管理、代码审查、仓库分析

6

研究工具

arXiv论文搜索、学术博客监控、大语言模型知识库(Wiki)、论文写作辅助

5

文档与数据

PDF处理、OCR识别、PPT处理、Jupyter 实时内核执行

4

自主Agent

调用OpenCode等AI编程助手驱动复杂工作流

4

其他

MCP服务器接入、Webhook集成、邮件客户端(Himalaya)、安全红队(GodMode)

5

说明

Lm-Evaluation-Harness:EleutherAI开发的行业标准LLM评测框架,用于量化比较模型能力,支持MMLU、HumanEval、GSM8K、HellaSwag等60多个学术基准测试,HuggingFace和各大AI实验室均使用这套评测体系。

1.5.4 如何安装Hermes Agent

Hermes Agent支持Linux服务器和Windows(WSL2)两种环境,在这两者上的安装步骤一致。Windows 用户需先安装好 WSL2,Linux 服务器用户可以跳过此步骤,直接进入下一步。

所需条件:一台Linux服务器或安装了WSL2的Windows计算机,一个飞书自建应用的App ID和App Secret,以及至少一个国内大模型的API Key(本书以DeepSeek为例)。

Windows 用户前置任务:安装 WSL2

如果你用的是Windows系统,需要先装WSL2(Windows内置的Linux子系统),安装完成后的操作步骤和在Linux服务器上安装时相同。

首先,以管理员身份打开PowerShell,运行:

wsl –install

这条命令会自动安装 WSL2 并下载 Ubuntu,并在完成后重启电脑。

重启电脑后,Ubuntu会自动启动,按提示设置Linux用户名和密码(和Windows账户无关,随意起)。

随后,打开“Windows Terminal”或在开始菜单搜索“Ubuntu”,进入Linux终端,后续所有步骤都在这里操作。

WSL2 需要Windows 10 2004及以上版本(内部版本19041及以上),或Windows 11系统。若执行wsl --install命令出现报错,可先进入系统设置的更新页面,将系统升级至最新版本后重试。

第一步:确认 Python 版本

在终端里检查 Python 版本:

python3 --version

Python需要为 3.11 或更新的版本,若版本不够高,需要进行升级(以下命令只适用于Ubuntu和Debian系统):

sudo apt update && sudo apt install python3.12 python3.12-venv -y

第二步:新建专用用户

在Linux服务器上部署Hermes Agent,建议单独新建用户,以与其他内容隔离。若是部署在WSL2 环境使用,则可以跳过该步骤。

sudo useradd -m -s /bin/bash hermes
sudo passwd hermes
sudo su - hermes    # 切换到Hermes用户,后续操作都在这里

第三步:克隆代码

git clone https://github.com/NousResearch/hermes-agent.git
cd hermes-agent

第四步:安装uv包管理器

uv是官方推荐的Python包管理工具,用uv安装,速度比用pip安装快很多:

curl -LsSf https://astral.sh/uv/install.sh | sh
source $HOME/.local/bin/env    # 让 uv 命令立即生效(或重新开一个终端)

验证安装成功:

uv --version

第五步:创建虚拟环境并安装依赖

DeepSeek、GLM、通义千问、Kimi 等国内模型均使用OpenAI兼容协议,相关库已包含在基础依赖里,只需额外安装飞书和 Web 模块:

uv venv .venv --python python3.12
source .venv/bin/activate
uv pip install -e “.[feishu,web]”

命令行最前面出现 (.venv) 说明虚拟环境已激活,安装大约需要 1~3 分钟。

如需使用AWS Bedrock,安装时将“.[feishu,web]”改为“.[feishu,web,bedrock]”。

第六步:写配置文件

创建配置目录:

mkdir -p ~/.hermes

创建主配置文件cli-config.yaml(以DeepSeek为例,其他模型改法见“常见问题”部分):

cat > ~/.hermes/cli-config.yaml << ‘EOF’
model:
  provider: deepseek
  default: deepseek-chat
EOF

创建密钥文件 .env,填入API Key和飞书凭证:

cat > ~/.hermes/.env << ‘EOF’
# 模型API Key(以DeepSeek为例)
DEEPSEEK_API_KEY=sk-你的DeepSeekKey
 
# 飞书
FEISHU_APP_ID=cli_你的AppID
FEISHU_APP_SECRET=你的AppSecret
FEISHU_CONNECTION_MODE=websocket
FEISHU_DOMAIN=feishu
 
# 访问控制(测试完后改为指定用户)
GATEWAY_ALLOW_ALL_USERS=true
EOF

用文本编辑器把占位符改成真实Key:

nano ~/.hermes/.env    # 编辑完按Ctrl+X → Y → 回车键保存

DeepSeek API Key申请地址:https://platform.deepseek.com/api_keys。

第七步:配置飞书应用

(1)访问飞书开放平台(open.feishu.cn),登录企业开发者账号,进入已创建的自建应用后台。

(2)找到并点击“添加应用能力”,在能力列表中选择“机器人”。

(3)进入“权限管理”页面,在权限搜索框检索“接收消息”,找到消息接收相关权限,完成权限申请与企业内审批开通。

(4)进入“版本管理与发布”页面,新建应用版本,完善版本信息后提交;选择企业内发布,等待审核通过,应用正式上线后,相关配置才能正常生效。Hermes Agent使用WebSocket长连接主动连飞书,不需要公网域名,也不需要配置回调地址,WSL2和内网服务器均适用。

第八步:启动

hermes gateway run

看到“WebSocket connected”,说明已连上飞书,去给 Bot 发条消息试试。

第九步:后台常驻运行

直接启动Hermes Agent,它会随终端窗口关闭而终止,可通过以下命令实现后台稳定运行:

nohup hermes gateway run > ~/hermes.log 2>&1 &
echo $! > ~/hermes.pid

查看日志:

tail -f ~/hermes.log

停止运行:

kill $(cat ~/hermes.pid)

注意:关闭Windows或所有WSL2 终端后,进程会停止。如需设置Windows重启后自动恢复,可在Windows任务计划程序里添加一条开机启动脚本:wsl -d Ubuntu -- bash -c “nohup hermes gateway run > ~/hermes.log 2>&1 &”。

Hermes常用命令如表1-2所示。

表1-2 Hermes常用命令

命令

作用

hermes gateway run

启动网关(连接飞书等平台)

hermes skills list

查看已安装的技能

hermes skills browse

浏览所有可安装技能

hermes skills install <名称>

安装指定技能

hermes claw migrate

从OpenClaw迁移配置、记忆、技能

tail -f ~/hermes.log

查看运行日志

常见问题

1.飞书消息无响应

依次检查3项配置:①.env 文件内的App ID、App Secret是否准确;②环境变量中是否配置了FEISHU_CONNECTION_MODE=websocket;③飞书应用是否已完成企业内发布,且正常开通“接收消息”权限。

2.报错:No module named xxx

确认已进入项目虚拟环境,命令行前需显示“(.venv)”;若未激活,执行以下命令:

source ~/hermes-agent/.venv/bin/activate

3.找不到hermes命令

可先激活虚拟环境,或使用完整路径直接调用程序:

python -m hermes_cli.main gateway run

4.想换成GLM-5

Hermes Agent原生适配GLM-5。修改 cli-config.yaml 配置:

model:
  provider: zai
  default: glm-5.1

.env替换为:

GLM_API_KEY=你的GLMKey

GLM API Key申请地址:https://bigmodel.cn/usercenter/apikeys。注册即可免费领取额度。

5.想换成通义千问(Qwen)

Hermes Agent原生适配通义千问的DashScope系列模型。修改 cli-config.yaml 配置:

model:
  provider: alibaba
  default: qwen3.5-plus

.env替换为:

DASHSCOPE_API_KEY=你的DashScopeKey

DashScope API Key申请地址:https://dashscope.console.aliyun.com/。

6.想换成Kimi

Hermes Agent原生适配Kimi。修改 cli-config.yaml 配置:

model:
  provider: kimi-for-coding
  default: kimi-k2.5

.env替换为:

KIMI_API_KEY=你的KimiKey

Kimi API Key申请地址:https://platform.moonshot.cn/。

7.想换成国内其他模型

Hermes Agent支持所有兼容OpenAI接口规范的大模型,国内主流模型(如百度文心、MiniMax、零一万物、讯飞星火等)基本提供OpenAI兼容接口。它们的通用接入方式如下。

第一步:去对应模型官网注册并申请API Key,找到其“OpenAI兼容”或“API文档”页面,记录接口地址(Base URL)和API Key。

第二步:修改cli-config.yaml,将模型提供商设置为 custom,在default后面填入模型名称。

model:
  provider: custom
  default: 模型名称(按官网填写,如ernie-4.5-turbo-128k)
  base_url: https://官方提供的OpenAI兼容接口地址/v1

第三步:向.env中添加API Key(变量名可自定义,也可直接用OPENAI_API_KEY)。

OPENAI_API_KEY = 你的APIKey

判断模型是否支持OpenAI兼容接口,可查看官网文档里有没有“OpenAI兼容”或“Chat Completions API”字样,如果有,按上述方式填入base_url即可接入。

1.6 驾驭工程

1.6.1 驾驭工程是什么

驾驭工程(Harness Engineering)是2026年兴起的AI工程新范式,核心思想是:让AI Agent在真实业务环境中可靠工作,关键不在于选择哪个模型,而在于给模型构建怎样的工作环境。

这个概念于2026年第一季度被Anthropic和OpenAI在工程交流中正式采用,随后迅速成为AI工程领域的主流话语体系。

1.马丁·福勒的定义

马丁·福勒(Martin Fowler,《重构:改善既有代码的设计》的作者)在2026年4月2日发表的文章中给出了清晰的定义:

agent (智能体) = model (模型) + harness (驾驭层)

harness就是你为模型搭建的一切工作环境:工具接口、上下文管理、反馈回路、记忆系统、权限控制、子agent协作等。

2.将驾驭工程类比为操作系统

2026年初,AI工程师菲利普·施密特(Philipp Schmid)提出了一个广为引用的类比,如表1-3所示,清晰地描述了驾驭工程在整个系统中的位置。

表1-3 将驾驭工程类比为操作系统

层级

对应技术概念

类比

模型(model)

LLM本身

CPU(计算核心)

上下文窗口(context window)

当前对话历史与输入

RAM(内存)

驾驭层(harness)

包含工具、规则、反馈、记忆等在内的整个环境

操作系统(OS)

智能体应用(agent)

最终的AI产品

应用程序(App)

只有模型而没有驾驭工程,就像有CPU(Central Processing Unit,中央处理单元)却没有操作系统。扩大上下文窗口,只是增加了“内存”,没有操作系统,计算机还是不能运行。

1.6.2 AI工程的发展阶段

Cobus Greyling在2026年3月的分析文章中,把AI工程的发展梳理为3个阶段,如表1-4所示。

表1-4 AI工程的发展阶段

阶段

时间

核心工作

局限性

提示词工程

(Prompt Engineering)

2023—2024年

优化提示词,使模型回答得更准确

治标不治本,模型行为不稳定

上下文工程

(Context Engineering)

2025年

对送入模型的上下文内容进行管控

只管输入,不管执行环境

驾驭工程

2026年至今

构建模型工作的整套运行环境

随着模型能力快速提升,各模型在静态基准测试上的差距正在缩小,在运行环境上的差距却在扩大。到2026年,选对驾驭工程比选对模型更重要。从“跟AI说话”到“给AI搭台子”——工程师的核心职责发生了根本性转变。

1.6.3 驾驭工程的构成框架

Birgitta Boeckeler(Thoughtworks工程师)在Martin Fowler的网站上发表了一篇文章,为驾驭工程搭建了较为完整的构成框架,如表1-5所示。

表1-5 驾驭工程的构成框架

构成要素

说明

典型实现

工具编排

(tool orchestration)

为AI提供能够操作的工具接口,包括文件读写、命令执行、网络搜索、API调用等接口,通过MCP(Model Context Pro tocol,模型上下文协议)等标准协议接入。工具越精简越好,避免选择混乱

MCP、shell工具、文件读写

上下文管理

(context curation)

长会话把工作进度保存在JSON文件或Git历史里,新会话会读取这些文件,并在几秒内重建上下文

进度文件、Git历史、会话检索

权限模型

(permission model)

默认为只读,写入操作需要明确授权或遵循预先声明的许可规则,防止AI越权操作

权限声明文件、操作白名单

钩子机制

(hooks)

在AI执行任务时或完成任务后,自动触发测试、代码扫描、格式校验等检查脚本,提前拦截问题代码,避免错误合入代码库

测试套件、Linter、格式化工具、CI(持续集成)流水线

子agent协作

(sub-agents)

为特定任务分配专属agent(有独立的上下文窗口),负责研究、测试、代码审查等,防止主agent上下文过载

多agent并行、agent互审机制

沙箱与快照

(sandbox & snapshots)

每次变更都在隔离环境中执行,结果可回滚,错误不影响生产状态

Docker容器、Git worktree、快照机制

1.6.4 两大控制机制

Martin Fowler把驾驭工程的工作方式归纳为两大控制机制,这正是驾驭工程核心的实操框架。

1.guides(引导机制)——事前控制

在AI开始工作之前,通过文件、规范、架构文档提前告诉AI该怎么做、不该怎么做。目标是让AI一次做对,减少返工次数。

guides可以分为以下两类。

(1)计算型guides:提供确定性规则,如代码格式规范、模块边界定义、类型检查配置。采用这类guides引导AI,AI运行快速、结果可靠。

(2)推断型guides:提供语义层面的引导,如AGENTS.md行为准则、架构决策文档、技能说明文件,需要AI理解和遵守。

OpenAI在实践中总结了一个重要教训:AGENTS.md不应该是“百科全书”,而应该是“目录索引”。一个约100行的AGENTS.md,指向代码库里各模块的详细文档,效果远好于把所有规则塞进一个文件。文件太长、规则太多,AI反而无法区分哪些真正重要。

2.sensors(传感器机制)——事后控制

AI完成工作后,自动触发检测,发现问题并引导自我修正,尽量在错误到达人工审查环节之前就将其处理掉。

sensors同样分为两类。

(1)计算型sensors:如测试、静态分析、Linter、类型检查等,快速可靠,发生任何变更都能运行。

(2)推断型sensors:AI代码审查、“LLM作为判官”的语义校验,价格更高,运行速度更慢,但能处理需要语义理解的问题。

关键设计原则:传感器机制的报错信息要写成AI能直接读懂,并基于此自主修复的格式——不是给人看的错误提示,而是直接包含修复指引的结构化信息,让AI阅读之后就能知道下一步该如何修改。

3.两大机制缺一不可

guides 与sensors 是驾驭工程的核心双机制,二者相辅相成、缺一不可。

如果仅有guides,缺少sensors约束,AI会依照规则和引导操作,但无法主动判断产出质量。各类隐性缺陷无法被及时发现,长期累积,容易引发系统性问题。

反之,只依靠sensors,缺少guides,AI 会缺少明确的行为边界与创作规范,极易频繁触发各类错误检测,需要反复纠错,浪费大量算力和时间,降低整体生产效率。

唯有两种机制协同配合,才能构建完整的闭环:依靠guides从源头正向引导,规范 AI 的创作逻辑与行为标准,减少问题产生;再通过sensors全流程动态检测,及时识别不合规内容与潜在缺陷。

4.驾驭工程的保护目标

Boeckeler把驾驭工程的保护目标分为3个层次,如表1-6所示。

表1-6 驾驭工程的保护目标分为3个层次

层次

具体保护目标

成熟度

可维护性

(Maintainability Harness)目标

代码质量、模块结构、测试覆盖率、风格规范

最成熟,工具链完备

架构适应性

(Architecture Fitness Harness)目标

运行时行为、性能指标、非功能性需求(如响应时间)

较成熟

行为正确性

(Behaviour Harness)目标

功能逻辑是否符合用户实际需求

尚处发展阶段,不够成熟

1.6.5 OpenAI实战案例(2026年2月)

OpenAI在博客文章Harness Engineering: Leveraging Codex in An Agent-first World中公开了一个完整的驾驭工程实战案例。

1.实验基本信息和结果

团队规模:初始配置3名工程师,项目后期团队规模拓展至7人。

项目周期:5个月。

代码量:约100万行,全面覆盖应用业务逻辑、底层基础设施、自研工具链及配套文档等全部内容。

迭代频次:累计合并PR(Pull Request,拉取请求)约1500个,人均日产出 3.5 个 PR,迭代节奏快。

研发模式:全程由Codex Agent 独立完成内容编写,零人工手写代码。

效率提升:整体研发效率约为传统人工开发模式的10倍。

落地验证:项目上线后,已支撑数百名内部用户常态化使用,经历业务部署、bug提交与迭代,落地效果得到实际场景验证。

2.最关键的发现

项目早期进展缓慢,不是因为Codex自身能力不足,而是工作环境尚未完善。AI欠缺完成高阶目标所需的工具、抽象体系与内部架构。工程师的主要工作转变为搭建适配AI高效作业的基础条件。

每次出现新问题,解决方案几乎从不是“让AI更努力地尝试”,而是精准定位缺失的关键能力,并将其转化为AI能够理解且可强制执行的规则。

3.驾驭工程的具体设计

OpenAI团队搭建的驾驭工程包含以下关键元素。

知识结构:以约100行的AGENTS.md作为总目录,具体规范统一收录在结构化的 docs/目录里,并按模块划分,由AI按需检索调用。

可观测性接入:将应用日志、性能指标、调用链路全面接入Codex,支持AI通过LogQL查询日志、借助PromQL读取指标数据。

浏览器控制:在agent运行时集成Chrome DevTools Protocol,使AI可直接操作页面界面、截取画面、复现bug、验证修复效果。

任务隔离:各项任务均在独立Git worktree中执行,配置专属应用实例与可观测性组件,任务结束后自动销毁资源。

agent 互审:代码编写完成后,由其他Codex Agent交叉评审,全部agent审核通过后方可合并代码,人工评审调整为可选环节。

单次Codex任务最长可连续运行超过6小时,通常在工程师休息时独立完成工作。

1.6.6 Anthropic实验数据

Anthropic于2025年11月至2026年3月间发表了两份详细的研究报告,提供了最有说服力的量化数据。

1.双agent架构(2025年11月)

双agent结构由Justin Young设计:初始化agent建负责创建Git仓库、进度记录文件及200余项功能清单;编码agent按条目逐一落地实现。每次开启新会话时,系统自动读取进度文件,短时间内即可快速还原工作状态。

2.三agent架构(2026年3月)

三agent模式由Prithvi Rajasekaran设计:规划agent负责把简短的需求扩展为详细的产品规格;生成agent逐步实现产品;评估agent用Playwright实现自动化测试,并按Sprint合同为产品打分。

3.核心结论

同一个模型,只对工作环境进行修改,原本无法完成的任务便得以完成。两个研究均未通过单一数字量化提升幅度,但都通过可运行的实验验证了驾驭工程设计对任务完成质量有决定性影响。

基准测试数据:Anthropic在Terminal-Bench 2.0上测试时发现,仅调整运行环境的资源配置(不更换模型、不修改驾驭规则),最严格和最宽松配置之间的成功率相差6个百分点(p<0.01),而这一差距已超过很多模型间的榜单差距,足以说明运行环境的质量能极大地影响模型表现。

1.6.7 驾驭工程与OpenClaw的关系

OpenClaw本质上是一个为普通用户打包好的驾驭工程框架,用户不需要自己研究如何搭建工作环境,开箱即用。OpenClaw组件与驾驭工程各层级的对应关系如表1-7所示。

表1-7 OpenClaw组件与驾驭工程各层级的对应关系

OpenClaw组件

驾驭工程对应层级

具体作用

SOUL.md

guides(推断型)

行为准则,告诉AI该做什么、不该做什么

AGENTS.md

guides(推断型)

任务规范,项目架构说明,相当于目录索引

技能文件

guides(推断型)

具体任务操作指南,按需加载

MEMORY.md

上下文管理

让AI每次工作都有记忆支撑,跨会话保持连贯

多agent角色边界

权限模型

使每个agent职责清晰,各司其职,防止越权

memory_search验证

sensors(推断型)

完成任务后自动校验,触发记忆更新

1.6.8 驾驭工程与Hermes Agent的关系

Hermes Agent在设计上更贴近驾驭工程的工程哲学,其多个组件直接对应驾驭工程的核心概念。Hermes Agent组件与驾驭工程各层级的对应关系如表1-8所示。

表1-8 Hermes Agent组件与驾驭工程各层级的对应关系

Hermes Agent组件

驾驭工程对应层级

具体作用

技能系统

guides(推断型)

技能文件即引导规范,任务完成后,AI会自动沉淀新技能,使驾驭工程也能持续进化

lm-evaluation-harness技能

sensors(计算型)

量化评测AI输出质量,基于60余项 EleutherAI 学术基准测试开展行业标准级验证

多agent互审机制

sensors(推断型)

一个agent编写,另一个agent审校,程序员只做最终架构决策

三重上下文压缩(预剪枝→迭代摘要→防抖)

熵增管理

对抗工作环境随时间劣化的情况,相当于自动“清洁工”

SQLite + FTS5跨会话检索

上下文管理

所有历史对话自动入库,支持全文检索,让AI真正有记忆

6个执行后端(local、docker、ssh、modal等)

沙箱与隔离

任务在独立环境执行,切换对AI透明

多key轮换池

健壮性保障

单点故障自动切换,保持工作环境持续可用

Hermes Agent最符合驾驭工程理念的一点在于:其技能系统是“活”的。每次完成复杂任务,AI会判断是否值得把这个过程沉淀为新技能——这相当于工程师在“steering loop”里持续优化驾驭工程本身。

1.6.9 小结

驾驭工程代表了AI工程从“跟AI说话”到“给AI搭台子”的根本性转变:工程师的核心职责不再是直接写代码,而是构建一套让AI能够可靠、持续工作的环境。

本节得出的核心结论可以归纳为以下3点。

(1)环境比模型更重要。同一个模型,配置不同的驾驭工程,原本无法完成的任务或许就可以顺利完成了。此外,运行环境对AI执行效果的影响正在超过模型本身的影响——换更好的模型,不如先把驾驭工程搭好。

(2)项目早期进展偏慢是正常现象。在驾驭工程体系尚未搭建完善时,推进效率偏低并非AI能力的问题,而是因为工作环境尚不完整。随着驾驭工程体系的持续完善,整体推进速度会显著提升,且呈指数级增长。

(3)人的职责是“驾驭”而不是“执行”。工程师负责工作环境搭建、规则定义与架构层面的关键决策,AI 则负责在该工作环境中完成所有具体执行类任务。

1.7 别的AI功能固定,小龙虾可以无限装技能

你买了一部新手机,出厂的时候手机上预装了一些App,如计算器、备忘录、地图。但你用手机不只是用这些App,你会自己去App Store下载你需要的App:音乐、外卖、打车、办公软件……

手机的价值,很大程度上来自你可以无限地往里面装功能(App)。

小龙虾是同样的逻辑。

它有一套基础能力:聊天、搜索、写作、代码……但远不止这些。很多技能市场,例如ClawHub、EasyClaw Link这些有信誉的平台,提供了全球用户贡献的各种技能包,可按需安装。

飞书文档自动生成?给小龙虾装一个技能。PPT一键生成?给小龙虾装一个技能。漫画自动转短剧视频?给小龙虾装一个技能。股票数据分析?给小龙虾装一个技能。

每装一个技能(skill),小龙虾就多了一种能力。没有你用不到的技能 ,只有你还没装的技能。技能市场示意如图1-4所示。

图1-4 技能市场示意

而且,技能不是一成不变的。你可以修改已有技能的行为规则,也可以从零创建专属于你的技能。如果你的公司有特定的业务流程、特定的数据格式、特定的操作规范,你都可以把这些写成小龙虾的技能,让它按你公司的方式工作,而不是按一个通用AI的默认方式工作。

这正是小龙虾功能的可扩展性所在。普通的AI产品,功能由厂商决定,你能做的只有等待更新功能。小龙虾的功能,你可以自己决定,你需要什么,就给它装什么技能。

1.8 数据安全这件事,你需要想清楚

这一节,我想如实地说明一个重要问题——安全。

首先,有一件事你需要知道:小龙虾背后也有大语言模型,你跟小龙虾的对话内容,会经过你选择的模型服务商(如Anthropic、OpenAI、火山引擎AWS、阿里云)的服务器。

这一点和其他AI产品没有本质区别。你用GPT,内容会经过OpenAI处理;你用小龙虾,内容会经过你选择的模型服务商处理。

那小龙虾在数据安全上的优势到底是什么?

第一,你自己选择用哪家大模型服务商。你可以根据自己对数据安全的要求来选择大模型服务商。比如有企业级数据保护协议(明确约定不将数据用于训练、不存储对话内容)的服务商,就比免费的AI服务安全得多。

第二,你的会话记录、文件、个人设定,存在你自己的服务器上。 OpenClaw是自托管的——你把它部署在哪里,这些数据就存在哪里。没有一个第三方平台能看到你的历史记录、知道你的工作习惯、分析你使用的数据。这和用豆包、Kimi这类SaaS(Software as a Service,软件即服务)产品有本质区别:用那些产品,你的所有历史记录都在那些产品的平台上。

第三,你可以选择本地模型。如果你对数据安全要求极高,可以配置小龙虾使用完全在本地运行的开源模型,对话内容完全保存在你自己的本地服务器。这对大多数普通用户来说不是必须的,但企业用户处理极敏感信息时,这是必须的。

用一句话来总结:小龙虾不能保证对话内容绝对不经过任何服务器,但它给了你选择权和控制权——你的历史数据在自己手里,你可以选有保障的大模型服务商,也可以完全本地化。小龙虾和SaaS AI的数据流向示意如图1-5所示。

图1-5 数据流向示意

1.9 一张表看清楚:普通AI和小龙虾的对比

说了这么多,我们来做个总结。

下面通过表1-9对比普通AI和小龙虾。

表1-9 普通AI和小龙虾的对比

区别

普通AI

小龙虾(OpenClaw)

在哪里用

需要专门的App/网站

直接在飞书、EasyClaw等工具里使用

能做什么

生成文字、图片、视频等内容

真实执行任务(发消息/操作文件/运行代码)

工作方式

等你来问,才给回应

可以主动发起任务,定时自动运行

能力范围

厂商预设,无法自定义

你可在技能市场ClawHub下载技能,按需扩展能力

会话记录存在哪里

AI厂商的平台服务器

你自己的服务器

数据控制权

平台说了算

你自己来选模型服务商,对话记录在自己手里

适合场景

临时提问、内容生成

长期工作流、自动化、企业级部署

表1-1中最重要的是“工作方式”这一行。普通AI是一个随时待命的顾问,你问它,它回答你;小龙虾是一个可以独立工作的助手,你交代好任务,它自己去做。

这个区别,决定了两种完全不同的使用体验。

1.10 动手安装:在Windows上部署你的小龙虾

为什么要安装小龙虾?

小龙虾并不是一个传统意义上的软件。它更像是一个运行在你自己计算机或云服务器里的AI助手。和那些打开网页就能使用的在线AI不同,小龙虾是“住在你设备上的”。它的运行环境、配置方式,甚至一部分数据,都是由你自己掌控的。这也是它与大多数AI产品之间最重要的区别之一。

安装小龙虾对新手来说可能是使用小龙虾的第一道门槛,所以我提供了比较详细的安装教程。整个安装过程不需要任何编程基础,只要按步骤复制、粘贴命令即可。

在 Windows 上安装小龙虾,总共分3个阶段:先装一个 Linux 小系统(WSL2),再装运行小龙虾所需的底层工具(Node.js),最后装小龙虾本体。看起来步骤不少,但每一步都很明确,照着教程做就行。

第一步:安装WSL2

WSL2 是 Windows 10(2020年5月更新版本及以上)和 Windows 11 的官方内置功能,默认未启用,需要手动安装。这是微软自己提供的工具,不需要去第三方网站下载,安全可靠。它可以让你在Windows里运行一个真正的Linux环境。用通俗的话来讲,你可以把它理解为:在Windows这间“大屋子”里,搭了一顶Linux的“小帐篷”——帐篷是Linux的“地盘”,小龙虾就住在“帐篷”里工作,Windows 和 Linux 之间也可以互相传文件。

注,安装全过程可参考微软官方文档https://learn.microsoft.com/zh-cn/windows/wsl/install。

(1)在键盘上按Win键(键盘左下角的Windows徽标键),在搜索框中输入“PowerShell”,在搜索结果中找到“Windows PowerShell”,如图1-6所示,右键单击此结果,在弹出的菜单中选择“以管理员身份运行”,此时会弹出一个名为PowerShell的窗口。

图1-6 Windows PowerShell

(2)在PowerShell窗口中输入以下命令(见图1-7),然后按回车键。

wsl --install -d Ubuntu

图1-7 在窗口中输入命令

该命令会自动开启WSL2功能,并安装Ubuntu(一种广泛使用的Linux系统)。

(3)安装完Ubuntu后,系统会提示重启计算机。请重启,这一步是必需的。

(4)重启计算机之后,系统会自动弹出一个黑色窗口,提示设置Linux的用户名和密码。设置一个英文用户名(如名字的拼音),再设置一个密码即可。注意:输入密码时,屏幕上不会显示任何字符,这是正常现象,并非计算机卡顿,输入完成后按回车键确认。至此,Ubuntu被安装完成。以后需要使用时,在开始菜单中搜索“Ubuntu”并单击带有“Ubuntu”的选项,如图1-8所示。

图1-8 搜索“Ubuntu”并单击带有“Ubuntu”的选项

第二步:安装Node.js

Node.js是小龙虾运行所需要的底层工具,就像汽车需要发动机才能启动一样,小龙虾需要Node.js才能运行,Node.js版本不低于22。在开始菜单中搜索“Ubuntu”并单击打开,在黑色窗口中依次输入3条命令,每行输入完毕后按回车键。首先输入以下命令,配置Node.js安装源。

curl -fsSL https://deb.nodesource.com/setup_22.x | sudo -E bash – 

这行命令做了两件事:第一,通过curl工具从Node.js官方地址下载安装配置文件;第二,以管理员权限(sudo)执行该配置文件,就像拿着官方授权书,委托“系统”去“仓库”领货。执行过程中,系统可能会要求输入密码,直接输入第一步中设置的密码即可,注意屏幕上是看不到密码的。然后输入以下命令,安装Node.js(见图1-9)。

sudo apt install nodejs -y

图1-9 安装Node.js

待命令执行完成后,输入以下命令确认安装结果(见图1-10)。

node –version

图1-10 确认安装结果

如果屏幕上显示“v22.x.x”或更高版本号(如v22.22.0),则说明安装成功。

第三步:安装小龙虾

Node.js安装完成后,接下来安装小龙虾应用程序。在Ubuntu窗口中输入以下命令(见图1-11)。

curl -fsSL https://openclaw.ai/install.sh | bash

图1-11 在Ubuntu窗口中输入命令

这是小龙虾官方提供的一键安装命令,它会自动下载并配置好所有必要内容。命令执行完成后,输入以下命令进行确认:

openclaw --version

如果屏幕上显示了版本号,则说明小龙虾已经安装成功。

第四步:首次配置

小龙虾安装完成后,需要进行一次初始配置——主要是告诉它使用哪个AI模型。在Ubuntu窗口中输入以下命令:

openclaw onboard --install-daemon

该命令会启动一个交互式配置向导,根据向导提示进行配置即可。配置完成后,向导会自动启动小龙虾的后台服务。这个后台服务名为Gateway(网关),相当于小龙虾的“大门”——只有大门开着,外部应用才能与小龙虾通信。

第五步:验证安装

在Ubuntu窗口中输入以下命令,检查Gateway是否正常运行:

openclaw gateway status

如果提示Gateway正在监听端口18789,则说明安装成功,Gateway正常运行。这里的“端口”可以理解为楼栋里的“房间号”——18789就是小龙虾所在的房间,Gateway说它在监听,意味着大门已开、可以接待访客。最后,输入以下命令,打开小龙虾的管理界面:

openclaw dashboard

执行该命令后,浏览器会自动打开小龙虾的管理界面。如果界面正常加载,即可开始与小龙虾对话。

提示

如果安装过程中出现报错,最常见的原因是网络访问受限(部分命令需要连接境外服务器)。如遇此情况,可尝试到网络环境较好的场所安装,或使用网络加速工具后再执行相关命令。

1.11 动手安装:在Mac计算机上部署你的小龙虾

第一步:打开终端

同时按下键盘上的Command键和空格键(或单击屏幕右上角的放大镜图标),在弹出的搜索框中输入“终端”或“Terminal”,然后按回车键,屏幕上会出现一个白色或黑色的窗口,这就是后续所有操作的工作台(窗口)。

第二步:安装Homebrew

在终端中输入以下命令,然后按回车键:

/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

这行命令来自Homebrew官方,你无须理解其含义,将它复制、粘贴到终端后直接执行即可,不要修改任何字符。安装过程中,系统可能会弹窗要求输入计算机开机密码,输入即可;输入密码时屏幕不会显示任何字符,这是正常现象。如果你的Mac计算机使用的是M系列芯片(M1、M2、M3、M4,2020年底及以后购买的Mac计算机采用的通常为此系列芯片),安装完成后终端会提示需要额外执行两行命令。这是因为M系列芯片的Homebrew安装路径与英特尔(Intel)芯片的不同,需要额外告知终端Homebrew的位置。依次输入以下两行命令:

echo ‘eval "$(/opt/homebrew/bin/brew shellenv)"’ >> ~/.zprofile
eval "$(/opt/homebrew/bin/brew shellenv)"

如果不确定自己的Mac计算机中是否有M系列芯片,可单击屏幕左上角的苹果图标,选择“关于本机”,查看“芯片”一栏的内容进行确认。安装完成后,输入以下命令进行验证:

brew --version

如果屏幕上显示了版本号,则说明Homebrew安装成功。如果此前已经安装过Homebrew,可跳过本步骤。

第三步:安装小龙虾

在Mac计算机上,可以通过Homebrew直接安装小龙虾。在终端中输入以下命令:

brew install --cask openclaw

安装完成后,输入以下命令进行验证:

openclaw --version

如果屏幕上显示了版本号,则说明小龙虾安装成功。

第四步:首次配置

与在Windows上安装小龙虾的流程相同,在Mac计算机上安装完小龙虾应用程序后,需要进行一次初始配置。在终端中输入以下命令:

openclaw onboard --install-daemon

第五步:验证安装

在终端中输入以下命令,检查后台服务是否正常运行:

openclaw gateway status

看到Gateway正在运行的提示后,输入以下命令打开小龙虾的管理界面:

openclaw dashboard

浏览器会自动打开小龙虾的管理界面。如果页面正常加载,即可开始使用小龙虾(见图1-12)。

图1-12 浏览器会自动打开小龙虾的管理界面

当然,OpenClaw提供的管理界面比较简单,用户可以连接飞书、微信等通信工具来使用小龙虾。

连接飞书只需前往飞书开放平台(https://open.feishu.cn)安装官方插件即可(见图1-13)。

关于微信,OpenClaw目前不支持个人微信且无官方接入渠道,如需使用微信,可考虑企业微信的第三方方案,但配置较为复杂。推荐新手直接使用飞书。

图1-13 飞书开放平台

1.12 把小龙虾装在云服务器上

前面两节介绍的是把小龙虾装在自己计算机上的方法。但有些情况下,你可能希望小龙虾不运行在本地,而是运行在一台云服务器上。你可以把云服务器理解为一台计算机,且不用你管理它的运行,而是云厂商负责帮你7×24小时地运行它。把小龙虾装在云服务器上有以下好处。

第一,本地计算机关机了,安装在该计算机上的小龙虾就停止运行了,但云服务器不会。安装在云服务器上的小龙虾可以做到7×24小时不间断运行。

第二,本地计算机长时间运行小龙虾会卡顿,甚至和系统操作冲突,这时候你就需要一台专属于自己的云服务器来运行小龙虾,不影响你使用本地计算机。

第三,数据存在云服务器上,能有效避免丢失。小龙虾的配置文件、会话记录存在云服务器上,本地设备丢失或损坏不影响小龙虾的运行和数据的存储。

如果你认为以上任何一条对你有价值,可以考虑将小龙虾部署在云服务器上,部署方法如下。

第一步:购买并登录云服务器

好消息是:在云服务器上安装小龙虾的步骤与1.8节和1.9节描述的基本一致。云服务器通常运行Linux系统,相当于你已经有了一个“装好的Ubuntu”,省去了1.8节中安装WSL2的环节。整个流程如下。

在任意云服务商(阿里云、腾讯云、华为云等)购买一台云服务器。云服务器硬件配置建议:2核的CPU、4GB的内存、20GB的硬盘。这是小龙虾稳定运行的基本条件。购买完成后,通过SSH(Secure Shell,安全外壳)登录服务器,你会看到一个和Ubuntu窗口一样的命令行界面。

什么是SSH?你可以把它理解为一条加密的“远程遥控线”,借助这条线,你就能在自己的计算机上操作远在机房里的那台服务器,就好像那台服务器正摆在你面前一样。Windows用户可以用系统自带的PowerShell或免费工具PuTTY发起SSH连接;Mac计算机用户直接在终端中输入命令ssh即可连接服务器。

第二步:安装Node.js和小龙虾

登录服务器后,按照1.8节中的第二步和第三步进行操作。云服务器的Linux环境与WSL2的Ubuntu环境完全兼容。

第三步:配置与验证

同1.8节第四步和第五步,进行初始配置并验证Gateway是否正常运行。

唯一需要注意的是:云服务器上的小龙虾管理界面不能直接通过浏览器打开,你需要在浏览器地址栏手动输入服务器的公网IP加端口号(格式为:服务器公网IP:18789)来访问小龙虾的管理界面。公网IP可以在云服务商的控制台中查看。此外,还需要在云服务商的防火墙(安全组)设置中,开放18789端口的入站访问权限,否则浏览器将无法连接到小龙虾的管理界面。

提示

云服务器按使用时长计费,你记得关注自己使用云服务器的账单。如果你只是临时体验一下小龙虾的功能,用完可以停止服务器实例,停止后通常只收取存储费用,不再计算运行费用。具体计费规则请参考所选云服务商的官方说明。

1.13 零门槛上手:不想碰命令行,直接用这3个平台

如果你觉得前面几节讲的安装小龙虾的方式还是太麻烦,或者对接入大模型的步骤感到困惑,可以选择下面介绍的平台。它们是目前真正意义上对普通新手用户友好的小龙虾使用方式——不需要碰命令行,不需要自己购买和管理服务器,大模型配置也已内置好,按平台引导操作即可使用小龙虾。

下面推荐3个平台,按使用门槛由低到略高排列,你可以根据自身需求选择。

1.EasyClaw(easyclaw.com)——简单,下载即用

EasyClaw提供Windows和macOS双平台的桌面安装包。从官网下载安装包,双击运行安装包,按照安装向导完成配置,小龙虾即在本地运行,安装全程不需要接触任何命令行。也可以租用云服务器,没有复杂配置。EasyClaw支持飞书、WhatsApp、Telegram、Discord等主流通讯工具接入。

2.MyClaw.ai——纯云托管,浏览器里直接用小龙虾

MyClaw.ai是一个完全托管的小龙虾服务平台。注册账号后,在浏览器中即可直接使用小龙虾,无须在本地安装任何软件,也不需要购买服务器或配置Docker(一种应用容器化工具)。用户按月付费,可随时取消订阅。MyClaw.ai适合不希望在自己计算机上安装任何东西、需要随时随地访问小龙虾的用户。

3.腾讯云——价格较低,有少量操作步骤

腾讯云轻量应用服务器(Lighthouse)提供OpenClaw一键部署模板。在腾讯云控制台选择该模板,系统会自动创建服务器并完成小龙虾的安装与配置。部署前需要注册腾讯云账号并绑定支付方式,并进行少量的控制台操作。与前两个平台相比,用腾讯云部署小龙虾操作步骤略多,但小龙虾运行在用户独立的云服务器上,灵活性和可控性更高。这种方式适合有一定动手能力、希望以较低成本获得云端部署效果的用户。

1.14 给小龙虾接上大脑:配置大语言模型

小龙虾安装完成后,它还不能立刻“开口说话”,因为它自己并不会“思考”,需要外接一个大语言模型作为大脑,才能真正理解你说的话、执行你交代的任务。

可以把小龙虾和大模型的关系想象成:小龙虾是一个能干的助手,负责执行任务、记住你的偏好、连接各种工具;大模型是这个助手的大脑,负责理解语言、做出判断、给予回应。没有大脑,助手就是一具空壳;接上大脑,助手才能真正工作。

本节以DeepSeek大模型为例,演示如何完成接入。DeepSeek是目前国内使用最广泛的大模型之一,性能出色,价格实惠,且对中文支持良好,适合初次尝试小龙虾时使用。

1.14.1 获取DeepSeek的API密钥

API密钥(API Key)是大模型服务商颁发的一串字符,相当于你调用大模型能力的“通行证”。小龙虾每次请求大模型“回答”问题时,都会出示这串密钥,大模型服务商验证通过后才会响应小龙虾的请求。

获取API Key的步骤如下:打开DeepSeek官网,注册并登录账号;进入控制台,找到“API密钥”页面,单击“创建API密钥”;将密钥复制并保存到本地,因为它只会完整显示一次,之后无法再查看。

提示

API密钥是私密凭证,相当于账户密码,不要将其分享给他人或提交到公开代码仓库,否则他人可以用你的“配额”消费。

1.14.2 在小龙虾管理界面填入API密钥

打开小龙虾管理界面(在本地安装的小龙虾,用浏览器访问localhost:18789;在云服务器安装的小龙虾,访问“服务器公网IP:18789”),进入模型配置页面,找到大模型配置项,按如下信息填写。

提供商(Provider):DeepSeek。

模型名称(Model):deepseek-chat。

API密钥(API Key):粘贴你保存的API密钥。

填写完成后单击“保存”按钮,小龙虾会自动发送一个测试请求,用以验证连接是否成功。若提示“连接成功”,即表示小龙虾已正确接入大模型,小龙虾的“大脑”已就位。

1.14.3 大模型的费用说明

用户使用DeepSeek,按实际用量计费,单位是token(可以理解为文本量,一千个汉字约等于一千至两千个token,其标准中文译名为“词元”)。DeepSeek平台新注册用户一般会获得赠送的免费额度,可以先用免费额度体验。

如果你希望使用其他大模型,小龙虾同样支持接入ChatGPT(OpenAI发布的大模型)、Claude(Anthropic发布的大模型)、Gemini(Google发布的大模型)等主流模型,配置方式与DeepSeek相同,只需更换对应的提供商名称、模型名称和API密钥即可。

1.14.4 给小龙虾配置生图/生视频模型

需要注意的是,大语言模型无法生图/生视频。如果你是多媒体创作者,可能需要为小龙虾接入多模态模型。你可以选用火山引擎的Seedream生图模型和Seedance生视频模型,完整配置和使用方法如下。

首先,在火山引擎官网volcengine.com注册账号并完成实名认证,登录后进入火山方舟,在模型广场找到并开通Seedream和Seedance相关服务。然后,在控制台右上角的账号菜单中单击“API访问密钥”,新建并复制你的AccessKeyID和AccessKeySecret,同时确保账号有可用余额或免费试用额度。回到小龙虾模型配置界面,在生图模型配置项中填写如下信息:提供商为“火山引擎”;模型名称填写Seedream及对应版本编号;API密钥处按格式填入AccessKeyID|AccessKeySecret,用竖线分隔两组密钥。填写完成后单击“保存”按钮,小龙虾会自动发起图片生成测试,提示连接成功,即表示生图模型配置完成。生视频模型的配置方式相同,提供商为“火山引擎”,模型名称填写Seedance及对应版本编号,API 密钥同样使用 AccessKeyID|AccessKeySecret,保存后完成验证即可使用。你日常使用时,可直接向小龙虾发送生图或生视频指令,例如“生成一张城市夜景插画”“将这张图片转为动态短视频”,小龙虾会通过火山引擎的Seedream和Seedance完成任务并返回结果。火山引擎按实际生成量计费,新用户一般有免费额度,个人日常使用成本较低。如果连接失败,可检查密钥是否正确、模型服务是否开通、账号是否有可用额度,也可重启小龙虾网关后重试。

相关图书

SDD实战:规范驱动开发之道
SDD实战:规范驱动开发之道
Agent设计模式 图解可复用智能体架构
Agent设计模式 图解可复用智能体架构
AI科研绘图:Nano Banana极速实战指南
AI科研绘图:Nano Banana极速实战指南
Skills+OpenClaw:从零打造个性化AI助理
Skills+OpenClaw:从零打造个性化AI助理
GESP编程能力等级认证一本通(C++ 四级)
GESP编程能力等级认证一本通(C++ 四级)
十倍速开发:AI时代的Cursor编程手记
十倍速开发:AI时代的Cursor编程手记

相关文章

相关课程