WorkBuddy从上手到变现

978-7-115-70373-6
作者: 唐菲悦李果小蔡吴睿冼杰铿张凯明
译者:
编辑: 林舒媛
分类: 其他

图书目录:

详情

本书以AI Agent的崛起为背景,介绍普通用户如何借助WorkBuddy这一无需编程基础的AI Agent工具,实现效率提升与商业变现。全书共5章,从AI发展的3个阶段切入,阐释AI Agent “从帮你写到替你干” 的本质转变,以WorkBuddy为贯穿始终的教学工具,手把手带领读者学习部署上手、投资信息系统搭建、公众号运营、资源中介变现等完整实战案例。本书最大特色在于以WorkBuddy为操作工具,将复杂的AI Agent技术操作转化为可复现的图文流程,每章均提供实战案例与调试建议,兼顾实操性与严谨性,并提供了安全风险与变现天花板提示内容。 本书适合对AI Agent感兴趣但缺乏技术背景的职场人士、自媒体创作者、个人投资者,以及希望探索“一人公司”模式的创业者阅读。读者无需编程经验,可通过本书掌握将AI Agent融入日常工作流并产生收益的实操路径。

图书摘要

版权信息

书名:WorkBuddy从上手到变现

ISBN:978-7-115-70373-6

本书由人民邮电出版社发行数字版。版权所有,侵权必究。

您购买的人民邮电出版社电子书仅供您个人使用,未经授权,不得以任何方式复制和传播本书内容。

我们愿意相信读者具有这样的良知和觉悟,与我们共同保护知识产权。

如果购买者有侵权行为,我们可能对该用户实施包括但不限于关闭该帐号等维权措施,并可能追究法律责任。

版  权

著    唐菲悦  李 果  小 蔡  吴 睿  冼杰铿  张凯明

责任编辑 林舒媛

人民邮电出版社出版发行  北京市丰台区成寿寺路11号

邮编 100164  电子邮件 315@ptpress.com.cn

网址 http://www.ptpress.com.cn

读者服务热线:(010)81055410

反盗版热线:(010)81055315

内 容 提 要

本书以AI Agent的崛起为背景,介绍普通用户如何借助WorkBuddy这一无需编程基础的AI Agent工具,实现效率提升与商业变现。全书共5章,从AI发展的3个阶段切入,阐释AI Agent“从帮你写到替你干”的本质转变,以WorkBuddy为贯穿始终的教学工具,手把手带领读者学习部署上手、投资信息系统搭建、公众号运营、资源中介变现等完整实战案例。本书最大特色在于以WorkBuddy为操作工具,将复杂的AI Agent技术操作转化为可复现的图文流程,每章均提供实战案例与调试建议,兼顾实操性与严谨性,并提供了安全风险与变现天花板提示内容。

本书适合对AI Agent感兴趣但缺乏技术背景的职场人士、自媒体创作者、个人投资者,以及希望探索“一人公司”模式的创业者阅读。读者无需编程经验,可通过本书掌握将AI Agent融入日常工作流并产生收益的实操路径。

前  言

写这本书的初衷,源自一个很简单的观察:身边越来越多的人开始用AI,但绝大多数人对AI的使用,仍然停留在“问一句,答一句”的层面。让AI写一段文案,改一封邮件,画一张图——这些当然有价值,但AI能做的还有太多。

真正的拐点,发生在AI Agent出现之后。它不再只是被动地等你提问,而是可以主动操作软件、抓取信息、串联任务,把一件件原本需要人去做的琐事跑完。从“帮你写”到“替你干”,背后是工作方式的根本性变化。在国外,奥地利开发者发布的开源项目OpenClaw几乎在一夜之间引爆了开发者社区;在国内,腾讯、阿里、字节跳动等大厂也已经把AI Agent能力集成进自家云平台。这场变化不是“未来”,而是“此刻”。

但变化越快,普通人越容易被两种情绪夹击:一种是焦虑——担心被时代抛下;另一种是迷茫——面对铺天盖地的概念、工具、术语,不知道从哪儿开始迈第一步。这本书想做的事情很朴素:把AI Agent这件事,从概念讲到落地,从工具讲到变现,让一个没有技术背景的普通读者,也能跟着书里的步骤,把AI Agent真正用起来。

全书围绕一个核心思路展开:先认知,再上手,最后变现。第1章讲清楚AI Agent是什么、它和ChatGPT到底有何不同——这是认知的地基。第2章带你完成WorkBuddy的安装与配置,跑通第一个任务——这是动手的起点。第3~5章,则是三个完整的变现场景:用AI Agent打造个人投资决策大脑、自动化运营公众号矩阵、做资源对接中介赚差价。每一章都有完整的实战流程,可以直接照着复刻。

需要提前说明的是,这本书并不打算把AI Agent包装成“一夜暴富”的工具。它确实能够显著提升你的效率,让一个人完成过去需要一个小团队才能完成的工作,但它仍然有自己的能力边界——它擅长执行结构化任务,不擅长复杂决策;它能放大你的专业能力,但无法替代你的判断力。读完这本书,你不会变成技术专家,但你会拥有一种新的工作方式:把繁琐交给AI,把判断和创造留给自己。

如果你正打算把AI从“偶尔用一下”变成“每天都依赖”的生产力工具,希望这本书能成为你迈出第一步的助推器。让我们一起,认识WorkBuddy。

第1章 认知觉醒——如何用AI Agent开启赚钱之旅

本章先聚焦基础知识——AI Agent是什么、它和你熟悉的ChatGPT有何不同、它今天到底能做什么、又有哪些做不到的地方。我们会以OpenClaw(“小龙虾”)这一爆款开源项目为切入点,看看普通人如何借助AI Agent把繁琐的执行工作交给机器,把宝贵的时间留给真正需要判断和创造的事。本章能帮助你对接下来几章介绍的实操内容形成清晰的认识。

1.1
一场正在发生的变化:从“帮你写”到“替你干”

你很可能已经接触过AI工具。无论是打开 ChatGPT 提出问题,让豆包帮忙撰写一封邮件,还是借助生成式模型制作一张海报,这些操作如今已经变得十分常见,甚至逐渐成为日常工作的一部分。然而,在频繁使用这些工具的过程中,一个容易被忽视的问题也逐渐浮现:在获得 AI 的输出结果之后,后续的大量操作仍然需要依赖人工完成。

例如,你仍然需要将生成的内容复制到文档中,手动调整排版格式,再选择合适的渠道发送出去。换言之,AI在一定程度上帮助我们节省了“思考”的时间,却并没有显著降低“执行”的成本。整个流程依然被分割为多个环节,而人类仍需负责这些环节的连接与调度。

事实上,这正是当前绝大多数人使用 AI 的典型方式:用户提出指令,系统返回结果,随后通过复制粘贴将其嵌入既有工作流中。在这一模式下,AI更像是一个被动响应的“内容生成器”——只有在被调用时才开始工作,而一旦交互结束,系统便停止参与后续过程。

然而,AI技术正在经历一场意义深远的转变。这种转变不仅体现在模型能力的提升,更重要的是其角色正从“被动工具”向“主动执行者”演化。本章将围绕这一变化展开讨论,探讨其背后的技术逻辑,以及它为何会对未来的工作方式产生深远影响,并说明为什么在当下就值得引起重视。

1.1.1 AI发展的3个阶段

如果将AI的发展过程放在一条时间轴上进行观察,可以清晰地看到其演进大致经历了三个具有代表性的阶段。

第1个阶段可以被称为“搜索时代”。在这一阶段的技术体系以谷歌(Google)为代表,其核心功能在于从海量信息中进行高效检索。用户通过输入关键词,系统返回一系列相关链接,而信息的筛选、理解与整合仍然需要由人来完成。从本质上看,这一阶段所解决的问题是“信息在哪里”,即降低信息获取的成本,但并未改变信息处理的主体。

第2个阶段是“生成时代”。随着 ChatGPT 等生成式AI系统的出现,AI 的角色开始发生显著变化,从“帮助检索信息”进一步转向“直接生成内容”。用户不再需要在多个来源之间进行比对和拼接,而是可以直接获得结构完整的文本、报告甚至代码。这一阶段的关键突破在于AI开始承担部分原本属于人类的内容生产任务,其核心解决的是“内容如何产出”的问题。

而当前正在展开的,则是第3个阶段——“代理时代”(Agent Era)。在这一阶段,AI的能力进一步延伸,从单纯的回答问题或生成内容,转向对任务的实际执行。系统不再停留在输出层面,而是能够调用工具、操作软件,并在多步骤流程中持续推进任务的完成。例如,当用户提出“整理本周销售数据并发送报告”这一需求时,AI 可以自主完成数据获取、表格生成、文本撰写及邮件发送等一系列操作,从而形成一个相对完整的执行闭环。

正如麻省理工科技评论(MIT Technology Review)在相关报道中所指出的,AI Agent 正在推动软件从以信息处理和内容生成为核心的工具形态,转变为能够代表用户执行任务的系统。这一转变意味着,AI的角色正在由“表达能力增强的工具”逐步演化为“具备执行能力的助手”,其影响不仅体现在技术层面,更将重塑人与软件之间的基本关系。

1.1.2 什么是AI Agent

“AI Agent”这一概念在近期的技术讨论与产业实践中频繁出现。其常见的中文翻译为“智能代理”,但这一译法偏向学术语境,对于非专业读者而言并不直观,也难以准确传达其在实际应用中的角色变化。

为了更清晰地理解这一概念,可以将其与传统AI系统进行对比。在以往的使用模式中,AI 更类似于一种被动响应的工具:用户提出问题,系统给出答案;一旦交互结束,系统便停止工作。这种模式强调的是“响应能力”,而非“执行能力”。相比之下,AI Agent 更接近一种具备自主性的任务执行者。用户只需给出目标,如安排一次出差行程,系统便可以围绕这一目标展开一系列操作,包括信息检索、方案选择、资源预订及过程协调,并在遇到不确定情况时进行适当调整,必要时再向用户反馈。

在定义层面,Amazon Web Services(AWS)将 AI Agent 描述为一种能够感知环境、进行决策并采取行动以实现既定目标的软件系统。这一定义强调了三个关键能力:对外部信息的感知、基于目标的决策,以及面向结果的行动。与此同时,IBM 则从运行机制的角度对其工作过程进行了结构化拆解:首先是对用户目标的理解与任务规划,其次是通过调用工具获取信息并执行具体操作,最后是在结果基础上进行反馈与优化。

从更抽象的层面来看,这一过程可以概括为三个连续阶段:规划、执行与反思。这一逻辑并非源于AI本身,而是与人类在复杂任务处理中的基本工作方式高度一致。正因为如此,AI Agent 的出现不仅意味着工具能力的增强,更体现了一种工作范式的转变。

在这样的背景下,越来越多的研究者与从业者开始将 AI Agent 视为“数字员工”。与传统生成式模型不同,它的核心价值并不在于产出文本或内容,而在于围绕目标完成任务本身。这种从“生成内容”到“执行任务”的转变,正在重新定义AI在实际工作流程中的位置与作用。

1.1.3 OpenClaw(小龙虾):AI Agent的爆款代表

在概念层面的讨论之后,有必要通过一个具体案例来理解 AI Agent 在现实中的形态与影响。

2025年年底,奥地利开发者 Peter Steinberger 发布了一个开源项目。该项目最初名为 Clawdbot,经过多次迭代与调整后,最终定名为 OpenClaw。上线后不久,该项目在 GitHub 社区迅速获得关注,并在较短时间内实现了用户与开发者规模的快速增长,成为当时增长速度极为突出的开源项目之一。OpenClaw界面如图1-1所示。

从功能定位来看,OpenClaw 的核心特征在于将 AI Agent 的能力本地化部署到个人计算环境中。用户可以通过即时通信工具(如微信、Discord 等)向系统发送指令,而系统则能够在本地计算机上直接执行相关任务。这些任务涵盖文件管理、代码生成、网页数据抓取、内容发布及日程安排等多个方面,体现出从“信息处理”向“任务执行”的明显转变。

图1-1 OpenClaw界面

进入 2026 年初,OpenClaw 在中国市场的传播速度进一步加快。根据 Business Insider 的相关报道,包括腾讯、阿里巴巴及字节跳动旗下的火山引擎在内的多家平台,已开始尝试将该项目集成至其云服务体系中,以支持用户进行快速部署与调用。与此同时,在小红书等内容平台上,围绕 OpenClaw 的使用教程与实践案例也迅速积累了大量关注,显示出其在普通用户群体中的扩散潜力。

进一步来看,部分用户甚至选择为此配置专门的硬件环境(如低功耗主机),以实现长时间持续运行,并将其作为一种“常驻型”的自动化执行系统。这种使用方式表明,AI Agent 正在从间歇性调用的工具,转变为持续参与工作流程的基础设施。

在产业与投资层面,OpenClaw 同样引发了广泛关注。Y Combinator 首席执行官 Garry Tan 及 Andreessen Horowitz(a16z)的多位合伙人均对这一方向表达了明确兴趣。随后,OpenAI 在 2026 年初将 Peter Steinberger 招入团队,参与下一代 AI Agent 产品的研发。这一举动也从侧面印证了该方向的战略价值。

一个开源项目能够在短时间内引发如此规模的技术关注与产业响应,说明 AI Agent 已不再停留于概念层面的讨论,而是正在演变为具备实际可用性的技术形态。更重要的是,这种形态正在逐步融入真实的工作与生活场景之中,成为新一代软件范式的重要组成部分。

1.1.4 3个常见误解

在进一步讨论 AI Agent 的能力与应用之前,有必要对其当前的边界与局限进行澄清。只有在充分理解其能力范围的前提下,才能对这一技术形成合理的预期,并在实践中加以有效利用。

首先,AI Agent 并非通用意义上的“智能决策者”。从现阶段的发展来看,它更擅长处理步骤清晰、结构明确的任务,如数据整理、定时执行、批量处理等。在这些场景中,其执行效率往往显著超过人工。然而,当任务涉及复杂判断、价值权衡或不确定性较高的决策时,其能力仍然有限。例如,对于“是否应推进某一方案”这类问题,AI Agent 尚不具备可靠的判断能力。因此,将其理解为一种执行力较强但决策能力有限的辅助角色,是更为现实的定位。

其次,AI Agent 目前尚未达到“完全自动化、无需干预”的成熟阶段。以OpenClaw 为例,该项目仍处于快速迭代过程中,在功能稳定性与使用体验方面均存在一定不足。用户在实际使用过程中,往往需要进行环境配置、参数调整及问题排查等操作。在少数派(一个专注于数字生活与效率工具的内容平台)上,一位连续使用 OpenClaw 两周的作者曾指出,该产品在实践中仍会遇到多种问题,整体成熟度尚有提升空间。这意味着,用户在部署后仍需保持一定程度的参与和管理,而不能将其视为完全自主的系统。

最后,安全风险是这一类系统不可回避的重要问题。为了完成任务,AI Agent 往往需要访问本地文件、账户信息及浏览器环境等敏感资源。一旦配置不当或权限控制不足,相关数据就可能面临泄露风险。在小红书上,一位名为“程序员Yago”的用户曾形象地描述这一问题,认为在缺乏有效保护的情况下,个人数据可能处于高度暴露的状态。同时,火山引擎在其部署文档中也明确建议,应尽量在隔离环境中运行相关系统,避免处理敏感信息,并对权限设置进行定期审查。

需要强调的是,对这些问题的讨论并非出于否定或警示,而是为了帮助读者建立更加理性的认知框架。只有在清晰理解其能力边界与潜在风险的基础上,AI Agent 才能被更安全、有效地纳入实际工作流程之中。

本节围绕 AI Agent 的基本概念及 OpenClaw 的兴起背景进行了介绍。接下来,将进一步聚焦其具体应用层面,探讨 OpenClaw 在实际使用中能够承担哪些类型的任务,以及这些能力如何转化为可感知的效率提升。

1.2
OpenClaw的能力:先看效果再说原理

在展开具体原理之前,不妨先从实际应用场景入手进行观察。相比于抽象概念,真实案例往往更有助于理解一项技术的实际价值与边界。

1.2.1 从对话到自动化知识库: 6个真实使用场景

下面将介绍6个具体示例,这些任务均已由用户在 OpenClaw 环境中完成并验证其可行性。通过这些案例,可以更直观地了解AI Agent 在实际工作流程中的表现方式,以及其能够承担的具体职责。阅读这些案例后,读者可以根据实际效果判断这一技术是否值得进一步投入时间与精力。

场景一:随时随地与AI对话,无须切换App。

这是最基础且最容易理解的一类使用方式。在完成 OpenClaw 的基础配置后,用户可以通过即时通信工具(如微信、Discord 等)直接与系统交互,其体验在形式上与日常与同事沟通没有显著差异。用户可以在移动端发起指令,并在计算机端继续处理相关任务,对话记录会在不同设备之间自动同步,从而形成连续的工作上下文。

与直接使用 ChatGPT 等传统对话式工具相比,OpenClaw 的关键差异在于其对上下文的持续管理能力。在一般对话系统中,每次交互通常是相对独立的,而 OpenClaw 则能够在更长时间范围内保留并调用历史信息。例如,用户在上午查询某行业的政策变化,随后在下午提出“将此前内容整理为简报”的需求时,系统可以基于既有对话自动完成关联与延续,而无须用户重复说明背景。这种能力使其不再是一个“每次从零开始”的对话界面,而更接近于一个具备持续记忆的工作协同工具。

此外,OpenClaw 还支持接入多种主流大语言模型,包括 ChatGPT(GPT 系列)、Claude、Gemini,以及国内的 Kimi 和 MiniMax 等。用户可以在同一界面中灵活切换不同模型,从而在成本、性能与输出风格之间进行权衡与选择。这种多模型协同能力使其在复杂任务处理中具备更高的适应性与扩展空间。

场景二:手机上发条消息,远程指挥计算机写代码。

这一场景对于非程序员读者而言或许略显陌生,但它能够较为典型地体现 AI Agent 的工作方式与能力边界。

在一个实际案例中,一位用户更换手机输入法后,对其默认皮肤的视觉风格感到不满意。与传统方法不同,他并未在计算机上手动查阅教程或修改代码,而是直接通过飞书将皮肤文件发送给 OpenClaw,并提出“根据个人使用习惯调整配色”的需求。随后,系统在其本地计算机环境中自动完成了一系列操作,包括读取文件内容、修改相关代码,以及生成新的皮肤文件。整个过程中,用户无须直接操作计算机设备,甚至没有进行任何键盘输入。

这一案例所体现的关键差异在于,AI Agent 不再仅仅停留于提供建议或解释方案,而是能够围绕用户目标直接完成实际操作。在传统AI工具的使用模式下,系统通常会给出“应当如何修改代码”的指导,而具体的执行仍然依赖用户完成;而在 AI Agent 的框架中,这一执行过程被进一步自动化,从而实现从“提供方案”到“完成任务”的转变。

正是在这一点上,AI Agent 与传统生成式 AI 形成了本质区别:前者关注任务的落地与执行,后者则主要停留在信息与内容的生成层面。这种差异也构成了其在实际工作流程中价值提升的核心来源。

场景三:定制你自己的新闻推送。

这一场景在实际使用中具有较强的实用价值,也更贴近日常的信息获取需求。

用户可以将常用的 RSS(Really Simple Syndication,一种基于 XML 的内容订阅与分发标准)订阅源提供给 OpenClaw,由系统围绕这些信息源构建一个自动化的信息处理流程。具体而言,OpenClaw 会定期抓取各订阅源的最新内容,并依据用户预设的筛选规则(如仅保留与AI或商业相关的文章)对信息进行过滤。在此基础上,系统还可以按照固定时间(如每日晚间)生成一份结构化摘要,将筛选后的文章进行简要概括并推送给用户,使其能够在较短时间内判断是否有必要进一步阅读全文。

与此同时,这一流程还可以与本地存储机制相结合。所有抓取到的内容会被自动归档为本地文件,并按照预设策略进行管理,如仅保留最近若干天的数据,过期内容自动清理,从而在保证信息及时性的同时避免无序积累。

在此基础上,部分用户进一步扩展了这一工作流。例如,系统可以在完成内容筛选与摘要生成后,将当日信息自动转化为音频形式,并以播客的方式发送给用户。这种做法实际上将原本分散的信息流整合为一个连续的“个人新闻频道”,使信息获取从主动浏览转变为被动接收,从而进一步降低了时间成本。

场景四:写作全流程辅助。

对于从事写作相关工作的用户而言,这一场景尤为值得关注,因为它直接体现了 AI Agent 对完整创作流程的介入能力。

在少数派上,一位作者将自身的写作流程整体迁移至 OpenClaw 环境中,并构建了一套相对稳定的辅助机制。在写作准备阶段,系统会围绕既定主题自动搜集相关资料,对关键信息进行交叉核验,并整理为带有来源标注的结构化概要,从而为后续创作提供可靠的参考基础。

进入写作过程后,AI Agent 的作用进一步体现在对思路连续性的保护上。当作者在撰写过程中遇到需要补充或核实的信息时,无须切换至浏览器或其他工具进行检索,而是可以直接在飞书中发出指令,由系统即时返回结果。这种交互方式有效减少了上下文中断,使写作过程更加连贯。

在初稿完成后,OpenClaw 还可以承担自动校对与优化的任务,包括识别错别字、语法问题及表达不够严谨之处,并给出相应的修改建议。相比传统的人工自检或简单的拼写检查工具,这种方式在覆盖范围与反馈质量上均有所提升。

在具体的使用形态上,该作者还通过在飞书中建立专门的“写作助手”群组,将 OpenClaw 纳入其中,实现与编辑器的并行协作。通过分屏方式,一侧用于与系统交互,另一侧进行文本编辑,使信息获取、内容生成与修改优化等环节能够在同一工作界面内连续完成,从而显著降低了多工具切换带来的干扰。

场景五:控制浏览器,自动化操作网页。

OpenClaw 还具备对本地浏览器进行操作的能力,如直接控制 Google Chrome 的行为。这一功能使其能够在无须人工干预的情况下,模拟用户在网页中的操作流程,从而完成数据获取与整理等任务。

例如,在小红书上,当用户发现某一内容创作者具有较高的参考价值,并希望系统性整理其历史发布内容时,通常会面临一个现实问题:平台并未提供公开接口,传统方式只能通过逐篇浏览与手动复制来完成,过程烦琐且效率较低。在这种情况下,OpenClaw 可以通过模拟浏览器操作,依次打开相关页面,提取文本信息,并将其整理后保存至本地,从而在一定程度上替代重复性的人工劳动。

需要指出的是,这一过程在实际运行中仍存在一定局限性。一方面,由于页面加载与交互需要逐步执行,其整体速度通常难以达到批量接口调用的效率;另一方面,平台的反爬机制可能会对自动化行为进行识别与干扰,从而导致任务中断。因此,该功能更适用于中等规模的数据整理,而非大规模且需要高稳定性的抓取任务。

更为重要的是,这一功能在带来便利的同时,也引入了不可忽视的安全风险。由于系统需要访问浏览器环境以完成操作,其潜在可见范围可能涵盖用户的登录状态、账户信息及浏览内容等敏感数据。如果权限配置不当或运行环境缺乏隔离,相关信息可能存在被滥用或泄露的风险。因此,在实际使用中,应谨慎评估风险,避免在涉及重要账户或敏感数据的环境中直接部署相关插件。必要时,可以考虑使用专用浏览器或隔离环境以降低风险。

场景六:把Notion变成自动化知识库。

最后这一类场景相对更为进阶,但也更能体现 AI Agent 在长期任务管理中的潜力。

在一个实际案例中,用户将 OpenClaw 与 Notion 数据库进行连接,并围绕个人词汇学习构建了一套自动化流程。系统首先通过定时任务,从用户维护的单词库中提取数据,并基于简单的记忆策略(如间隔复习或熟练度权重)筛选出当日需要复习的若干词汇,随后将其推送给用户。

完成学习后,用户只需对每个单词给出熟悉程度的反馈。OpenClaw 会将这些评分及对应的复习次数自动写回 Notion 数据库,从而更新每个词条的状态信息。下一轮推送时,系统会基于这些历史记录重新计算优先级,实现动态调整。这一过程形成了一个持续运行的反馈机制,使学习不再依赖人工记录与手动管理。

同时,当用户在日常生活中遇到新的生词时,也可以直接通过对话方式提交给系统。OpenClaw 会自动在 Notion 中创建对应条目,并补充包括音标、词性、释义及辅助记忆信息在内的结构化内容,从而将零散输入纳入统一的知识体系之中。

从整体来看,这一案例的关键价值不在于单一功能的实现,而在于构建了一个完整的学习闭环:从内容获取、任务分发,到反馈记录与策略调整,各个环节均由系统自动衔接完成。相比传统依赖人工维护的学习方式,这种模式显著降低了管理成本,并提升了过程的连续性与可持续性。

1.2.2 这些场景背后的共同逻辑

在上述六个场景的对比中,可以归纳出一个具有共性的特征:OpenClaw 的作用并不仅限于“回答问题”,而是围绕用户目标执行一整套连续的操作流程。

从结构上看,这些场景在底层遵循相似的运行逻辑。系统首先对用户意图进行理解与拆解,在此基础上选择并调用合适的工具(如文件系统、浏览器、外部 API 或数据库),随后在多步骤执行过程中逐步推进任务,并最终返回结果。这一过程并非一次性输出,而是一个具有过程性的执行链条。

也正是在这一点上,AI Agent 与传统AI形成了本质区别。后者主要停留在信息生成与表达的层面,而前者则进一步延伸至实际操作与任务完成。换言之,传统 AI 更接近于“能够表达的系统”,而 AI Agent 则开始变成“能够行动的系统”。其核心价值也因此从“生成内容”转向“完成任务”。

1.2.3 正视OpenClaw的能力边界

在强调其潜力的同时,也有必要对 AI Agent 的能力范围保持清醒认识。

从当前阶段来看,OpenClaw 的能力范围相对明确:它在处理规则清晰、流程可拆解且具备重复性的任务时,往往能够表现出较高的效率与稳定性;但在面对语义模糊、目标不明确或需要依赖人类经验与直觉进行判断的情境时,其表现仍存在明显局限。例如,对于“定时抓取并筛选行业信息”这类任务,系统通常可以稳定完成;然而,当问题转向“是否应进入某一市场”这类涉及复杂决策的情境时,其输出虽可能结构清晰,却往往缺乏必要的商业洞察与情境判断能力。

此外,其运行稳定性并非由单一因素决定,而是取决于多个条件的共同作用,包括所接入模型的能力水平、网络环境的稳定性及用户配置的合理程度等。在实际使用过程中,调试与问题排查往往不可避免。正如少数派上一位长期使用者所指出的,用户需要对调试过程有所预期。不过值得注意的是,这一过程本身也可以部分借助 AI Agent 完成,从而在一定程度上降低技术门槛。

综上所述,对 AI Agent 的理解既不能停留在概念层面的乐观想象,也不应忽视其在实际应用中的限制。只有在合理设定预期的前提下,才能更有效地发挥其在具体场景中的价值。

在此基础上,下一节将转向一个更具操作性的问题:如何在实际环境中部署并使用这一类系统。

1.3
从装不上到用得起:跨过AI Agent的使用门槛

尽管 AI Agent 的演示效果往往令人印象深刻,但当用户真正尝试从“理解概念”迈向“实际使用”时,往往会在关键环节遭遇阻碍。

这些阻碍主要集中在两个方面:其一是环境搭建与系统部署,包括运行环境的准备、依赖配置,以及相关组件的安装。这一过程对非技术背景的用户来说具有一定的门槛;其二是模型使用所涉及的成本问题。不同模型在价格、性能与可用性之间存在差异,如何选择合适的模型并控制费用,同样需要用户具备一定的判断能力。

因此,本节将围绕这两个核心问题展开阐述,旨在帮助读者建立清晰的路径认知,从而根据自身条件选择合适的使用方式,降低实际入门的难度。

1.3.1 传统部署的“劝退三连”

OpenClaw 作为一个开源项目,从理论上讲,任何用户都可以免费获取并使用其功能。然而,“免费可得”与“实际可用”之间往往存在一条不易跨越的技术门槛。

按照传统方式,其安装与部署流程大致包括以下几个环节:首先,需要准备运行环境,如安装 Node.js;随后,通过命令行工具下载项目代码;在此基础上,配置所需的 AI 模型 API 密钥;接着,完成与即时通信工具(如微信等)的消息通道对接;最后,启动相关服务以使系统进入可运行状态。整个过程涉及多个步骤,且各环节之间存在一定依赖关系。

在实际操作中,这一流程的稳定性较为脆弱。环境变量配置错误、端口冲突、依赖版本不兼容等问题均可能导致部署中断。一旦出现问题,用户往往需要具备一定的技术背景才能完成排查与修复。

对于具备编程经验的用户而言,上述操作通常属于可控范围;但对于大多数非技术背景的使用者来说,即便是“打开终端并输入命令”这一基础步骤,也可能已经超出其日常使用经验。因此,尽管项目本身具备较高的开放性,其实际可及性却受到明显限制。

这也解释了一个在AI领域中反复出现的现象:某些项目在技术社区中获得了广泛关注,但真正进入日常使用场景的用户却相对有限。技术门槛在无形中筛选了用户群体,使大量潜在需求难以转化为实际应用。

1.3.2 降低门槛的几种方式

值得注意的是,上述技术门槛正在被快速降低,多种替代路径已经逐步出现,使非技术背景的用户也能够进入这一领域。综合来看,目前较为可行的方案大致可分为三类,其差异主要体现在部署难度、成本结构及数据控制方式上。

第一类是基于云服务器的一键部署方案。以腾讯云、阿里云及火山引擎为代表的云服务商已经提供了预配置环境的镜像或模板。用户无须自行搭建运行环境,只需完成基础实例创建,即可在较短时间内启动 OpenClaw。这种方式显著降低了上手难度,适合希望快速体验的用户。但其代价在于持续的云资源费用,同时由于数据运行在远程服务器上,在隐私与安全性方面需要额外权衡。

第二类是面向终端用户的桌面级工具。这类工具通过图形化界面与本地运行机制,将安装、配置与调用过程整合为一体,从而避免用户接触命令行环境。WorkBuddy 即属于这一方向。用户只需要直接下载WorkBuddy,如图1-2所示,之后输入自然语言即可触发任务执行。这种模式在降低使用门槛的同时,也有助于提升数据的本地可控性。随着相关产品的不断涌现,这一路径正在逐步成熟。

图1-2 WorkBuddy下载界面

第三类是基于本地硬件的持续运行方案。在当前的 OpenClaw 社区中,一种较为普遍的实践是使用 Mac mini 作为专用设备进行部署。该设备具有功耗低、稳定性高的特点,非常适合长时间不间断运行。在成本方面,主流配置的价格已进入可接受范围,使其成为兼顾性能与投入的折中选择。用户可以将其作为常驻设备放置在固定环境中,从而实现类似“全天候在线助手”的运行形态。当然,这一方案仍然要求用户具备完成初始安装与配置的能力。不过,随着社区教程的逐步完善,其实际操作难度已显著降低。

1.3.3 模型选择:从免费到付费的四条路径

在完成 OpenClaw 的安装与部署之后,用户还需要进行一个关键选择,即接入具体的 AI 模型。需要明确的是,OpenClaw 本身并不包含模型能力,它更接近于一个“执行框架”,负责理解任务、调度工具并组织流程,而真正承担推理与生成能力的“核心引擎”则需要由用户自行配置。

围绕模型选择,目前大致可以形成从免费到付费、从云端到本地的多种路径,其差异主要体现在成本、性能与隐私控制之间的权衡。

对于仅希望进行初步体验的用户,可以选择免费方案。例如,NVIDIA 提供的 Kimi K2.5 模型试用,或 OpenRouter 上的部分免费模型,都可以通过申请 API 密钥直接接入。这类方案的优势在于零成本或低门槛,但通常需要以数据使用权限作为交换,即对话内容可能被用于模型训练。因此,是否采用需根据个人对隐私的敏感程度进行判断。

在付费方案中,当前性价比较为突出的选择之一是 ChatGPT 的订阅服务,如图 1-3 所示。通过 ChatGPT Plus(约 20 美元/月),用户可以使用 GPT-5.3 Codex 等高性能模型,在任务执行的稳定性、响应速度及结果质量之间取得较为均衡的表现。根据少数派相关用户的实际对比体验,这类模型在综合表现上具有明显优势,尤其适合对复杂任务有较高要求的场景。

图1-3 ChatGPT 付费套餐

对于不便使用海外服务的用户,国产模型同样提供了可行替代方案。例如,Kimi 的 Coding Plan 及 MiniMax 的订阅方案均已被 OpenClaw 开发者 Peter Steinberger 推荐用于实际部署。从体验角度来看,Kimi K2.5 在工程类任务中的稳定性较强,适合处理复杂流程;而 MiniMax 在成本与响应速度方面更具优势,更适用于轻量级或高频调用场景。

此外,对于高度关注隐私或希望控制成本的用户,还可以选择本地模型方案。通过 Ollama 等工具,可以在本地设备上部署如 DeepSeek、Qwen 等开源模型,从而使数据始终保留在本机环境中。这一方案在数据安全性方面具有明显优势,但其性能受限于本地硬件条件,整体能力通常仍弱于主流云端商业模型。

1.3.4 使用模型时的典型问题

在实际使用过程中,除了基础配置与模型选择之外,还存在一些较为典型的问题。这些问题在初期往往不易被察觉,但一旦进入高频使用阶段,可能会对整体体验产生显著影响。

首先需要关注的是额度与频率限制问题。以 Gemini 和 Claude 为例,一些订阅方案表面上看似性价比较高,但实际使用中频率限制(Rate Limit)往往更容易触发,特别是在连续对话或高频调用的场景下尤为明显。例如,Claude 模型在多轮交互后可能出现额度提示,从而中断任务流程。因此,对于需要稳定、高频运行 AI Agent 的用户而言,按调用量计费的 API 方案在可用性与连续性方面通常更加可靠。

其次是模型能力差异带来的隐性成本问题。部分模型在初始阶段能够“跑通流程”,但在代码质量、异常处理或边界情况应对方面存在不足。这类问题往往不会立即显现,而是在后续使用中逐步暴露。“理论上可行”与“实际稳定可用”之间存在明显差距。一旦系统被纳入真实工作流程,这些隐患可能转化为返工成本,且通常远高于模型本身的费用。因此,从一开始选择质量更高、稳定性更强的模型,是更具长期收益的策略。

最后需要重点考虑 Token 消耗带来的资源压力。与传统的一问一答式交互不同,AI Agent 在执行任务时会经历多轮内部调用,包括指令解析、任务规划、步骤执行及结果校验等环节,每一步都会消耗 Token。在高频使用场景下,这种消耗会迅速累积。例如,有用户在使用 Kimi Code 套餐(约 99 元/月)时,不到五天即触及额度上限。这一现象表明,在将 AI Agent 用于主力工作流程时,必须对资源消耗进行预估,并为此预留充足预算。

针对 Token 消耗问题,可以通过一些具体策略进行优化。例如,定期使用 /new 命令清空会话上下文,以避免历史信息不断累积;通过/compact 命令对当前会话进行压缩,在保留关键信息的同时降低 Token 占用;在自动化运行场景中,还可以设置定时清理机制,以维持系统在较低资源消耗状态下持续运行。

上述问题分别对应系统使用中的三个核心维度:稳定性(频率限制)、质量(模型能力)与成本(Token 消耗)。理解这一结构,有助于在实际使用中做出更合理的取舍与优化。当安装部署与模型选择这两项基础门槛被跨越,并对上述问题形成清晰认知之后,用户通常即可进入较为稳定的使用阶段。在此基础上,下一节将从更宏观的角度展开,讨论 AI Agent 所代表的不仅是一类工具的演进,更是一种工作方式的变化。

1.4
一人公司:1个人加AI Agent能做什么

不妨设想这样一个日常场景。

早上8点,在你尚未起床之前,OpenClaw 已经完成了若干后台任务:它从你订阅的多个信息源中筛选出当天值得关注的行业动态,并整理为一份结构化摘要,推送至飞书;与此同时,它还对你的邮箱进行了自动梳理,将待处理邮件按紧急程度排序,并为关键邮件标注了建议回复要点。

当你起床查看手机时,只需花费几分钟浏览摘要,即可快速掌握当天的重要信息。对于紧急邮件,可以在系统生成的回复草稿基础上进行简单修改后直接发送,从而显著缩短处理时间。

进入上午的工作阶段,例如,在进行竞品分析时,你只需提出类似“整理三家公司的近期融资情况与产品动态”的需求,系统便会自动抓取公开信息,完成结构化整理,并标注数据来源。在此基础上,你只需补充判断与分析,即可在较短时间内完成原本需要更长周期的工作。

下午进行内容运营时,OpenClaw 可以基于当天筛选出的行业信息,自动生成多条候选文案。你从中选择合适的版本并进行必要调整后,系统即可完成配图、排版与多平台发布等后续流程,从而将创作与分发环节整合为一个连续过程。

在晚间学习场景中,系统还可以从你的 Notion 单词库中选取需要复习的内容进行推送。你完成学习并给出反馈后,相关数据会被自动记录与更新,形成持续运行的学习闭环。

1.4.1 “一人公司”不再是概念

上述这种“由单个个体完成多角色任务”的工作方式,正在被越来越多的人称为“一人公司”。

这一概念之所以能够从一种理念转化为现实,关键在于 AI Agent 使个体具备了同时管理多条工作流的能力。在传统模式下,即便只是个人运营一个自媒体账号,也需要花费大量时间处理选题、写稿、配图、排版、发布,以及后续的数据分析和用户互动等事务。这些环节高度依赖人工串联,不仅效率有限,而且难以扩展。

而在 AI Agent 的参与下,大量重复性、流程性的工作可以被自动化执行。选题筛选、信息整理、初稿生成、内容分发等环节都可以交由系统完成,人只需要集中精力处理判断与创作等核心部分。这种变化的本质,不是简单的“效率提升”,而是工作结构本身发生了改变。

这一趋势也开始在现实层面得到回应。2026年以来,深圳龙岗区、无锡高新区、合肥高新区等地,已经围绕“一人公司”模式出台了相关支持政策,如图 1-4 所示。例如,龙岗区和合肥高新区提出,对优秀的 OpenClaw 应用项目提供最高可达 1000 万元的补贴与融资支持,同时还包括算力资源、住房及办公空间等方面的优惠条件。此外,苏州大学也在校园内组织了以“一人公司”为主题的创新比赛,鼓励学生探索这一模式的实际应用。

图 1-4 深圳市龙岗区公告

当公共政策开始为这种形态提供资源支持时,这表明它已经不再局限于个体层面的尝试,而是在更大范围内被视为一种具有潜力的生产方式。AI Agent 的出现显著增强了个体在任务执行与资源调度方面的能力,从而在一定程度上改变了“人力规模决定产出规模”的传统逻辑。

1.4.2 安全是底线

然而,在将更多任务交由 AI Agent 处理之前,有一条底线必须明确——安全。

要实现自动执行,AI Agent 必然需要较高的系统权限,如读取本地文件、访问邮箱、操作浏览器及连接各类在线服务。这些权限一旦被滥用或配置不当,可能带来严重后果。因此,在引入此类系统时,必须将安全问题置于与效率同等重要的位置。

在实际部署层面,火山引擎在其相关指南中明确指出:由于系统具备广泛的数据、账号与网络访问能力,应优先在隔离环境中运行,尽量避免处理敏感信息,并对权限进行定期审查与必要限制。这一建议从侧面说明,AI Agent 的风险并非假设,而是需要在设计与使用阶段主动应对的问题。

从技术角度来看,这类系统可能面临“提示词注入”攻击的风险。攻击者可以在文档、网页或邮件中嵌入隐蔽指令,诱导系统执行未经授权的操作,如读取敏感数据或以用户身份发布内容。由于 AI Agent 具备自动执行能力,一旦被误导,其影响范围可能超出单次交互的范畴。

基于上述风险,可以归纳出以下基本使用原则:首先,应尽可能采用本地或隔离环境进行部署,以降低数据外传的可能性;其次,应避免让系统接触核心敏感信息,如账户凭证或关键业务资料;再次,需要定期检查权限设置,关闭不必要的访问通道;此外,在启用浏览器控制等高权限功能时,应明确系统的可见范围与可执行范围,以避免潜在风险。

这些措施并非过度谨慎,而是与系统能力相匹配的必要约束。随着 AI Agent 在实际工作流程中的参与程度不断加深,其潜在风险也随之增加。只有在建立基本安全意识的前提下,才能实现长期、稳定且可控的使用。

1.5
本章小结

本章主要围绕四个问题展开:第一,AI Agent 究竟是什么,它与传统对话式AI的核心区别在哪里;第二,以 OpenClaw 为例,这类系统在真实场景中能够承担哪些具体任务;第三,普通用户要真正开始使用它,需要跨过哪些现实门槛,包括部署方式、模型选择与使用成本;第四,当 AI Agent 开始稳定参与日常工作流程之后,它所带来的不仅是效率提升,更可能是一种新的工作组织方式。

如果在读完本章之后,你的结论是这项技术确实值得进一步尝试,那么下一章将转入具体实践:从安装配置开始,到完成第一个可运行的任务,逐步建立起对 AI Agent 的实际使用能力。

相关图书

SDD实战:规范驱动开发之道
SDD实战:规范驱动开发之道
Agent Skills开发实战像搭积木一样构建智能体
Agent Skills开发实战像搭积木一样构建智能体
Agent设计模式 图解可复用智能体架构
Agent设计模式 图解可复用智能体架构
Codex快速入门:Harness工程落地
Codex快速入门:Harness工程落地
构建之法——现代软件工程(第四版)
构建之法——现代软件工程(第四版)
AI科研绘图:Nano Banana极速实战指南
AI科研绘图:Nano Banana极速实战指南

相关文章

相关课程