GPT 不是万能的,遇到它做不好的任务,继续在 Codex 里反复尝试,还是换个模型试试?一个模型不够用,就得考虑换模型、补资料,或者让它用上工具。
在 Codex 出来之前,我就一直在用 Cherry Studio,身边把 AI 玩得比较深的朋友,也有不少在用它。今天就聊聊它能做什么,以及怎么把这套工作台用顺手。
一、Cherry Studio 能做什么
Cherry Studio 是一款开源的桌面 AI 软件。GPT、Claude、DeepSeek、Kimi,以及自己电脑上运行的模型,都可以通过相应接口接进来,在同一个软件里使用。
它最吸引我的地方,是模型可以换,常用的资料、写作要求和工具也能留在这套工作台里。

比如写一篇文章,开头怎么都不满意,可以把同一份材料同时交给几个模型,各写一版,放在一起比较。选到一个合适的方向,再继续往下改,不用在几个聊天网站里反复粘贴。
两个版本都想保留,就开「分支」,各改各的。写了几轮发现还是原来好,也能回到前面的分叉点。平时对语气、格式的要求,可以存成「助手」,下次不用重新交代。
自己写过的文章、产品手册、项目文档,可以放进知识库。需要用的时候让 AI 查原文,根据资料回答;换个模型,这些资料还能接着用。
要照模板生成 Word、整理文件夹,或者做一个能打开的网页,可以交给 Agent。配好模型和工具以后,它就能读取材料、操作文件。做完打开看,哪里不对,再让它改。
软件里也有翻译、绘画等入口。想试开源模型,或者限制较少的本地模型,可以通过 Ollama、LM Studio 接入,后面会单独讲。
这些常用功能都有现成入口,配置好模型和需要的服务就能用,不用从头写程序。
二、安装 Cherry Studio
Mac 用 Apple 芯片就选 ARM64,Intel 芯片选 x64,打开安装包后拖进「应用程序」。Windows 电脑通常选 x64 安装版;如果是 ARM 设备,就选 ARM64。
第一次打开,可以点「稍后设置」,先进入软件。

左侧「对话」用来写东西、问问题;「工作」是 Agent 做任务的地方;「知识库」存放以后还会反复查的资料。配置模型则从左下角「设置」进去。
顶部标签页和浏览器差不多。配置模型时可以留着对话页面,改完设置切回来试,不必来回退出。
三、接入模型
安装完,还要给 Cherry Studio 接一个模型。软件本身免费,模型调用可能收费,账单记在提供模型的服务商那里。
假如平时喜欢用 Kimi,可以接月之暗面的 API;想用 DeepSeek,就接 DeepSeek 的 API。也可以选提供多种模型的平台,例如硅基流动,一个账户下使用不同模型。刚开始接一家就够了,后面想比较时再加第二家。
这里的 API,可以先理解成「让 Cherry Studio 使用这家模型的接口」。你不用写代码,拿到一串叫 API Key 的密钥,填进软件就行。
API Key 要去服务商的「开放平台」创建。即使买过它的聊天会员,也要单独看 API 有没有额度,这两边通常分开计费。
以 Kimi 为例,到 月之暗面开放平台 注册或登录,找到 API Key 管理,创建一把密钥。看一下账户有没有可用额度,没有就按平台要求开通,先用少量预算试,不必一上来充很多。
回到 Cherry Studio,打开「设置 → 模型服务」,找到「月之暗面」,把密钥粘进去,启用服务,再点「获取模型列表」。

列表里可能有好几个名字,先添加自己打算用的那个。回到对话页面,点击上方的模型名称,就能切换到它。发一条短消息,能正常回复,这条连接就通了。
接进来的是模型 API,Kimi 网页的功能和会员权益不会一起搬过来。在这里,用的是 Cherry Studio 的界面和工具。
如果朋友或公司给了你一套接口,服务商列表里却找不到,就点列表底部的「添加服务商」。通常需要这些信息:

服务商名称可以起成自己认得的名字,例如「公司测试接口」。模型 ID 不能随便起,它是服务端用来识别模型的名字。获取模型列表失败时,如果对方明确提供了 ID,也可以手动添加。
接不通时,按报错检查。密钥无效,就核对是否复制完整、是否填到了对应服务;额度不足,去服务商账户看余额;模型不存在,核对模型 ID。地址和接口类型也要与服务商文档一致。
模型能聊天之后,再试图片、文件和工具调用。文字能回复,并不代表它支持所有功能,尤其是后面的 Agent。
至于选官方还是第三方服务,我建议刚开始用官方接口,少一层排查。第三方也可以用,但要知道资料发给了谁、价格怎么算、模型由谁提供。名字写着某个模型,不足以证明背后一定是同一个服务。
API Key 别贴进聊天记录或公开截图,别人拿到后可能花你的额度。
四、测试模型
模型接好以后,拿自己常用的材料试,比如一段原稿、会议记录或产品说明。内容熟悉,才容易看出回答有没有漏掉什么。
比如,要把一段长材料整理成给同事看的短消息,可以给两个模型同样的要求:
1把下面的材料整理成一段可以发给同事的消息,控制在 200 字以内。23保留已确定的结论、负责人、时间,以及还没解决的问题。4原文没写的不要补;暂定事项不能写成已经确定。5不要加开场白,直接给正文。67材料:8在这里粘贴原文。
比较时重点看:截止时间有没有留下,「暂定周五」有没有被改成「周五完成」。这些都能拿原文核对,不用凭语气判断谁更聪明。
在对话顶部打开模型选择器,开启多模型选择,勾上已经配置好的两个或三个模型,再发送同一个问题。

如果一个模型写初稿更顺,另一个查遗漏更仔细,以后就可以分开用,不必让同一个模型包办。
想看速度,到「设置 → 外观」打开「显示预估 Token 数」。回答后查看相关统计,可以比较等多久才开始出字、每秒输出多少,以及大致用了多少 Token。

Token 是模型处理文字的计量单位,不用把它当成精确字数。这些统计能帮你看开销,但最终账单还是看服务商。
写作模型还值得多试一轮。让它「保留第二段,只改开头,别动数字」,看看它会不会顺手把别的地方也改了。每次改一句都得重查全文,用起来会很累。
把几道常用测试题连同材料存成笔记,以后接入新模型,就拿出来再试一遍。比较时都开新话题,用相同的材料和要求,避免前面的聊天影响结果。
也不必每条消息都同时问好几个模型。多选会分别发出请求,每家都可能计费,材料也会分别发送给这些服务。挑方案、起标题时可以比较;确定好方向以后,用一个模型继续做就行。
五、用分支管理一项工作
改到第五版,突然觉得第二版更好,或者同一份提纲想试两种写法,都可以从对应的消息创建分支。
找到想保留的那条消息,打开消息菜单,选择「分支」。新路线带着分叉点之前的上下文,后面的讨论单独记录,原来的路线不会被覆盖。想回去时,打开分支管理器切换。
比如一篇文章已经有了提纲,开头还没定。可以从提纲这里分出两条:一条直接说结论,另一条从具体场景写起。两边各改几轮,看哪边好,再沿着选中的那条往下写。不用先删掉一个,才能试另一个。
普通的小修改,接着追问就行。两种写法都想留,再开分支。
经常做同一类文字工作,还可以先建一个助手。进入「对话 → 添加助手」,起个容易认的名字,比如「文章编辑」,把长期不变的要求存进去:
1你帮我修改面向普通读者的中文文章。23优先保留原稿里的事实和具体例子。4删掉没有新增信息的铺垫,不补写作者经历。5我指定修改某一段时,只改那一段。6遇到没有依据的判断,指出来,不要自行编来源。
助手里存长期不变的习惯。某篇文章的主题、材料、长度要求,放在当次话题里,免得下一篇还带着上一篇的条件。
需要审稿时,另开一个分支,让模型只找问题:
1检查这份稿子,不要重写。23对照我提供的材料,找出:41. 原材料没有支持的事实或数字。52. 把「可能」「暂定」写成确定结论的地方。63. 重复解释、删掉也不影响理解的段落。78每项引用原句,说明问题。找不到依据就写「需补来源」。
换一个模型审稿,有时能找出前一个漏掉的问题。不过两家都认可的内容也可能有错,重要事实仍要核对原资料。
只改文章时,不需要给模型开终端、浏览器或文件写入工具。把不相关的工具关掉,也能少带一些不必要的说明。
转到 Agent 做文件时,记得把定稿和要求一起交给它。刚才的对话不会自动完整带过去,要明确告诉它用哪一版。
六、把任务交给 Agent
稿子定下来,要照模板排成 Word,再导出 PDF,就到左侧「工作」里做,把稿件和模板准备好。

点击「添加智能体」,名字按用途起,例如「资料整理」。先选择运行模式,再选它支持的模型,填写工作要求。创建完成后,还能在编辑页面调整工具、权限、技能和知识库。

运行模式会影响能选哪些模型、用哪些权限,按当前模式的模型列表选就行。普通对话能用的模型,不一定适合 Agent。模式选定后不能直接切换,想换模式需要新建智能体。
有些模式还会出现主模型、Plan 模型、Small 模型,分别负责主要工作、规划和轻量处理。第一次可以先用同一个模型,熟悉以后再分配。
然后新建任务,选择工作目录。先拿一个专门文件夹练习,放材料副本;权限里有「逐次确认」就先用它,看看 Agent 准备读什么、运行什么、写到哪里。
选了工作目录,也要看工具权限。有些工具仍可能访问目录外的文件,第一次使用先不要开「完全访问」。
可以先放几份不敏感的会议记录,让它整理项目进展:
1读取当前工作目录里的会议记录,整理一份项目进展。23不要修改、移动或删除原文件。4按已完成、进行中、待确认三部分整理。5负责人和时间必须来自原文,没有写明就标记「待确认」。6每条进展后注明来源文件名。78先列出你找到的文件和整理提纲,等我确认。9确认后生成一个新文件:项目进展.md。
先看它找到的文件是不是对的,再确认提纲。文件生成以后打开核对,尤其看名字、日期和「待确认」事项有没有被它写成确定结论。
再试 Word、PDF 时,可能还需要安装对应的文档工具或依赖。做完到右侧产物区或工作目录里打开文件,看看内容、排版是否正常。
需要它联网补资料时,到「设置 → 网络搜索」配置搜索服务,例如 Exa。去对应平台拿搜索 API Key,填好后测试,再检查智能体的搜索工具是否启用。

搜索需要另外配置,也有自己的额度和费用。没接通搜索工具时,模型可能只凭已有知识回答,并没有查网页。
如果搜索找到了网页,但任务还需要点按钮、翻页面、下载文件,就可能要补浏览器操作能力。参考演示里用的是 Playwright CLI 技能,可以在技能管理中查找相应技能,安装后选给智能体。

技能可以理解成一套做事说明,比如怎样操作浏览器、怎样生成文档。有些还需要安装配套工具,按说明配置后,先用一个小任务试试能否运行。
MCP 用来接外部工具和服务,比如让智能体访问某个业务系统。到「设置 → MCP」添加服务,按它提供的说明配置,连接成功后,再到智能体的 MCP 设置里绑定。

整理本地会议记录,用文件工具就够了。浏览器技能和 MCP 等任务需要时再装,省得排查一堆暂时用不上的配置。
技术皮皮虾的演示里,Agent 做过三类任务:寻找并下载电子教材,照范文生成 Word 和 PDF 教学材料,以及把火车转弯例题做成可调参数的互动网页。
布置类似任务时,把教材名称、范文文件、网页要调的参数写清楚。要求越具体,做完越容易核对。
已经在 Codex 里做得顺的任务,可以继续在那里做。Cherry Studio 多给了一种选择:换别家模型试同一项工作,或者为不同用途配不同的工具。
每周整理项目进展,可以复用同一个智能体;换了项目,就新建任务,选对应的文件夹。网页制作另建一个,把需要的工具和要求分开配置。
七、建立知识库
先选一批会反复用到的资料,比如产品手册或历史文章。只为眼前一个问题读一次的文件,直接上传到对话就行,不必专门建库。
建库以后,软件会把资料分成片段。提问时先找相关原文,再交给聊天模型组织答案;资料是单独保存、检索的,没有被训练进模型。
打开左侧「知识库」,点击新增,名称直接写用途,例如「产品售后手册」或「历史文章」。第一次可以把「嵌入模型」设为「不使用」,这样仍能进行关键词检索。

添加一两份内容熟悉的文件,等待处理完成,再看看解析出的文字是否正常。扫描 PDF 尤其要检查,文字没识别出来,后面就查不到。

先到这个知识库的「召回测试」里问一道有明确答案的问题。召回,就是看看它从资料里找回了哪些片段。比如产品手册里写了退换货条件,就问「拆封后还能退吗」,点开结果,看它找到的是否正是那段条件。
这里显示的是找回来的原文片段,可以直接检查有没有找对,不用隔着模型的回答猜。
确认能找对以后,回到对话,点击输入区左下角的添加按钮,选择「知识库」,勾上刚才的库。看到输入区出现知识库名称后,再提问:
1根据选中的产品资料,整理客户最常问的售后问题。23每个回答附上对应来源。4资料没有说明的内容写「资料中未找到」,不要补充承诺。5不同文件说法不一致时,把冲突列出来,不要替我决定采用哪一版。
如果知识库入口是灰色的,先检查当前模型是否支持工具调用,并移除这条消息里附带的文件。知识库至少也要有一份已经处理好的资料。
如果资料一多,换种问法就找不到,可以再加嵌入模型。比如原文写「住宿费标准」,提问写「住酒店最多能报多少」,两边用词差得很远。嵌入模型负责按意思接近程度找内容,不是负责最后写答案的那个聊天模型。
配置方法和前面接模型一样。以硅基流动为例,在「设置 → 模型服务」配置 Key,获取模型列表,找到嵌入类别里的 bge-m3 等模型并添加,模型 ID 以平台实际提供的完整名称为准。
然后回到知识库设置,在「嵌入模型」里选它,等待软件处理资料、建立索引。如果原来已经用了另一种嵌入模型,换模型时要按提示重建。处理完成后,用刚才的问题再测一遍。
加了嵌入模型,关键词检索还在,只是多了一条按意思查找的办法。如果正确内容能找到,却经常排在后面,可以再考虑重排模型。
重排模型会给找回来的片段重新排序,把更相关的往前放。在模型服务中添加重排类别的模型,例如 bge-reranker-v2-m3,然后到知识库设置里选中它。可用模型和收费以服务商页面为准。
嵌入和重排不一定都要配。如果只是查产品型号、条款编号,关键词检索可能已经够用。
出错时也有个简单的排查顺序。完全没找到原文,先看文件有没有处理好、文字有没有缺失;原文找到了但少了前后条件,检查片段是否被切断;正确片段齐全,回答却乱写,再检查提示词或换聊天模型。
旧手册换新手册时,处理掉不再适用的条目,别让两份互相矛盾的版本一直留在库里。还可以专门问一道资料中不存在的问题,看它会不会承认没找到。
需要 Agent 查这些资料,就在智能体的知识库设置里绑定对应的库。比如整理一份产品方案时,把产品手册交给它查,不必把公司的全部文件都绑上去。
用了云端嵌入、重排或聊天模型,相关内容仍可能发往服务商。公司资料导入前,先确认是否允许这样处理。
八、接入本地模型
如果想试开源模型,或者看看限制较少的模型是什么表现,可以让模型直接在自己电脑上运行,再接进 Cherry Studio。聊天时仍用同一个界面,只是回答不再来自云端接口。
常见选择是 Ollama 和 LM Studio,装一个就够。它们负责下载和运行模型,Cherry Studio 负责连接、对话和组织资料。Hugging Face 则是找模型的地方。
先说 Ollama。在 Ollama 官网 下载并安装,打开终端,运行:
1ollama run dolphin-mistral
这是一个可以用来体验的 7B 模型,首次会下载模型文件。下载完后,先在终端里问一句,确认它能回答。
然后打开 Cherry Studio 的「设置 → 模型服务」,找到 Ollama。服务地址通常用:
1http://localhost:11434
启用服务,获取模型列表,添加刚才的模型,再回到对话里选它。

这里的 localhost 指自己的电脑。连接失败时,先确认 Ollama 还在运行、模型已下载,端口也没有改。不要为了让同一台电脑上的两个软件连接,就把服务开放到公网。
不想用终端,可以选 LM Studio。在它的搜索页面找模型、下载,再加载模型并启动本地服务。回到 Cherry Studio,找到 LM Studio 服务商,填入它显示的服务地址,获取模型列表即可。只下载文件、没有加载模型或启动服务,Cherry Studio 还用不了它。
想找大家说的「未审查模型」,可以到 Hugging Face 模型库 搜:
1uncensored GGUF
uncensored 一般是发布者对限制较少的描述,不是统一认证。模型可能更少拒绝某些创作要求,但不代表它更聪明,也不代表它的回答更可靠。Cherry Studio 没有一个能把所有模型「解除限制」的开关,这里是在选择另一个模型。
GGUF 是常见的本地模型文件格式。进入模型页面,先看基础模型、支持的语言和使用许可,再下载适合自己运行工具的文件,不需要下载整个仓库。
第一次可以从 7B 或 8B、Q4 量化的模型试起。B 大致表示参数规模;Q4 表示模型权重经过压缩,通常少占一些内存,也可能损失部分效果。要把它用在 Agent 里,还得确认是否支持工具调用。
小模型可以从普通电脑开始试。上面的 Dolphin Mistral 下载文件约 4 GB;30B 的 Q4 权重可能就有十五六 GB,甚至更大,还没算运行开销和长对话需要的缓存。
16 GB 内存的电脑可以先试 7B、8B 量化模型,实际速度还要看芯片、显存和上下文长度。想跑 30B,除了留够硬盘空间,还要检查内存或显存。聊几句能用,放进长资料后也可能明显变慢。
完全在本地运行时,输入不用发给云端聊天服务,也没有按请求计算的 API 账单,但会占用自己电脑的算力。如果又打开云端搜索、嵌入或重排,相关数据仍可能发出去。
顺便区分一下:Cherry Studio 设置里能下载的本地嵌入、OCR 等组件,是帮忙检索和识别文字的。把它们装好,不等于已经装好了能聊天的大模型。
下次有人给你发来一个新模型的接口,把它接进来,用自己那几道题试一遍。合适,就留着干活;不合适,就换掉,不必连常用的工作台也一起换。
我是 Miles,一名从大厂转型 FDE 的 AI 算法专家,做过算法研发、优化部署,也做过企业培训。关注我@miles_mazy,一起成长,一起赚钱。






