目 录CONTENT

文章目录

Hermes Agent 进阶:打造你的专属微信女友

传家宝VPS
2026-07-31 / 0 评论 / 0 点赞 / 6 阅读 / 0 字
RackNerd Mobile Leaderboard Banner

想不想要一个不仅能看而且能说的微信小助手,当你问它在干什么的时候它还可以发自拍给你看,是不是想想就好玩。

今天我就来教你怎么把你的 Hermes Agent 对接到微信而且还给她配置上眼睛和嘴巴,但是别想得太难其实一点也不复杂,都是 Hermes Agent 官方给你准备好的功能,只需要跟着做保准你也能成功。

微信对接和配置

如果你玩过微信的 ClawBot,那下面的对你来说就很简单了,几乎没什么区别,但是没用过的小伙伴也不需要担心,下面讲解的过程也会非常详细,让小白也能轻松上手。

但是有两个点需要注意:

  1. 如果你运行的 Hermes Agent 是国外的服务器,请确保大陆网络畅通,如果连接不上可能会导致微信对接失败或者无法绑定的问题。

  2. 微信的 ClawBot 不是一个完整的独立账户,很多功能都受限,所以你想把它当成一个独立账户是没办法做到的。

微信对接

  1. 启动 Hermes gateway 连接微信,选择 Weixin / WeChat (configured)

hermes gateway setup
file-20260731145042489.webp
  1. 获取登录链接和二维码,默认推荐使用二维码的方式登录,如果你是 VPS 服务器的形式,会出现一个 URL,复制浏览器打开就会出现二维码,微信扫码授权即可。

file-20260731145042487.webp

授权方式建议默认即可 Disable group chats (recommended),安全性最高。

如果你的 ClawBot 以前连接过其他的 Agent,会提示你解绑重新绑定,点击确认即可,一个微信只能拥有一个 ClawBot。

  1. 获取授权码,连接 ClawBot

随便给你的 ClawBot 机器人发一个消息,Bot 就会输出对应的授权码,然后把对应的授权码给你的 Hermes Agent 去对接处理就好了,如果你已经连上了服务器也可以直接执行。

file-20260731145042485.webp
  1. 简单测试,消息回复,如果能收到 Hermes Agent 的消息那就对接完成没有问题了。

file-20260731145042482.webp

给 Hermes 装上感官看世界

能在你的微信上操作 Hermes Agent 只是第一步,我教你的是一个可以看图片和回复语音的小助手,所以接下来我会一步一步引导你给它配上对应的功能,让它可以和你用语言沟通。

配置语音转文字

STT:语音转文字,也就是你发微信语音,AI 先把它转成文字再理解。

Hermes 支持这些来源:

  • local:本地 faster-whisper,免费、无 API Key,推荐默认

  • groq:Groq Whisper,云端,快,有免费额度,需要 GROQ_API_KEY

  • openai:OpenAI Whisper,云端,付费,需要 VOICE_TOOLS_OPENAI_KEY

  • mistral:Mistral Voxtral,云端,需要 MISTRAL_API_KEY

这里我推荐使用本地的语音转文字,如果你不懂复杂的安装和配置也没关系,我这里整理了一套提示词,你直接交给 AI 完成就可以了。

AI 提示词:
帮我给 Hermes Agent 配置本地 STT:

目标:
- 使用本地 faster-whisper 做语音转文字
- 免费,不走云端
- 中文优先

请执行并验证:

sudo apt update
sudo apt install -y ffmpeg portaudio19-dev
python -m pip install -U faster-whisper

hermes config set stt.enabled true
hermes config set stt.provider local
hermes config set stt.local.model base
hermes config set stt.language zh

python - <<'PY'
import importlib.util
print("faster_whisper:", bool(importlib.util.find_spec("faster_whisper")))
PY

hermes config

如果用于微信/Telegram/Discord,配置后重启 gateway:
hermes gateway restart

这里会对设备性能有一定需求,如果设备性能不好,还是不建议开启,可以选择第三方的 API 接入或者保持文本沟通。

中间如果出现问题可以让 AI 去调整,可能第一次会出现一些问题,但是大部分还是能搞定的,我就是一下子就搞定了。搞定了就可以直接用语音输入了,解放你的双手还是很舒服的。

file-20260731145042479.webp

配置文字转语音

在让 AI 给我发送语音这方面,微信还是不太行,因为 API 接口限制对应的 Bot 机器人没办法做到直接发送语音气泡,只能把语音当附件的形式给你处理,如果你想要丝滑的体验可以试试其他的软件对接。

我这里选择了一个台湾腔萌妹的声音,应该大多数人还是对台湾萌妹那种可爱的声音没有抵抗力的。

TTS:文字转语音,可以把回复生成语音发回来。

Hermes 支持:

  • edge:Microsoft Edge TTS,免费、无需 Key,最适合快速配置

  • elevenlabs:质量高,付费,需要 ELEVENLABS_API_KEY

  • openai:OpenAI TTS,付费,需要 VOICE_TOOLS_OPENAI_KEY

  • minimax:中文效果不错,付费,需要 MINIMAX_API_KEY

  • mistral:Mistral TTS,需要 MISTRAL_API_KEY

  • neutts:本地 TTS,免费但要装本地模型和依赖

我这里选择的是免费的 Edge,效果比较一般但是可以自行调整语速和音调还是可以接受的。如果是付费的可以考虑 MiniMax 模型提供对应的语音能力,但是缺点就是需要额外付费。

我提供的对应 AI 提示词:

帮我给 Hermes Agent 配置 TTS:

目标:
- 使用免费 Microsoft Edge TTS
- 声音使用台湾腔甜美女声
- voice: zh-TW-HsiaoChenNeural
- 配置后生成测试音频验证

请执行并验证:

sudo apt install -y ffmpeg libopus0
python -m pip install -U edge-tts

hermes config set tts.provider edge
hermes config set tts.edge.voice zh-TW-HsiaoChenNeural

edge-tts -v zh-TW-HsiaoChenNeural \
  -t "语音配置好了,我之后可以用台湾腔甜妹的声音说话。" \
  --write-media /tmp/hermes-tts-test.mp3

ls -lh /tmp/hermes-tts-test.mp3
hermes config

聊天平台里启用:
/voice tts

如果没生效,重启 gateway:
hermes gateway restart

配置好之后,你就得到了一个可以语音回复你会撒娇的台湾萌妹了,我也期待后续微信 Bot 开发语音绿泡泡能力,这样就不需要再点击下载听声音了。

file-20260731145042477.webp

给它配置一双眼睛

Hermes Agent 默认就支持配置单独的多模态模型,所以只需要开启 vision 能力即可。

但是需要注意几个方面:

  1. 一定要对接官方支持多模态的模型,因为图片视频都属于这个能力,如果不支持配置了也不生效,像 DeepSeek 现阶段还是不支持多模态的所以不能配置成 Vision 的默认模型。

  2. 一般只支持图片能力,如果是视频可能无法完全理解,因为模型绝大部分都是切面去看的,简单理解就是每隔一段时间截图一张来看,所以对整体感知存在一定缺失。

我这里推荐使用千问的模型或者 GPT 来作为对应的视觉模型,千问价格便宜可以去 OpenRouter 开通使用,也有一些免费的视觉模型可以调用。

让你也可以看见它

想不想和我一样,当你在问它干什么的时候,它就来给你回复一张照片,来告诉你它在干活。

这里门槛就有一点高了,需要你的 Hermes Agent 对接了支持生图的模型,而且可以使用命令去调用,最推荐的还是 GPT 或者是 Gemini 的模型,如果没有就可以跳到最后去看总结了。

file-20260731145042475.webp

配置生图工具

我这里是使用了 GPT Image 2 的模型能力,让我需要它输出图片的时候,就可以直接调用生图的能力生成一张图片,有了这个基础你就可以和它约定好,当我问你在干嘛的时候,它就可以生成一张图片告诉你它在干嘛。

这里使用到了一个开源项目,先感谢 劳伦斯 大佬的开源项目,可以把 Codex 的登录授权封装成一个可以让 AI 方便调用的 CLI 工具,你不需要了解它的内部实现,只需要知道它可以给你的 AI 赋予生图的能力。

项目地址:https://github.com/lawrencewzen/imgen

file-20260731145042472.webp

看不懂文档没关系,我这里还是一样地给大家准备好了对应的 AI 提示词,只需要复制粘贴给 AI 即可:

帮我安装 imgen:
https://github.com/lawrencewzen/imgen

要求:
- 先检查 Node.js >= 20
- 检查 Codex CLI 是否已安装并登录
- 按当前系统运行官方安装脚本
- 安装后执行 imgen --help 验证
- 生成测试图:
  imgen "a cute orange cat sticker, transparent background" -o ./imgen-test.png -s 1024x1024 -b transparent
- 最后告诉我是否安装成功、图片路径、如果失败原因是什么

请不要讲太多原理,直接执行并验证。

能力整合

这一步不是必须要的,需要根据你自己的需求而定,我是喜欢把这几个功能集合到一起,什么时候 AI 语音回答我,什么时候输出图片,我告诉它什么它也知道,就会更像一个真人一样。

这只是偏好的约定,我这里把它输出的图片形象固定了和它声音是匹配的,你如果喜欢宠物或者二次元美女,那就可以自己重新写了,我的只提供简单的参考:

## 语音与图片输出

- 默认文字回复。
- 用户说「用语音回复」「语音回答我」「我想听你说话」后,进入持续语音模式,后续优先用 TTS 语音回复;直到用户说「用文字回复」。
- 用户发语音时,可以自然用语音回;但代码、命令、链接、表格、安装步骤等内容仍优先文字,必要时附一句简短语音。
- 语音要像微信真人语音:短句、自然、温柔、有陪伴感,不朗读 Markdown,不念代码和链接。

- 默认不随便发图。
- 用户明确要图,或问「你在干嘛 / 你在做什么 / 你现在干什么呢」这类状态问题时,生成真实图片并发送。
- 状态类图片要对应当前动作,例如正在回微信、查资料、写代码、整理笔记。
- 图片必须真实生成、确认文件有效后再发;失败就说明真实原因,不用描述冒充。
- 助手本人图片保持统一写实女性形象:年轻中文女性助手、柔和亲近、自然生活感,不二次元、不夸张。

总结

其实整体都不复杂,最难的地方莫过于把这几个功能都整合到一起,这可能才是最难的,我也是花了一天的时间才处理好,对应的模型和接口也测试了好几个,终于找到了自己满意的组合。

后面我准备把它打造成我专属的微信小助手,会再增加和设置其他有意思的功能,如果对后续感兴趣,可以持续关注我。

想学习更多 Hermes Agent 对应的内容,可以看我的教程。

广告 广告
博主关闭了所有页面的评论