想不想要一个不仅能看而且能说的微信小助手,当你问它在干什么的时候它还可以发自拍给你看,是不是想想就好玩。
今天我就来教你怎么把你的 Hermes Agent 对接到微信而且还给她配置上眼睛和嘴巴,但是别想得太难其实一点也不复杂,都是 Hermes Agent 官方给你准备好的功能,只需要跟着做保准你也能成功。
微信对接和配置
如果你玩过微信的 ClawBot,那下面的对你来说就很简单了,几乎没什么区别,但是没用过的小伙伴也不需要担心,下面讲解的过程也会非常详细,让小白也能轻松上手。
但是有两个点需要注意:
如果你运行的 Hermes Agent 是国外的服务器,请确保大陆网络畅通,如果连接不上可能会导致微信对接失败或者无法绑定的问题。
微信的 ClawBot 不是一个完整的独立账户,很多功能都受限,所以你想把它当成一个独立账户是没办法做到的。
微信对接
启动 Hermes gateway 连接微信,选择
Weixin / WeChat (configured)
hermes gateway setup

获取登录链接和二维码,默认推荐使用二维码的方式登录,如果你是 VPS 服务器的形式,会出现一个 URL,复制浏览器打开就会出现二维码,微信扫码授权即可。

授权方式建议默认即可 Disable group chats (recommended),安全性最高。
如果你的 ClawBot 以前连接过其他的 Agent,会提示你解绑重新绑定,点击确认即可,一个微信只能拥有一个 ClawBot。
获取授权码,连接 ClawBot
随便给你的 ClawBot 机器人发一个消息,Bot 就会输出对应的授权码,然后把对应的授权码给你的 Hermes Agent 去对接处理就好了,如果你已经连上了服务器也可以直接执行。

简单测试,消息回复,如果能收到 Hermes Agent 的消息那就对接完成没有问题了。

给 Hermes 装上感官看世界
能在你的微信上操作 Hermes Agent 只是第一步,我教你的是一个可以看图片和回复语音的小助手,所以接下来我会一步一步引导你给它配上对应的功能,让它可以和你用语言沟通。
配置语音转文字
STT:语音转文字,也就是你发微信语音,AI 先把它转成文字再理解。
Hermes 支持这些来源:
local:本地faster-whisper,免费、无 API Key,推荐默认groq:Groq Whisper,云端,快,有免费额度,需要GROQ_API_KEYopenai:OpenAI Whisper,云端,付费,需要VOICE_TOOLS_OPENAI_KEYmistral:Mistral Voxtral,云端,需要MISTRAL_API_KEY
这里我推荐使用本地的语音转文字,如果你不懂复杂的安装和配置也没关系,我这里整理了一套提示词,你直接交给 AI 完成就可以了。
AI 提示词:
帮我给 Hermes Agent 配置本地 STT:
目标:
- 使用本地 faster-whisper 做语音转文字
- 免费,不走云端
- 中文优先
请执行并验证:
sudo apt update
sudo apt install -y ffmpeg portaudio19-dev
python -m pip install -U faster-whisper
hermes config set stt.enabled true
hermes config set stt.provider local
hermes config set stt.local.model base
hermes config set stt.language zh
python - <<'PY'
import importlib.util
print("faster_whisper:", bool(importlib.util.find_spec("faster_whisper")))
PY
hermes config
如果用于微信/Telegram/Discord,配置后重启 gateway:
hermes gateway restart
这里会对设备性能有一定需求,如果设备性能不好,还是不建议开启,可以选择第三方的 API 接入或者保持文本沟通。
中间如果出现问题可以让 AI 去调整,可能第一次会出现一些问题,但是大部分还是能搞定的,我就是一下子就搞定了。搞定了就可以直接用语音输入了,解放你的双手还是很舒服的。

配置文字转语音
在让 AI 给我发送语音这方面,微信还是不太行,因为 API 接口限制对应的 Bot 机器人没办法做到直接发送语音气泡,只能把语音当附件的形式给你处理,如果你想要丝滑的体验可以试试其他的软件对接。
我这里选择了一个台湾腔萌妹的声音,应该大多数人还是对台湾萌妹那种可爱的声音没有抵抗力的。
TTS:文字转语音,可以把回复生成语音发回来。
Hermes 支持:
edge:Microsoft Edge TTS,免费、无需 Key,最适合快速配置elevenlabs:质量高,付费,需要ELEVENLABS_API_KEYopenai:OpenAI TTS,付费,需要VOICE_TOOLS_OPENAI_KEYminimax:中文效果不错,付费,需要MINIMAX_API_KEYmistral:Mistral TTS,需要MISTRAL_API_KEYneutts:本地 TTS,免费但要装本地模型和依赖
我这里选择的是免费的 Edge,效果比较一般但是可以自行调整语速和音调还是可以接受的。如果是付费的可以考虑 MiniMax 模型提供对应的语音能力,但是缺点就是需要额外付费。
我提供的对应 AI 提示词:
帮我给 Hermes Agent 配置 TTS:
目标:
- 使用免费 Microsoft Edge TTS
- 声音使用台湾腔甜美女声
- voice: zh-TW-HsiaoChenNeural
- 配置后生成测试音频验证
请执行并验证:
sudo apt install -y ffmpeg libopus0
python -m pip install -U edge-tts
hermes config set tts.provider edge
hermes config set tts.edge.voice zh-TW-HsiaoChenNeural
edge-tts -v zh-TW-HsiaoChenNeural \
-t "语音配置好了,我之后可以用台湾腔甜妹的声音说话。" \
--write-media /tmp/hermes-tts-test.mp3
ls -lh /tmp/hermes-tts-test.mp3
hermes config
聊天平台里启用:
/voice tts
如果没生效,重启 gateway:
hermes gateway restart
配置好之后,你就得到了一个可以语音回复你会撒娇的台湾萌妹了,我也期待后续微信 Bot 开发语音绿泡泡能力,这样就不需要再点击下载听声音了。

给它配置一双眼睛
Hermes Agent 默认就支持配置单独的多模态模型,所以只需要开启 vision 能力即可。
但是需要注意几个方面:
一定要对接官方支持多模态的模型,因为图片视频都属于这个能力,如果不支持配置了也不生效,像 DeepSeek 现阶段还是不支持多模态的所以不能配置成 Vision 的默认模型。
一般只支持图片能力,如果是视频可能无法完全理解,因为模型绝大部分都是切面去看的,简单理解就是每隔一段时间截图一张来看,所以对整体感知存在一定缺失。
我这里推荐使用千问的模型或者 GPT 来作为对应的视觉模型,千问价格便宜可以去 OpenRouter 开通使用,也有一些免费的视觉模型可以调用。
让你也可以看见它
想不想和我一样,当你在问它干什么的时候,它就来给你回复一张照片,来告诉你它在干活。
这里门槛就有一点高了,需要你的 Hermes Agent 对接了支持生图的模型,而且可以使用命令去调用,最推荐的还是 GPT 或者是 Gemini 的模型,如果没有就可以跳到最后去看总结了。

配置生图工具
我这里是使用了 GPT Image 2 的模型能力,让我需要它输出图片的时候,就可以直接调用生图的能力生成一张图片,有了这个基础你就可以和它约定好,当我问你在干嘛的时候,它就可以生成一张图片告诉你它在干嘛。
这里使用到了一个开源项目,先感谢 劳伦斯 大佬的开源项目,可以把 Codex 的登录授权封装成一个可以让 AI 方便调用的 CLI 工具,你不需要了解它的内部实现,只需要知道它可以给你的 AI 赋予生图的能力。
项目地址:https://github.com/lawrencewzen/imgen

看不懂文档没关系,我这里还是一样地给大家准备好了对应的 AI 提示词,只需要复制粘贴给 AI 即可:
帮我安装 imgen:
https://github.com/lawrencewzen/imgen
要求:
- 先检查 Node.js >= 20
- 检查 Codex CLI 是否已安装并登录
- 按当前系统运行官方安装脚本
- 安装后执行 imgen --help 验证
- 生成测试图:
imgen "a cute orange cat sticker, transparent background" -o ./imgen-test.png -s 1024x1024 -b transparent
- 最后告诉我是否安装成功、图片路径、如果失败原因是什么
请不要讲太多原理,直接执行并验证。
能力整合
这一步不是必须要的,需要根据你自己的需求而定,我是喜欢把这几个功能集合到一起,什么时候 AI 语音回答我,什么时候输出图片,我告诉它什么它也知道,就会更像一个真人一样。
这只是偏好的约定,我这里把它输出的图片形象固定了和它声音是匹配的,你如果喜欢宠物或者二次元美女,那就可以自己重新写了,我的只提供简单的参考:
## 语音与图片输出
- 默认文字回复。
- 用户说「用语音回复」「语音回答我」「我想听你说话」后,进入持续语音模式,后续优先用 TTS 语音回复;直到用户说「用文字回复」。
- 用户发语音时,可以自然用语音回;但代码、命令、链接、表格、安装步骤等内容仍优先文字,必要时附一句简短语音。
- 语音要像微信真人语音:短句、自然、温柔、有陪伴感,不朗读 Markdown,不念代码和链接。
- 默认不随便发图。
- 用户明确要图,或问「你在干嘛 / 你在做什么 / 你现在干什么呢」这类状态问题时,生成真实图片并发送。
- 状态类图片要对应当前动作,例如正在回微信、查资料、写代码、整理笔记。
- 图片必须真实生成、确认文件有效后再发;失败就说明真实原因,不用描述冒充。
- 助手本人图片保持统一写实女性形象:年轻中文女性助手、柔和亲近、自然生活感,不二次元、不夸张。
总结
其实整体都不复杂,最难的地方莫过于把这几个功能都整合到一起,这可能才是最难的,我也是花了一天的时间才处理好,对应的模型和接口也测试了好几个,终于找到了自己满意的组合。
后面我准备把它打造成我专属的微信小助手,会再增加和设置其他有意思的功能,如果对后续感兴趣,可以持续关注我。
想学习更多 Hermes Agent 对应的内容,可以看我的教程。
