App 使用指南
本文介绍 ParrotClaw App 的各个界面和功能的使用方式。
概览
ParrotClaw 是一个对话式 AI 数字员工 App。核心界面分为几个 Tab:
| Tab | 说明 |
|---|---|
| 💬 对话 | AI 聊天主界面,支持文字、图片、语音、文件 |
| 🎙️ 语音 | 纯语音交互界面,对话即按即说 |
| 👤 数字人 | Live2D 数字人对话,有表情和口型 |
| ⚙️ 设置 | 服务器管理、语音配置、关于页面 |
对话界面
基本操作
打开 App 默认进入对话界面。底部输入框支持:
- 文字输入 — 像聊天一样打字
- 语音输入 — 点击录音按钮开始录音,停止说话后自动发送
- 图片发送 — 点击 + 从相册选择或拍照
- 文件发送 — 点击 + 选择文件(音频、文档等)
消息类型
App 支持多种消息格式的渲染:
| 消息类型 | 显示方式 |
|---|---|
| 文本 | 聊天气泡,支持 Markdown |
| 流式文本 | Agent 逐字输出时的渐进式显示 |
| 图片 | 内嵌显示,点击可放大 |
| 音频 | 播放器控件,支持播放/暂停/进度调节 |
| 视频 | 视频播放器(支持平台原生播放器) |
| 文件 | 文件卡片,点击可预览或保存 |
| 系统消息 | 连接状态、错误提示等 |
回复框操作
发送文字和语音之外,输入框左侧的 "+" 按钮展开更多操作:
- 📷 拍照 — 调用相机拍照并发送
- 🖼️ 相册 — 从相册选择图片
- 📎 文件 — 从文件管理器选择文件
- 🎤 语音输入 — 点击开始录音,停止说话后自动发送
长按消息
长按任意消息弹出操作菜单:
- 复制 — 复制消息文本
语音界面
语音界面提供纯语音交互体验:
- 点击中央的麦克风按钮开始录音
- 对着麦克风说话
- 停止说话后自动检测静默,语音自动发送
- Agent 回复后,TTS 自动朗读
语音界面需要配置离线 ASR(SenseVoice 模型)和 TTS。详见 OpenClaw 配置指南。
语音设置
在设置中可以调整:
- TTS 模式 — 选择使用 OpenClaw 端 TTS 还是 Flutter 端本地 TTS(flutter_tts)
- 语音打断 — 是否允许说话时打断 Agent 的 TTS 回复
数字人界面
Live2D 数字人通过 WebView 渲染,支持:
- 口型同步 — TTS 播放时嘴唇随语音同步
使用前提
数字人正常工作需要:
- Live2D 模型文件 已放置在
assets/live2d/Resources/目录下 - TTS 配置 正常(数字人朗读需要 TTS 音频)
- 音频格式 为 44100Hz、16-bit、单声道 PCM WAV(Live2D 播放器的硬性要求)
音频格式说明
如果使用 tts-wrapper.sh 脚本方案,wrapper 会自动用 ffmpeg 转码为正确格式。如果直接使用 edge-tts(不经过 wrapper),需要确认输出格式符合要求:
bash
# 检查音频格式
ffprobe /path/to/audio.wav
# Sample Rate = 44100 Hz, Channels = 1 (mono)如格式不符,用 ffmpeg 转码:
bash
ffmpeg -y -i input.wav -acodec pcm_s16le -ar 44100 -ac 1 output.wav多服务器管理
ParrotClaw 支持同时配置多台服务器,在 App 内一键切换。
添加服务器
- 进入 设置 → 服务器配置
- 点击 添加服务器
- 填写服务器信息:
| 字段 | 说明 | 示例 |
|---|---|---|
| 名称 | 自定义名称 | "OpenClaw" |
| 地址 | OpenClaw Gateway 的 WebSocket 地址 | 192.168.1.100 |
| 端口 | OpenClaw Gateway 端口 | 18789 |
| Token | 认证 token | e939... |
切换服务器
配置多台服务器后,在对话界面点击顶部服务器名称,即可在弹出的列表中切换。
应用场景
- 多地点部署 — 可以家里一台负责个人需求,公司一台负责工作
- 功能隔离 — 生图设备建议16G显存(带 ComfyUI)
设置界面
主题
- 深色模式 — 护眼暗色主题
语言
当前支持:中文。(将会开发英文版)
数据管理
- 清除聊天记录 — 删除所有聊天记录
- 管理模型文件 — 删除APP会清除ASR模型文件
关于
显示 App 版本号、开源协议、作者信息、致谢列表。
快捷键(桌面版)
macOS 桌面版支持以下快捷键:
| 快捷键 | 功能 |
|---|---|
Enter | 发送消息 |
Shift + Enter | 换行 |
常见操作流程
流程一:生成图片
- 在对话界面输入:"帮我画一只橘猫"
- Agent 接收后调用 ComfyUI 生成
- 图片生成后自动显示在聊天中
- 如果效果不理想,继续对话调整 prompt
流程二:会议记录
- 打开录音功能
- 告诉 Agent:"帮我把这段录音整理成会议纪要"
- Agent 生成结构化纪要
- 纪要生成后可以要求导出
流程三:知识问答
- 在设置中配置好知识库(需 OpenClaw 端配置)
- 对话中提问:"我们公司的离职流程是什么?"
- Agent 从知识库中检索并回答
- 可以追问更多细节
流程四:文章发布
- 在设置中配置好掘金等平台的 Skills
- 对话中:"把 workspace 里的 文章.md 发布到掘金"
- Agent 自动打开浏览器、登录、发布
- 默认发布为草稿,确认无误后再公开发布