Files
CamTalk/docs/README.md
hhs 032de796c8 docs: 重构文档结构,规范编号并整合冗余内容
## 主要变更

### 文档重构(减少 1199 行,-23%)
- 01-架构设计.md: 503→369 行 (-27%),删除 DDL/配置示例,精简鉴权/存储描述
- 02-接口文档.md: 1313→570 行 (-57%),删除 Go 接口/Orchestrator 实现/配置管理
- 07-成本控制.md: 65→59 行 (-9%),代码块替换为文件引用

### 文档编号规范化
- 08-功能创意.md → 删除(内容整合到 README.md "功能扩展方向")
- 10-Eino框架与编排设计.md → 08-Eino框架与编排设计.md
- 情景切换.md → 09-情景切换.md
- 12-鉴权体系.md → 10-鉴权体系.md
- 13-令牌桶限流.md → 11-令牌桶限流.md

### 交叉引用更新
- 01-架构设计.md: 更新对鉴权体系/令牌桶限流的引用为新编号
- README.md: 更新文档索引表、推荐阅读顺序、新增功能扩展方向

### 删除过时文档
- 09-技术名词解释.md(内容已整合到 03-技术选型.md)
- 10-Eino重构方案.md(历史记录,已完成)
- 11-Eino框架技术文档.md(已合并到 08)
- 情景切换功能完整文档.md(已规范化为 09)

## 重构原则
- 架构文档聚焦系统结构,移除实现细节
- 接口文档保留纯契约,删除内部实现
- 编号连续(01-11),语义清晰
- 通过交叉引用连接相关文档,避免重复
2026-06-21 14:48:03 +08:00

2.6 KiB
Raw Blame History

CamTalk 设计文档

CamTalk 是一款多模态实时 AI 视觉对话助手。用户通过摄像头和麦克风与 AI 交互AI 理解视觉场景和语音输入后,以文字和语音形式给出自然回应。

文档索引

文档 说明
01-架构设计 系统架构、技术栈、模块设计、数据库、部署架构(含 Mermaid 图)
02-接口文档 WebSocket 协议、REST API、AI 服务层、Eino 编排器、Session Manager、配置管理、数据模型、错误码
03-技术选型 各技术的选型对比与决策理由(含 Eino 框架选型、关键技术术语)
04-用户故事 P0/P1/P2 用户故事、验收标准
05-语音交互 VAD → STT → LLM → TTS 全链路、延迟优化
06-视觉理解 帧采样策略、图像编码、多模态 LLM 输入机制
07-成本控制 智能采样、端云协同、模型分级、缓存复用
08-Eino框架与编排设计 Eino 框架核心概念、Graph 设计、节点实现、测试策略
09-情景切换 多情景 AI 角色扮演系统(面试官、英语老师、辩论对手、翻译员、自由对话)
10-鉴权体系 JWT 双 token 轮转认证、bcrypt 密码哈希、Refresh Token Rotation、安全机制
11-令牌桶限流 令牌桶限流算法、内存/Redis 双实现、Gin 中间件、WebSocket query 限流

推荐阅读顺序

  1. 01-架构设计 — 理解三层架构、技术栈和模块全貌
  2. 02-接口文档 — 前后端通信契约,实现时的最高依据
  3. 03-技术选型 — 了解为什么选这些技术(含 Eino 框架、关键技术术语)
  4. 04-用户故事 — 明确功能优先级
  5. 05~07 — 各技术领域的详细设计
  6. 08-Eino框架与编排设计 — Eino 框架核心概念、Graph 编排、节点实现
  7. 09-情景切换 — 多情景 AI 角色扮演系统
  8. 10-鉴权体系 — 认证授权机制详细设计
  9. 11-令牌桶限流 — 速率限制设计

功能扩展方向

以下是未来可能的功能创意和扩展方向:

  1. 视频录制 — 支持录制对话过程中的视频画面
  2. 对话翻译 — 实时多语言翻译能力
  3. 对话总结 — 自动生成对话摘要和关键点
  4. 手动对话功能 — 支持用户手动触发对话而非自动 VAD
  5. 视频框自定义 — 视频框大小可调整,支持最小化和拖动