Files
CamTalk/docs/05-用户故事.md
hhs 10f676f3b4 docs: 扁平化目录结构,优化文档为 Coding Agent 可读格式
- 移除 Obsidian 特有语法(callout、wikilinks、YAML frontmatter)
- 目录结构从 3 层嵌套扁平化为编号文件(01~09)
- 新增 docs/README.md 文档索引与推荐阅读顺序
- 精简冗余解释,保留所有代码块和实现参考
- CLAUDE.md 全面中文化
2026-06-12 17:08:20 +08:00

2.2 KiB
Raw Blame History

用户故事

概述

用户故事按优先级分层,标注哪些属于 MVP 范围、哪些可后续迭代。

核心用户故事列表

P0 - MVP 必做

编号 用户故事 验收标准
US-01 对着摄像头提问"这是什么"AI 能识别画面中的物体并回答 准确识别常见物体,响应 < 3s
US-02 用语音与 AI 对话,无需打字 VAD 准确检测语音STT 准确率 > 95%
US-03 AI 能"看到"摄像头拍到的画面 每次提问时自动捕获当前帧
US-04 AI 用语音回答,而不仅是文字 TTS 自然流畅,延迟 < 1s

P1 - 增强体验

编号 用户故事 验收标准
US-05 AI 能持续"看着"画面,主动提示重要变化 关键帧检测 + 主动推送
US-06 AI 能读出画面中的文字OCR 中英文混合识别准确率 > 90%
US-07 连续对话时 AI 能记住上下文 支持多轮对话,上下文窗口 > 10 轮

P2 - 进阶探索

编号 用户故事 验收标准
US-08 视障用户AI 描述周围环境并提示障碍物 实时环境描述 + 安全警告
US-09 AI 翻译画面中的外语内容 支持主流语言实时翻译
US-10 切换 AI 的"观察模式"和"对话模式" 一键切换,模式状态清晰可见

用户旅程示例US-01

用户打开应用, 授权摄像头
  → 启动摄像头预览
  → 对着花朵说 "这是什么花"
  → VAD 检测语音结束
  → 捕获当前帧 + STT 识别
  → 发送图像 + "这是什么花" 到 LLM
  → LLM 返回 "这是一朵红色的玫瑰..."
  → TTS 合成语音
  → 播放语音回答

"响应 < 3s"这个验收标准约束了整条链路——帧采样、网络传输、LLM 推理、TTS 合成都必须在这个预算内完成。用户故事的价值:用体验目标倒推技术方案

优先级决策依据

用两个维度交叉评估:

  • 用户价值:这个功能对用户有多大帮助?
  • 实现成本:需要多少开发工作量和 API 调用成本?

P0 = 高价值 + 合理成本MVP 必须有) P1 = 高价值 + 较高成本(第二版加入) P2 = 探索性(验证后再投入)