# 用户故事 ## 概述 用户故事按**优先级分层**,标注哪些属于 MVP 范围、哪些可后续迭代。 ## 核心用户故事列表 ### P0 - MVP 必做 | 编号 | 用户故事 | 验收标准 | |------|---------|---------| | US-01 | 对着摄像头提问"这是什么",AI 能识别画面中的物体并回答 | 准确识别常见物体,响应 < 3s | | US-02 | 用语音与 AI 对话,无需打字 | VAD 准确检测语音,STT 准确率 > 95% | | US-03 | AI 能"看到"摄像头拍到的画面 | 每次提问时自动捕获当前帧 | | US-04 | AI 用语音回答,而不仅是文字 | TTS 自然流畅,延迟 < 1s | ### P1 - 增强体验 | 编号 | 用户故事 | 验收标准 | |------|---------|---------| | US-05 | AI 能持续"看着"画面,主动提示重要变化 | 关键帧检测 + 主动推送 | | US-06 | AI 能读出画面中的文字(OCR) | 中英文混合识别准确率 > 90% | | US-07 | 连续对话时 AI 能记住上下文 | 支持多轮对话,上下文窗口 > 10 轮 | ### P2 - 进阶探索 | 编号 | 用户故事 | 验收标准 | |------|---------|---------| | US-08 | 视障用户:AI 描述周围环境并提示障碍物 | 实时环境描述 + 安全警告 | | US-09 | AI 翻译画面中的外语内容 | 支持主流语言实时翻译 | | US-10 | 切换 AI 的"观察模式"和"对话模式" | 一键切换,模式状态清晰可见 | ## 用户旅程示例(US-01) ``` 用户打开应用, 授权摄像头 → 启动摄像头预览 → 对着花朵说 "这是什么花" → VAD 检测语音结束 → 捕获当前帧 + STT 识别 → 发送图像 + "这是什么花" 到 LLM → LLM 返回 "这是一朵红色的玫瑰..." → TTS 合成语音 → 播放语音回答 ``` > "响应 < 3s"这个验收标准约束了整条链路——帧采样、网络传输、LLM 推理、TTS 合成都必须在这个预算内完成。用户故事的价值:**用体验目标倒推技术方案**。 ## 优先级决策依据 用两个维度交叉评估: - **用户价值**:这个功能对用户有多大帮助? - **实现成本**:需要多少开发工作量和 API 调用成本? P0 = 高价值 + 合理成本(MVP 必须有) P1 = 高价值 + 较高成本(第二版加入) P2 = 探索性(验证后再投入)