2026-06-12 11:20:09 +08:00
|
|
|
|
---
|
|
|
|
|
|
tags: [AI, 用户故事, 产品设计, 多模态, 需求分析]
|
|
|
|
|
|
create time: 2026-06-12 11:13
|
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
|
|
# 用户故事
|
|
|
|
|
|
|
|
|
|
|
|
## 概述
|
|
|
|
|
|
|
|
|
|
|
|
用户故事是连接"技术实现"与"真实需求"的桥梁。本节列出 AI 视觉对话助手的典型用户故事,按**优先级分层**,并标注哪些属于 MVP 范围、哪些可后续迭代。
|
|
|
|
|
|
|
|
|
|
|
|
## 正文
|
|
|
|
|
|
|
|
|
|
|
|
### 用户故事全景
|
|
|
|
|
|
|
|
|
|
|
|
```mermaid
|
|
|
|
|
|
graph TD
|
|
|
|
|
|
A["AI 视觉对话助手"] --> B["实时问答"]
|
|
|
|
|
|
A --> C["场景理解"]
|
|
|
|
|
|
A --> D["辅助功能"]
|
|
|
|
|
|
B --> B1["这是什么物体"]
|
|
|
|
|
|
B --> B2["读出屏幕上的文字"]
|
|
|
|
|
|
B --> B3["帮我翻译这个标志"]
|
|
|
|
|
|
C --> C1["描述当前环境"]
|
|
|
|
|
|
C --> C2["识别人物动作"]
|
|
|
|
|
|
D --> D1["视障用户导航辅助"]
|
|
|
|
|
|
D --> D2["实时字幕生成"]
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
### 核心用户故事列表
|
|
|
|
|
|
|
|
|
|
|
|
#### P0 - MVP 必做
|
|
|
|
|
|
|
|
|
|
|
|
| 编号 | 用户故事 | 验收标准 |
|
|
|
|
|
|
|------|---------|---------|
|
|
|
|
|
|
| US-01 | 作为用户,我希望对着摄像头提问"这是什么",AI 能识别画面中的物体并回答 | 准确识别常见物体,响应 < 3s |
|
|
|
|
|
|
| US-02 | 作为用户,我希望用语音与 AI 对话,无需打字 | VAD 准确检测语音,STT 准确率 > 95% |
|
|
|
|
|
|
| US-03 | 作为用户,我希望 AI 能"看到"我摄像头拍到的画面 | 每次提问时自动捕获当前帧 |
|
|
|
|
|
|
| US-04 | 作为用户,我希望 AI 用语音回答我,而不仅是文字 | TTS 自然流畅,延迟 < 1s |
|
|
|
|
|
|
|
|
|
|
|
|
#### P1 - 增强体验
|
|
|
|
|
|
|
|
|
|
|
|
| 编号 | 用户故事 | 验收标准 |
|
|
|
|
|
|
|------|---------|---------|
|
|
|
|
|
|
| US-05 | 作为用户,我希望 AI 能持续"看着"画面,主动提示重要变化 | 关键帧检测 + 主动推送 |
|
|
|
|
|
|
| US-06 | 作为用户,我希望 AI 能读出画面中的文字(OCR) | 中英文混合识别准确率 > 90% |
|
|
|
|
|
|
| US-07 | 作为用户,我希望连续对话时 AI 能记住上下文 | 支持多轮对话,上下文窗口 > 10 轮 |
|
|
|
|
|
|
|
|
|
|
|
|
#### P2 - 进阶探索
|
|
|
|
|
|
|
|
|
|
|
|
| 编号 | 用户故事 | 验收标准 |
|
|
|
|
|
|
|------|---------|---------|
|
|
|
|
|
|
| US-08 | 作为视障用户,我希望 AI 能描述周围环境并提示障碍物 | 实时环境描述 + 安全警告 |
|
|
|
|
|
|
| US-09 | 作为用户,我希望 AI 能翻译画面中的外语内容 | 支持主流语言实时翻译 |
|
|
|
|
|
|
| US-10 | 作为用户,我希望可以切换 AI 的"观察模式"和"对话模式" | 一键切换,模式状态清晰可见 |
|
|
|
|
|
|
|
|
|
|
|
|
### 用户旅程示例
|
|
|
|
|
|
|
|
|
|
|
|
以 US-01 为例,完整的用户旅程:
|
|
|
|
|
|
|
|
|
|
|
|
```mermaid
|
|
|
|
|
|
sequenceDiagram
|
|
|
|
|
|
participant U as User
|
|
|
|
|
|
participant App as Client
|
|
|
|
|
|
participant AI as LLM
|
|
|
|
|
|
|
|
|
|
|
|
U->>App: 打开应用, 授权摄像头
|
|
|
|
|
|
App->>App: 启动摄像头预览
|
|
|
|
|
|
U->>App: 对着花朵说 "这是什么花"
|
|
|
|
|
|
App->>App: VAD 检测语音
|
|
|
|
|
|
App->>App: 捕获当前帧 + STT
|
|
|
|
|
|
App->>AI: 发送图像 + "这是什么花"
|
|
|
|
|
|
AI->>App: "这是一朵红色的玫瑰..."
|
|
|
|
|
|
App->>App: TTS 合成语音
|
|
|
|
|
|
App->>U: 播放语音回答
|
|
|
|
|
|
```
|
|
|
|
|
|
|
|
|
|
|
|
> [!question] 思考
|
|
|
|
|
|
> 用户故事的验收标准中,"响应 < 3s"看似简单,但它约束了整条链路——帧采样、网络传输、LLM 推理、TTS 合成都必须在这个预算内完成。这反过来驱动了架构决策。这就是用户故事的价值:**用体验目标倒推技术方案**。
|
|
|
|
|
|
|
|
|
|
|
|
### 故事优先级决策依据
|
|
|
|
|
|
|
|
|
|
|
|
> [!tip] 如何判断优先级?
|
|
|
|
|
|
> 用两个维度交叉评估:
|
|
|
|
|
|
> - **用户价值**:这个功能对用户有多大帮助?
|
|
|
|
|
|
> - **实现成本**:需要多少开发工作量和 API 调用成本?
|
|
|
|
|
|
>
|
|
|
|
|
|
> P0 = 高价值 + 合理成本(MVP 必须有)
|
|
|
|
|
|
> P1 = 高价值 + 较高成本(第二版加入)
|
|
|
|
|
|
> P2 = 探索性(验证后再投入)
|
|
|
|
|
|
|
|
|
|
|
|
## 关联笔记
|
|
|
|
|
|
|
2026-06-12 11:51:07 +08:00
|
|
|
|
- [[视觉理解]]
|
|
|
|
|
|
- [[语音交互]]
|
|
|
|
|
|
- [[成本控制]]
|