2026-06-12 11:20:09 +08:00
|
|
|
---
|
|
|
|
|
tags: [AI, 多模态, 对话系统, 视觉, 语音交互, 端云协同]
|
|
|
|
|
create time: 2026-06-12 11:13
|
|
|
|
|
---
|
|
|
|
|
|
|
|
|
|
# AI 视觉对话助手
|
|
|
|
|
|
|
|
|
|
## 概述
|
|
|
|
|
|
|
|
|
|
开发一款**多模态实时对话应用**——通过摄像头与麦克风捕获用户的视觉场景与语音输入,由 AI 理解并给出自然、流畅的回应。核心挑战在于视觉理解的准确性、语音交互的自然度,以及端云协同下的成本控制。
|
|
|
|
|
|
|
|
|
|
## 正文
|
|
|
|
|
|
|
|
|
|
### 需求拆解
|
|
|
|
|
|
|
|
|
|
将原始需求拆解为三个技术维度:
|
|
|
|
|
|
|
|
|
|
| 维度 | 关键问题 | 详见 |
|
|
|
|
|
| -------- | ------------------------ | ---- |
|
2026-06-12 11:51:07 +08:00
|
|
|
| **视觉理解** | 如何准确理解摄像头画面中的人物、物体、场景? | [[视觉理解]] |
|
|
|
|
|
| **语音交互** | 如何让对话像真人交流一样自然、低延迟? | [[语音交互]] |
|
|
|
|
|
| **成本控制** | 实时视频流 + LLM 推理,如何避免账单爆炸? | [[成本控制]] |
|
2026-06-12 11:20:09 +08:00
|
|
|
|
|
|
|
|
> [!question] 思考
|
|
|
|
|
> 这三个维度之间存在天然的张力——提升视觉精度意味着更高分辨率和更频繁的采样,但这会直接推高带宽和推理成本。如何在设计中做好取舍?
|
|
|
|
|
|
|
|
|
|
### 项目目标
|
|
|
|
|
|
2026-06-12 11:51:07 +08:00
|
|
|
1. **[[用户故事|用户故事规划]]**:明确"AI 能看、能听、能说"需要覆盖哪些场景
|
|
|
|
|
2. **[[成本控制|成本控制策略]]**:从架构设计层面融入运营成本意识
|
2026-06-12 11:20:09 +08:00
|
|
|
|
|
|
|
|
### 需交付物
|
|
|
|
|
|
|
|
|
|
- 可运行的应用程序(摄像头 + 麦克风 → AI 回应)
|
|
|
|
|
- 设计文档,覆盖:
|
|
|
|
|
- 计划实现 vs 最终实现的用户故事
|
|
|
|
|
- 成本控制技巧的构思 vs 实际采用的方案
|
2026-06-12 14:43:41 +08:00
|
|
|
- [[项目架构与技术栈|项目架构设计]]与技术选型
|
2026-06-12 11:20:09 +08:00
|
|
|
|
|
|
|
|
## 关联笔记
|
2026-06-12 14:43:41 +08:00
|
|
|
- [[项目架构与技术栈]]
|
2026-06-12 15:55:55 +08:00
|
|
|
- [[接口文档]]
|
|
|
|
|
- [[技术选型]]
|
2026-06-12 11:51:07 +08:00
|
|
|
- [[视觉理解]]
|
|
|
|
|
- [[语音交互]]
|
|
|
|
|
- [[成本控制]]
|
|
|
|
|
- [[用户故事]]
|