- 移除 Obsidian 特有语法(callout、wikilinks、YAML frontmatter) - 目录结构从 3 层嵌套扁平化为编号文件(01~09) - 新增 docs/README.md 文档索引与推荐阅读顺序 - 精简冗余解释,保留所有代码块和实现参考 - CLAUDE.md 全面中文化
29 lines
1.2 KiB
Markdown
29 lines
1.2 KiB
Markdown
# 项目概述
|
|
|
|
## 概述
|
|
|
|
开发一款**多模态实时对话应用**——通过摄像头与麦克风捕获用户的视觉场景与语音输入,由 AI 理解并给出自然、流畅的回应。
|
|
|
|
核心挑战在于三个维度之间的张力:
|
|
|
|
| 维度 | 关键问题 | 详见 |
|
|
|------|---------|------|
|
|
| 视觉理解 | 如何准确理解摄像头画面中的人物、物体、场景? | `07-视觉理解.md` |
|
|
| 语音交互 | 如何让对话像真人交流一样自然、低延迟? | `06-语音交互.md` |
|
|
| 成本控制 | 实时视频流 + LLM 推理,如何避免账单爆炸? | `08-成本控制.md` |
|
|
|
|
> 提升视觉精度意味着更高分辨率和更频繁的采样,但这会直接推高带宽和推理成本。架构设计需要在三者之间做好取舍。
|
|
|
|
## 项目目标
|
|
|
|
1. **用户故事规划**:明确"AI 能看、能听、能说"需要覆盖哪些场景 → `05-用户故事.md`
|
|
2. **成本控制策略**:从架构设计层面融入运营成本意识 → `08-成本控制.md`
|
|
|
|
## 交付物
|
|
|
|
- 可运行的应用程序(摄像头 + 麦克风 → AI 回应)
|
|
- 设计文档,覆盖:
|
|
- 计划实现 vs 最终实现的用户故事
|
|
- 成本控制技巧的构思 vs 实际采用的方案
|
|
- 项目架构设计与技术选型
|