Files
CamTalk/docs/01-项目概述.md
hhs 10f676f3b4 docs: 扁平化目录结构,优化文档为 Coding Agent 可读格式
- 移除 Obsidian 特有语法(callout、wikilinks、YAML frontmatter)
- 目录结构从 3 层嵌套扁平化为编号文件(01~09)
- 新增 docs/README.md 文档索引与推荐阅读顺序
- 精简冗余解释,保留所有代码块和实现参考
- CLAUDE.md 全面中文化
2026-06-12 17:08:20 +08:00

1.2 KiB

项目概述

概述

开发一款多模态实时对话应用——通过摄像头与麦克风捕获用户的视觉场景与语音输入,由 AI 理解并给出自然、流畅的回应。

核心挑战在于三个维度之间的张力:

维度 关键问题 详见
视觉理解 如何准确理解摄像头画面中的人物、物体、场景? 07-视觉理解.md
语音交互 如何让对话像真人交流一样自然、低延迟? 06-语音交互.md
成本控制 实时视频流 + LLM 推理,如何避免账单爆炸? 08-成本控制.md

提升视觉精度意味着更高分辨率和更频繁的采样,但这会直接推高带宽和推理成本。架构设计需要在三者之间做好取舍。

项目目标

  1. 用户故事规划:明确"AI 能看、能听、能说"需要覆盖哪些场景 → 05-用户故事.md
  2. 成本控制策略:从架构设计层面融入运营成本意识 → 08-成本控制.md

交付物

  • 可运行的应用程序(摄像头 + 麦克风 → AI 回应)
  • 设计文档,覆盖:
    • 计划实现 vs 最终实现的用户故事
    • 成本控制技巧的构思 vs 实际采用的方案
    • 项目架构设计与技术选型