Files
note/课题一/AI 视觉对话助手.md
2026-06-12 15:36:35 +08:00

1.8 KiB

tags, create time
tags create time
AI
多模态
对话系统
视觉
语音交互
端云协同
2026-06-12 11:13

AI 视觉对话助手

概述

开发一款多模态实时对话应用——通过摄像头与麦克风捕获用户的视觉场景与语音输入,由 AI 理解并给出自然、流畅的回应。核心挑战在于视觉理解的准确性、语音交互的自然度,以及端云协同下的成本控制。

正文

需求拆解

将原始需求拆解为三个技术维度:

维度 关键问题 详见
视觉理解 如何准确理解摄像头画面中的人物、物体、场景? 视觉理解
语音交互 如何让对话像真人交流一样自然、低延迟? 语音交互
成本控制 实时视频流 + LLM 推理,如何避免账单爆炸? 成本控制

[!question] 思考 这三个维度之间存在天然的张力——提升视觉精度意味着更高分辨率和更频繁的采样,但这会直接推高带宽和推理成本。如何在设计中做好取舍?

项目目标

  1. 用户故事:明确"AI 能看、能听、能说"需要覆盖哪些场景
  2. 成本控制:从架构设计层面融入运营成本意识

需交付物

  • 可运行的应用程序(摄像头 + 麦克风 → AI 回应)
  • 设计文档,覆盖:
    • 计划实现 vs 最终实现的用户故事
    • 成本控制技巧的构思 vs 实际采用的方案
    • 项目架构与技术栈与技术选型

关联笔记