## Why 学习页视频舞台仍用原生控件 + 右下角 AI FAB,无法支撑「看画面提问 / 听上一句 / 语音通话 / 投屏通话」的儿童学习闭环。需要在 iPad 与 PC 上统一底部波形+工具条,并把 AI 能力拆成可触达的专用入口,同时用可负担的实时多模态方案(而非全量 30fps 推流)对齐豆包/通义类产品体验。 首版落地后,交互从「底栏内联发送」演进为「预览浮窗 + 对话」,并补齐简约图标、TTS 朗读与微信式语音消息;当前体验仍有破碎点,需以本 change 的 specs 为基线持续收口。 ## What Changes - **舞台分区**:视频舞台为视频区预留底部波形条与 AI 工具条高度;去掉原生 video controls 叠层与浮动 AI FAB。 - **工具条入口(简约 SVG)**:上一句、电话(语音通话)、视频、铅笔(涂鸦圈选)、消息等 MUST 使用与应用一致的描边 SVG 图标(非 emoji)。 - **上一句(能量断句)**:基于波形/能量在当前暂停点前回溯,优先 5s 内、否则 10s 内找音量低谷作为句起点,截取 `[start, now]` 音频片段向 AI 提问。 - **Ask 浮窗(左右分栏)**:点击音频/上一句、视频、截图/铅笔确认后、消息等入口时,打开遮罩浮窗:左侧预览(图/音频片段/视频),右侧 AI 对话(历史、Markdown 回复、输入发送)。 - **消息 / 截图**:消息入口暂停并截帧后打开浮窗;铅笔圈选确认后以截图预览打开浮窗。 - **TTS**:AI 文本回复提供喇叭朗读;优先 edgeTTS,失败/限额时回退本机 `speechSynthesis`(iPad speaker)。 - **语音消息**:输入区喇叭支持微信式点按录音→再点结束发送;发出可点击播放的语音气泡,并尽量转写后提问。 - **语音通话**:底栏电话图标启动纯语音实时对话;课程音频暂停。 - **视频/投屏通话**:视频入口打开视频预览浮窗;投屏通话从浮窗工具区进入(稀疏抽帧 Tier A);可选 RTC Tier B。 - **体验收口**:将破碎交互收敛进 specs / design 的「UX backlog」,后续逐项修订 spec 再改代码。 ## Capabilities ### New Capabilities - `studydeck-study-chrome`: 学习舞台底部 Wave + Toolbar 布局、SVG 图标规范、FAB 退役。 - `studydeck-media-ask`: 上一句能量断句、Ask 浮窗预览与对话、截图缓冲、TTS、微信式语音消息。 - `studydeck-realtime-call`: 语音通话与投屏/视频通话模式、互斥状态机、抽帧策略与 feature/endpoint 门控。 ### Modified Capabilities - (主库 `openspec/specs/` 尚无已归档的 `studydeck-ai-study`;本期以本 change 承接学习侧 AI UX。) ## Impact - **`studydeck/`**:`StudyBottomChrome`、`StudyAskModal`、`MediaWaveform`、`AnnotateOverlay`、`lib/tts`、`lib/voiceMessage`、`lib/realtimeCall`、Tauri edge-tts 调用等。 - **`studydeck-ios/`**:麦克风 / 语音合成权限与 safe-area;WebView 内跟随前端。 - **AI 配置**:`realtimeVoice` / `realtimeVision`、features 与 prompts;edge-tts 为可选本机依赖。 - **非目标**:系统级桌面录屏;完整豆包 MMT;字幕轴断句(可后续增强)。