
写在前面欢迎大家关注Rocky的知乎Rocky Ding《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book欢迎大家StarRocky最新撰写的10万字AI AgentAI智能体深入浅出全维度解析文章深入浅出完整解析AI AgentAI智能体的核心基础知识AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识欢迎大家加入https://t.zsxq.com/33pJ0大家好我是Rocky。核心导读MOSS-VL 把实时交互写进计算路径一个视频助手可以准确回答“刚才发生了什么”也可能在开口后完全错过现场变化。对监控提醒、运动解说和操作指导而言这段感知空窗会直接改变答案的有效性用户已经拿错工具模型却仍在把上一句建议慢慢说完。MOSS-VL 围绕这一问题组织了架构、数据和推理协议。视觉 patch 不进入语言自注意力序列而是保存在交叉注意力的视觉缓存中新增画面更新缓存后续生成 token 可以读取更新后的证据。训练再通过沉默、响应与自然纠正样本让模型学习何时开口、何时继续观察。Rocky认为这项工作的研究价值是把实时 Agent 的问题从“回答正确率”推进到“证据是否持续有效”。这需要计算图允许新证据进入也需要训练目标奖励恰当的响应时机。单独增加视频帧数或者在外面接一个定时轮询循环都不能完整解决这一问题。图1给出主要收益的分布主动提醒与时序理解突出其他能力并非全面领先。模型共 11.3B 参数论文中的实时模型在四组流式评测中取得三个最高平均分在另一组位列第二。这些数字来自作者的评测及其引用的基线报告本文分析方法与证据不将其视为独立复现实验。还有一个贯穿全文的边界作者把“生成过程中继续感知”称为 L5但现有公开基准的定量证据主要覆盖 L2–L4。实时演示与公开运行代码说明系统可以这样工作还不能给出跨场景的 L5 可靠性结论。1. 从视频问答到持续观察MOSS-VL 的能力分层离线视频问答默认视频已经结束模型可以先看完再组织答案。流式输入增加了因果约束任何时刻只能使用已经到达的帧。主动交互进一步要求模型保留任务意图在条件满足时自行响应在条件不满足时保持沉默。表1的五级体系是作者为讨论问题提出的分类并非全行业统一认证。它的关键分界具有工程意义L2–L4 系统仍可能在一次回复期间暂停感知L5 则要求输出过程中接收新证据必要时修改或中止当前表述。可以用一个具体场景理解这一差别。用户要求“猫碰到胡萝卜时提醒我”。持续输入只意味着模型不断收到画面长期指令保持意味着它不会忘掉提醒条件恰当沉默意味着它不会每秒重复描述猫边说边看则意味着它发出提醒的同时仍能注意到下一次接触或场景变化。这几项能力必须分别验证。2. MOSS-VL 架构视觉缓存与语言生成解耦MOSS-VL 使用来自 Qwen3-VL 的 27 层视觉编码器对动态分辨率图像编码再通过 2×2 patch 合并与投影进入视觉 token 空间。语言主干来自 Qwen3-8B保留 36 层自注意力并插入 12 层门控交叉注意力总计 48 层解码结构。图2中文本隐状态生成 Query视觉表示提供 Key 和 Value。交叉注意力每四层出现一次使用 32 个 Query 头、8 个 KV 头的 GQA以及 QK-RMSNorm。注意力和前馈通路使用零初始化的 tanh 标量门控训练起点保留语言骨干已有行为再逐步学会使用视觉信息。11.3B 的总参数由约 8.2B 语言骨干、2.3B 交叉注意力、0.8B 视觉编码与投影组成。参数数量增加并不必然导致相同输入下推理更慢因为实际开销还取决于哪些 token 进入哪些层、缓存如何增长以及算子是否适配这一计算路径。表2中的训练输入范围、上下文上限和推理默认值要分开理解。最大上下文为 262,144 token训练可接触最多 2,048 帧发布处理器默认按 1 fps、最多 256 帧处理而论文评测将上限提高到 768 帧。将训练上限直接当成开箱即用的默认配置会造成复现偏差。视觉 token 离开语言自注意力序列后语言侧仍保留时间戳和帧占位符。每到达一帧仅编码新帧并追加视觉 KV历史画面不用重新编码语言生成状态也得以延续。这里的“增量”没有消除全部增长成本视觉缓存会增加交叉注意力读取历史视觉证据仍有代价长时间运行也仍然需要缓存管理。3. XRoPE把空间位置、逻辑顺序与真实时间分清楚独立视觉缓存带来一个新问题文本 Query 与视觉 Key 如何知道彼此的时空位置XRoPE 在交叉注意力通路建立共享的三轴坐标。文本 token 使用( x , x , x ) (x,x,x)(x,x,x)一个合并后的h ′ × w ′ h\times wh′×w′视觉网格以逻辑坐标t tt为起点。公式1对应论文的位置定义p a , b ( t , t a , t b ) , 0 ≤ a h ′ , 0 ≤ b w ′ . \mathbf p_{a,b}(t,ta,tb),\qquad 0\le ah,\quad 0\le bw.pa,b(t,ta,tb),0≤ah′,0≤bw′.图3中视觉结束分隔符和语言侧帧占位符共享( x , x , x ) (x,x,x)(x,x,x)其中x max ( t h ′ , t w ′ ) x\max(th,tw)xmax(th′,tw′)后一个文本 token 从x 1 x1x1接续。64 对旋转频率按 24、20、20 分配给三轴分别作用于文本 Query 和视觉 Key。这里的t tt是相对序列坐标不是物理秒数。网格尺寸变化会改变位置推进方式不能用它直接计算两次事件的真实时间差。MOSS-VL 另外在文本序列写入绝对时间戳例如|time_start|X.X seconds|time_end|。训练时根据运动使用 1–16 fps 的可变采样显式时间戳可以避免把采样密度误当作时间速度。这一设计给实时多模态系统一个可复用的启发空间坐标帮助定位逻辑坐标帮助组织序列物理时间帮助判断节奏。三者有关联却不能相互替代。4. 训练课程先建立感知基础再安装交互行为MOSS-VL 发布五个检查点但它们不是一条连续升级链。论文主体研究的是 0708 系列Base 经常规指令训练成为 Instruct再经 Realtime-SFT 得到 Realtime。0408 的 Base/Instruct 是更早一次独立训练保留用于研究连续性。混用两个训练批次容易把不同底座、课程和后训练效果混在一起。做消融时应先固定 0708 的继承关系再比较常规指令模型与实时模型。预训练先冻结视觉与语言骨干只训练投影和交叉注意力完成对齐随后解冻全模型以图像、视频、OCR、定位、交错文档和纯文本建立能力广度再提高数据质量最后通过退火和长上下文训练把序列上限从 8K 推向 256K。表4完整保留每阶段的 token、样本、学习率与可训练模块token 统计包括投影压缩后的视觉 token不能仅按语言输出量理解。常规 SFT 包含 7.6M 样本、102.8B token实时阶段包含 0.56M 样本、34.8B token。Realtime-SFT 占全部训练 token 不到 3%这一比例说明实时行为可以集中在较轻的后训练阶段学习它不意味着从零获得实时视频智能只需这点资源。大量前置训练已经承担了识别、时序定位与语言理解成本。实时语料含约 2.2M 次响应决策58.7% 属于自主选择时机5.1% 的负样本流始终不出现目标事件要求全程沉默。数据按画面状态变化组织监督并检查回答证据在对应帧是否仍然成立。这样的负样本很重要只训练“看见目标就提醒”系统容易把持续等待学成持续找理由开口。5. MOSS-VL Realtime-SFT沉默也需要被正确监督模型新增|silence|与|response|两个状态 token沿用下一 token 预测选择当前行为没有额外接一个独立分类头。状态输出与文字输出共享模型但状态严重不平衡长视频中的多数时刻都不需要回复。公式2保留论文的加权损失及其归一化方式L − 1 ∑ i m i ∑ i m i w i log p θ ( y i ∣ y i ) , w i { α y i ( 1 − p θ ( y i ∣ y i ) ) γ , y i ∈ { silence , response } , 1 , 文字 token . \mathcal L-\frac{1}{\sum_i m_i}\sum_i m_i w_i\log p_\theta(y_i\mid y_{i}), \qquad w_i\begin{cases} \alpha_{y_i}(1-p_\theta(y_i\mid y_{i}))^\gamma,y_i\in\{\text{silence},\text{response}\},\\ 1,\text{文字 token}. \end{cases}L−∑imi1i∑miwilogpθ(yi∣yi),wi{αyi(1−pθ(yi∣yi))γ,1,yi∈{silence,response},文字token.其中m i m_imi是监督掩码γ 2 \gamma2γ2状态类别权重为α k ( n s n r ) / ( 2 n k ) \alpha_k(n_sn_r)/(2n_k)αk(nsnr)/(2nk)由全局 batch 内的两类计数得到。条件历史中还包含可见视觉信息。分母是监督位置数∑ i m i \sum_i m_i∑imi不能改成权重和∑ i m i w i \sum_i m_iw_i∑imiwi两者的梯度尺度不同。逆频率权重提高稀缺响应样本的贡献focal 因子降低简单状态判断的影响。文字 token 仍按标准预测目标学习避免把语义质量全部交给一个时机分类指标。论文还移除了轮末|im_end|的监督。在作者的控制比较中响应触发率增加 39%回复长度增加 68%。这两个行为统计能说明终止标记影响输出策略不能直接推导为准确率提升。产品侧仍要检验冗长、误提醒和重复输出是否增加。真实协议也参与塑造行为。推理参考流程发送一帧后等待新的沉默反馈长回复使用长度预算释放后续画面模板约定每个需要说话的帧只启动一次响应一段回复以一个沉默状态结束。训练还以约 50% 概率省去开头状态槽避免过度依赖固定模板位置。这些细节解释了为什么只下载权重、套一个普通聊天模板未必能得到演示中的交互效果。6. 系统实现可见前缀与缓存更新决定是否真能部署语言侧每个 Query 只能看到在该时刻已经到达的视觉帧其可见区域是视觉 KV 的一个前缀。如果显式创建“文本长度 × 视觉长度”的稠密注意力掩码内存和带宽开销会很快增长。MOSS-VL 为 FlashAttention-3 增加cross_kv_boundary每个 Query 行用一个 32 位整数表示可见视觉前缀算子跳过边界之外的 KV tile。它支持稠密、变长及 KV-cache 路径使长序列打包训练与增量推理能够使用同一可见性语义。这属于架构落地的一部分。理论上把视觉 token 拆出去如果运行时仍构建巨大掩码、重复搬运历史缓存预期收益就会被系统开销吃掉。研究者应把数据布局、内核和推理调度一起纳入测量。图4的测量条件是同版本 SGLang、单 H200、TP1、BF16、相同生成长度上限每个点来自五次独立冷启动误差条为样本标准差。匹配视觉 token 数时TTFT 优势随上下文增加从 2.8 倍扩大到 5.1 倍端到端优势从 1.9 倍扩大到 4.3 倍。相同视频、分辨率和帧数的比较更有解释力Qwen3-VL 在时间轴做 2 倍压缩MOSS-VL 为让新帧立即编码而不做时间压缩因此承载约两倍视觉 token在已测点仍保持较低延迟。它支持“计算路径比单看参数量更重要”的判断。这组图测的是离线服务不能直接当成直播场景下从事件发生到语音提醒的延迟。真实链路还包含采帧、排队、视觉编码、输出调度和语音合成且多个阶段可能并行。要宣称实时服务质量还需要报告事件级 P50/P95、漏报、误报及持续运行时的资源增长。7. 实验结果优势集中在哪里结论就落在哪里MOSS-VL-Instruct 在 Minerva、TOMATO、VideoMME-Logical 上分别达到 40.5、39.5、17.1体现出时序理解优势但 MMMU、部分文档理解与标准定位任务仍有差距。模型没有 thinking 模式当前报告也没有以强化学习后训练补齐复杂推理因此不宜把视频交互优势推广成通用推理领先。表5多数基线取自各自官方报告帧数等配置可能不同Gemma-4-12B-IT 由作者按相同协议评测部分文档指标另有专门口径。公平比较要逐列检查这些条件不能仅因为它们排在一张表里就默认输入预算相同。流式评测中OVO-Bench、OmniMMI、ProactiveVideoQA 平均分分别为 70.2、32.7、47.2在所列比较中领先StreamingBench 视觉平均分为 69.7低于 AURA 的 71.1。OmniMMI 主动提醒达到 66.0对应最好基线为 37.5收益集中在要求自主选择时机的子任务。StreamingBench 这里统计的是视觉 RT 与 CTX 两组的平均MOSS-VL 不输入音频没有评测依赖音频的 Omni-Source 组因此不能把 69.7 写成该基准完整官方总分。其他平均值也各有定义跨基准直接平均缺少意义。8. MOSS-VL 实时演示与 L5 验证缺口图5在单 H200 上展示两类任务猫接触胡萝卜时提醒以及连续足球解说。前者呈现长期条件、沉默和多次触发后者呈现持续生成过程中对哨声、射门、庆祝和比分变化的跟进。图中的时间线很有价值因为它把画面证据和实际输出放在同一坐标上。表7保留附录的演示译文便于逐项核对输出内容。示例能够证明实现路径和行为样态但精选片段没有给出长期失败率也没有系统测量“错误建议已经开始输出后新证据能在多久内改变它”。这一指标恰好是 L5 相较普通流式问答的核心增量。Rocky认为后续基准应主动制造证据反转物体移走、动作失败、操作顺序改变、旧结论变成危险建议。评测除了最终答案还应记录纠正延迟、已经说出的错误内容、重复提醒和错误中止。一个能快速修正但经常无故打断的助手也不能算可靠。9. 开放程度与工程落地从检查点走到系统官方仓库提供检查点、推理实现、实时模板及相关训练课程说明并有 SGLang 集成和扩展注意力后端。仓库后续还增加了带 ASR/TTS 的演示前后端与多会话服务路径这些外围组件使视觉语言模型可以进入语音交互系统不应据此把底座描述成原生音频模型。完整预训练引擎在仓库路线图中仍有待完成项。训练阶段公开、提供小规模微调脚本、开放全部预训练数据与基础设施是不同层次的复现能力。对量化版本“24GB 显存可运行”的说明也需要绑定具体检查点、精度、上下文和并发条件不能套用到全精度长视频服务。对算法工程师最值得研究的是视觉可见性与状态监督如何共同影响行为。对实时 Agent 团队先用一个明确的长期条件任务测误报和延迟再扩展为自由解说。对产品和创业团队用户为及时、正确且可追溯的提醒付费漂亮演示只是进入这一业务验证的起点。10. 术语速查与进一步研究概念在 MOSS-VL 中的作用需要保留的边界门控交叉注意力语言 Query 读取独立视觉 KV视觉缓存仍增长并非零成本XRoPE对齐文本与视觉空间的逻辑位置不能代替物理时间戳Realtime-SFT学会沉默、触发与修正依赖前置感知基础TTFT首个输出 token 的服务延迟不等同事件到语音提示的总延迟L5生成中持续感知的作者分类缺乏专门公开量化基准进一步研究可以围绕三个相互关联的问题展开。第一如何保留长期任务所需的视觉证据同时限制缓存增长且不破坏时间定位第二训练时合成的响应时机与真实用户容忍度存在何种偏差能否用任务完成和打扰成本建立偏好学习第三多用户服务下的调度延迟是否会抵消单会话架构收益这些问题决定系统能否从能跑一次走向长期可用。MOSS-VL 给出了有解释力的结构起点新证据可以进入正在生成的模型沉默可以被学习纠正可以成为交互的正常组成部分。下一阶段的价值需要由持续运行和事件级验收来兑现。推荐阅读1. 深入浅出完整解析AI AgentAI智能体的核心基础知识2025年可以说是AI Agent全面落地应用的元年因此Rocky在持续撰写对AI Agent的全维度解析文章深入浅出完整解析AI AgentAI智能体的核心基础知识2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解同时不断跟进补充扩散模型的最新技术发展希望能给大家带来帮助深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识3. 入浅出完整解析FLUX.2、Seedream即梦、Z-image、GLM-Image核心基础知识Rocky对AIGC时代“中场时刻”之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值入浅出完整解析FLUX.2、Seedream即梦、Z-image、GLM-Image核心基础知识4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识5. 深入浅出完整解析DeepSeek系列核心基础知识Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析深入浅出完整解析DeepSeek系列核心基础知识6. 深入浅出完整解析Stable Diffusion 3SD 3和FLUX.1系列核心基础知识Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析深入浅出完整解析Stable Diffusion 3SD 3和FLUX.1系列核心基础知识7. 深入浅出完整解析Stable Diffusion XLSDXL核心基础知识Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析深入浅出完整解析Stable Diffusion XLSDXL核心基础知识8. 深入浅出完整解析Stable DiffusionSD核心基础知识Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析深入浅出完整解析Stable DiffusionSD核心基础知识9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析包括其在传统深度学习中的价值和在AIGC中的价值深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识10. 深入浅出完整解析LoRALow-Rank Adaptation模型核心基础知识对于AIGC时代中的“ResNet”——LoRA模型Rocky进行了深入浅出的全面讲解深入浅出完整解析LoRALow-Rank Adaptation模型核心基础知识11. 深入浅出完整解析ControlNet核心基础知识AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。ControlNet正是让AI图像创作社区无比繁荣的关键一环它让AIGC图像创作过程更加的可控更有助于广泛地将AIGC算法解决方案应用到各行各业中深入浅出完整解析ControlNet核心基础知识12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识AI绘画和AI视频是两个互相促进、相互交融的领域2024年无疑是AI视频领域的爆发之年Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识13. 深入浅出完整解析AIGC时代Transformer核心基础知识在AIGC时代中Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向成为AI技术架构大一统与多模态整合的关键核心基座大有一统“AI江湖”之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析深入浅出完整解析AIGC时代Transformer核心基础知识14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识AIGC创作框架正是AIGC算法工作流的运行载体目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等。在传统深度学习时代PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架到了AIGC时代Rocky相信ComfyUI就是AIGC时代的“PyTorch”、Stable Diffusion WebUI就是AIGC时代的“TensorFlow”、Diffusers就是AIGC时代的“Caffe”深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识在AIGC时代中如何快速转身入局AIGC产业如何成为AIGC/LLM/AI Agent算法/开发工程师如何在学校中系统性学习AIGC/LLM/AI Agent知识斩获心仪的AIGC/LLM/AI Agent算法/开发offerDon‘t worryRocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍为大家答疑解惑希望能给大家带来帮助手把手教你成为AIGC/LLM/AI Agent算法/开发工程师斩获AIGC/LLM/AI Agent算法/开发offer16. AIGC产业的深度思考与分析2023年3月21日微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示自从1980年首次看到图形用户界面graphical user interface以来以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。Rocky也认为AIGC及其生态会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期未来随着AIGC的全面落地和深度商用会深刻改变我们的工作、生活、学习以及交流方式各行各业都将被重新定义过程会非常有趣。那么在此基础上我们该如何更好的审视AIGC的未来我们该如何更好地拥抱AIGC引领的革新Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点希望能帮助各位读者对AIGC有一个全面的了解深入浅出全面解析AIGC时代核心价值与发展趋势2025年版17. AI算法工程师的独孤九剑秘籍为了方便大家实习、校招以及社招的面试准备同时帮助大家提升扩展技术基本面Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍持续更新中18. 深入浅出完整解析AIGC时代中GANGenerative Adversarial Network系列模型核心基础知识GAN系列模型作为传统深度学习时代的最热门生成式Al模型在AIGC时代继续繁荣作为Stable Diffusion/FLUX系列大模型的“得力助手”广泛活跃于AlGC图像创作的产品与工作流中深入浅出完整解析AIGC时代中GANGenerative Adversarial Network系列模型核心基础知识