════ 2026.08.05 ════
今日要点
详细内容
ENTRY 001/016
[ MODELRELEASE · QWEN · MOE · CODINGAGENT · MULTIMODAL ]
Qwen3.8-Max 以 2.4T MoE 推进 Coding 与 Cowork
(Qwen3.8-Max: A New Bar for Coding and Cowork)
SOURCE · Frontier Release · Qwen · X · Reddit
Qwen3.8-Max 正式版采用 2.4T 总参数、约 95B 激活参数的 MoE,支持文本、图像与视频输入,提供约 1M input context 和 131K 最大输出。API 定价为每百万 input/output tokens 2/6 美元、implicit cache input 0.25 美元,团队表示 Max 与 27B 权重将在下一周开放。
这次发布把 Qwen3.8 从订阅计划中的 preview 推向有完整规格和 benchmark 表的正式模型。官方结果显示它在 Terminal-Bench 2.1、PaperBench、IFBench 和文档理解等任务上很强,但在 SWE-bench Pro、FrontierSWE 和通用 tool-use 指标上仍落后于最高端闭源模型;这更像一个成本显著更低、能力分布不同的生产候选,而不是单线替代品。
开放权重承诺尤其值得跟踪。2.4T 总规模意味着 Max 仍需要大型集群,真正影响本地部署的可能是同步预告的 27B 版本;在权重、license 和推理 recipe 实际落地前,团队不应把“即将开放”计入供应链保障。API 迁移则应先复测多模态 token 计费、长 context 有效利用率、tool-call schema 和长任务稳定性。
ENTRY 002/016
[ OPENWEIGHTS · VIDEOGENERATION · AUDIOGENERATION · MULTIMODAL · COMFYUI ]
MiniMax H3 开放原生音视频生成权重
(MiniMax H3)
SOURCE · Frontier Release · HF Models · GitHub · Reddit
MiniMax H3 开放权重,能统一理解文本、图像、视频与音频条件,并在一次生成中输出最长 15 秒、最高 2K 的视频和同步原生立体声。ComfyUI 同日提供 image-to-video workflow,社区已验证 INT8 量化版本可在 16GB VRAM 设备运行。
H3 的差异不是在视频生成后再拼接 TTS,而是把空间音频与画面放在同一生成过程里,并允许 reference image、video 和 audio 共同约束输出。这让对白、环境声与镜头变化的联合一致性成为模型内能力,也减少多模型 pipeline 中常见的时间轴对齐、音色漂移和后期合成成本。
开放权重并不等于轻量部署:完整 BF16 的算力与显存需求仍高,消费卡实践主要依赖 pruned INT8、量化 text encoder、attention 优化和分段 workflow。开发者比较本地与云端质量时,需要同时记录精度、scheduler、steps、分辨率和 audio VAE 配置,否则很容易把部署近似造成的差异误判为模型能力。
ENTRY 003/016
[ DIFFUSIONLM · MOE · SCALINGLAW · PRETRAINING · 论文 ]
LLaDA MoE v2 给出扩散语言模型的 MoE 缩放规律
(LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models)
SOURCE · arXiv · HF Papers
研究系统测量 MoE diffusion language model 的优化、模型—数据分配和 expert 结构缩放规律,并据此从头训练 30B-A3B 的 LLaDA MoE v2。模型使用 23.5T tokens,在约为 Qwen3 65% 的预训练 tokens 下接近其多项知识、推理与代码表现。
现有 language-model scaling law 大多来自 autoregressive 路线,直接套用到离散扩散模型可能造成 batch、learning rate 和数据预算配置错误。论文发现,MoE dLLM 随 compute 增长需要更快扩大的 nominal batch、更快衰减的 learning rate,并在 IsoFLOP 最优点上略偏向增加数据;固定激活容量时,大规模模型也更偏好更大的 expert pool。
LLaDA MoE v2 的价值在于把这些观察落实到 30B-A3B 实例,而不只停留在小规模拟合。结果仍主要说明“扩散路线可以有效缩放”,尚不能证明其推理吞吐、KV-free 优势或端到端服务成本优于成熟 AR stack;后续应关注权重、采样步数和真实 latency 的完整披露。
ENTRY 004/016
[ DIFFUSIONLM · CONTINUOUSLATENT · FLOWMATCHING · ARCHITECTURE · 论文 ]
AURORA-LM 在连续潜空间中生成可解码文本
(AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling)
SOURCE · arXiv · HF Papers · GitHub
AURORA-LM 用 Query-based Encoder-Decoder 构建 prefix-aligned、可解码的高容量 text latent,再由 block-causal Diffusion Transformer 以 flow matching 逐块生成、块内并行去噪。1B 模型在 OpenWebText 自由生成和 XSum 摘要上超过论文对比的连续及扩散语言模型。
连续文本生成的核心冲突是:压缩 latent 有利于 diffusion 学习,却会损害 token-level 可逆性。AURORA-LM 保留完整 decoder-facing latent,只限制 noisy-input pathway,并用 self-trajectory consistency 缩小训练时独立噪声与推理时迭代轨迹的差异。这是一种把表示学习与分布建模明确拆开的架构选择。
当前规模仍只有 1B,且训练在 Ascend NPU 上完成,与主流 autoregressive LLM 的能力和 serving 生态还不能直接比较。它更重要的意义是提供可复现的连续 latent 基线,让后续工作可以检验 block-parallel denoising 是否真正转化为 wall-clock 加速,而不只比较生成质量。
ENTRY 005/016
[ AGENT · BENCHMARK · LONGHORIZON · TOOLUSE · ECOMMERCE ]
MerchantBench 暴露 Agent 一年期经营的一致性缺口
(MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations)
SOURCE · arXiv · HF Papers · GitHub
MerchantBench 用 98,843 条真实商品记录、26 个工具和订单级状态构建 365 个模拟日的卖家经营环境,覆盖选品、定价、现金流和延迟反馈。八个 LLM、两个 Agent framework 的 48 次运行中,最佳配置最终净资产仅为人类参与者均值的 27.3%。
多数 Agent benchmark 把成功压缩成几十分钟内可立即验证的终态,MerchantBench 则让今天的采购和定价在数周后通过退款、差评或资金链反馈。模型因此必须追踪订单生命周期、修正早期假设,并保持多个控制循环持续工作;这比单纯扩大 context 更接近生产 Agent 的长期一致性问题。
结果指出“运行很久”不等于“具备长程能力”:Agent 会逐渐停止行动、缩窄关注范围,或让错误记忆不断自我强化。对实际系统而言,关键改进方向是外部状态机、延迟 feedback attribution、现金与风险约束,以及能检测控制循环是否意外停摆的独立监控。
ENTRY 006/016
[ MULTIMODALAGENT · VIDEOUNDERSTANDING · DEEPRESEARCH · GRPO · BENCHMARK ]
Video-DeepResearch 强制 Agent 先看视频再搜索
(Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent)
SOURCE · arXiv · HF Papers · GitHub
Video-DR 以解耦的 perception-exploration pipeline 和分阶段 tool unlocking,先完成跨帧视觉 grounding,再允许开放网络检索,以抑制“跳过视觉直接搜文字”和参数知识泄漏。35B-A3B 模型在 200 题 Video-DR-Bench 上达到 64.0%,论文对比的 Claude-4.5-Sonnet 为 59.0%。
多模态 deep research 的常见失败不是完全不会用工具,而是模型发现文本搜索更容易,于是绕过昂贵的视频理解步骤,再用训练记忆猜答案。Video-DR 通过 tool unlocking 把“先观察、后探索”编码进执行协议,并用 SFT 后接 GRPO,让策略学习超出单纯模仿轨迹。
64.0% 的结果说明结构化工具约束可以显著改变 Agent 行为,但 benchmark 只有 200 个协作构造问题,且闭源模型对比受 prompt、采样与工具实现影响。工程上更可迁移的结论是:对关键 modality 设置可审计的证据门槛,往往比在 system prompt 中提醒“务必查看视频”更可靠。
ENTRY 007/016
[ VIDEOEDITING · DIFFUSION · DISTILLATION · STREAMING · REALTIME ]
JoyAI-Video-Edit 在单张 B200 上实现 720p 约 30 FPS 编辑
(JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion)
SOURCE · arXiv · HF Papers · GitHub
JoyAI-Video-Edit 是 16B autoregressive diffusion framework,通过 chunk-wise adaptation、Source-Anchored Distribution Matching Distillation 和 Long-Horizon Autoregressive Distillation 支持未知总时长的流式编辑。完整系统在单张 NVIDIA B200 上达到端到端 720p、约 30 FPS。
实时开放式编辑同时受三类约束:不能访问未来帧、每个 chunk 的 compute 必须有界、误差又会沿时间累积。SA-DMD 用 source anchor 保住两步生成下的内容一致性,long-horizon distillation 则专门压制 autoregressive drift,说明模型把在线编辑当成长期稳定性问题而非逐帧风格迁移。
30 FPS 是在 B200 上的系统结果,距离消费设备或多租户服务的成本目标仍有差距;不过代码开放后,开发者可以直接测量 chunk size、首帧延迟、显存峰值和长视频漂移。相比只报告离线短片质量,这种有明确硬件和实时指标的发布更便于评估生产可行性。
ENTRY 008/016
[ 3DGENERATION · MULTIMODAL · DIFFUSION · EDITING · DATASET ]
Hunyuan3D-Buffalo 统一 3D 理解、生成与编辑
(Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing)
SOURCE · arXiv · HF Papers · Research Blog
Hunyuan3D-Buffalo 1.0 在同一框架中支持 3D understanding、text-to-3D、instruction-guided editing 与 text-grounded part generation。训练语料共 87M,包括 25M 理解样本、50M text-to-3D pairs 和 12M 由 Nano3D-v2 生成的 editing pairs。
统一 3D 模型的主要瓶颈不是缺少单项生成器,而是缺少几何一致、同时覆盖理解和编辑的数据。Buffalo 用 Hunyuan3D-VLM 提供语义、结构和空间条件,再由 Hunyuan3D DiT 合成;编辑与部件生成额外绑定 source object representation,以保留未修改区域。
研究报告生成与理解的联合训练也会提升编辑,支持“共享 3D 表示比串接多个专用模型更稳”的方向。87M 语料中 12M editing pairs 来自合成管线,因此仍需关注自动数据的错误模式、版权和 domain bias;对工具开发者而言,layer/part-level 可控性比单张渲染图的视觉质量更关键。
ENTRY 009/016
[ OMNILLM · TOKENCOMPRESSION · INFERENCE · MULTIMODAL · EFFICIENCY ]
OmniPack 以 16.7% FLOPs 保留 98% Omni-LLM 表现
(OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models)
SOURCE · arXiv · HF Papers · GitHub
OmniPack 是 training-free 的全模态 token compression framework,在 LLM 前去除结构冗余,在多模态交互后依据文本查询与音视频协同进一步压缩语义表示。Qwen2.5-Omni-7B 上,它以 16.7% 原始 FLOPs 保留 98.0% 表现,以 6.8% FLOPs 仍保留 92.9%。
只在 encoder 后做一次压缩容易丢掉分散在长视频或音频中的证据,只在 LLM 内压缩又已经支付了前几层的大量计算。OmniPack 将结构覆盖、相似 token merging 与 query-conditioned semantic refinement 分成前后两段,使低 token budget 下仍能保留跨模态协作所需的信息。
它不要求重新训练,适合作为现有 Omni-LLM serving 的可插拔优化候选。实际收益仍取决于 kernel 是否能把理论 FLOPs 减少转化为 latency 和显存下降,也要针对稀疏关键事件测试 recall;平均 benchmark 保真不能排除短促声音或单帧证据被过早删掉。
ENTRY 010/016
[ DISTILLATION · FLOWMATCHING · IMAGEGENERATION · REPRESENTATIONLEARNING · 论文 ]
Any-OPD 跨异构 Flow-Matching 模型做在线蒸馏
(Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging)
SOURCE · arXiv · HF Papers
Any-OPD 允许 VAE、architecture 和 timestep schedule 均不同的 flow-matching teacher/student 进行 on-policy distillation。它在冻结的模型无关视觉表示中比较输出,并以连续 noise level 对齐轨迹;将 12B FLUX.1-dev 蒸馏至 2.5B SD3.5-Medium 后,PickScore 从 0.846 升至 0.884。
传统 diffusion distillation 默认 teacher 与 student 共享 latent 坐标和时间步,跨家族迁移时 latent regression 往往直接失效。Any-OPD 把 teacher 降格为 black-box sampler,只在冻结的视觉 representation 中建立桥梁,再用 student VAE 重编码 teacher 样本做短暂 anchoring,避免梯度主要反映 domain mismatch。
这使团队可以选择“质量最好的 teacher”和“部署最合适的 student”,而不再被架构同源性绑定。代价是表示模型本身定义了优化偏好,可能忽略文字、几何或细节层面的错误;论文目前只展示一个主要 teacher-student 组合,异构能力是否能广泛泛化仍需更多复现。
ENTRY 011/016
[ AGENTRL · SELFDISTILLATION · GRPO · SPARSEREWARD · 论文 ]
PCSD 用持续一致性筛选 Agent 蒸馏信号
(PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning)
SOURCE · arXiv · HF Papers
PCSD 从 teacher-favoring signal 的局部持续性计算 token-level distillation weight,以 adaptive window、指数衰减和 trend-aware modulation 过滤不可靠教师位置,再与 GRPO 联合优化。两个 backbone 上的 ALFWorld Overall 均超过 GRPO 13.3 points 以上。
长轨迹 Agent 往往只获得一个终局 reward,而 privileged teacher 虽能提供 dense token supervision,却不会在每个位置都更可靠。PCSD 不把单点分歧直接当标签,也不为整个 step 分配同一权重,而是观察 teacher 优势是否在局部窗口持续存在,并在趋势转弱时降低影响。
ALFWorld unseen split 相对 GRPO 提升 15.8 points,说明这种细粒度 gating 有机会改善稀疏奖励下的泛化。训练团队需要继续检查计算 teacher logits 的额外成本、不同长度 trajectory 的 window 敏感性,以及 teacher 与环境 reward 冲突时是否会形成隐蔽偏置。
ENTRY 012/016
[ PERSONALAGENT · MEMORY · SELFIMPROVEMENT · BENCHMARK · EVALUATION ]
PAST-Bench 检验持久 Agent 是否真的从经验中变好
(PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents)
SOURCE · arXiv · HF Papers · GitHub
PAST-Bench 通过 matched condition 开关 retained experience,覆盖 26 个场景、204 个 episodes,分别评估记忆、流程复用、信息收集和更新。七个 base models 与四个 Agent frameworks 虽出现后续任务增益,但 save、retrieve、update 的证据路径并不稳定。
持久记忆系统常用“后一次任务分数更高”宣称自我改进,但提升可能来自随机性、额外 context 或未受控缓存。PAST-Bench 同时要求观察最终 gain 与预期的信息路径,因而能区分“碰巧做得更好”和“确实保存、取回并更新了正确经验”。
论文基于诊断结果构建 Hermes+,在 Agent loop 五个阶段加入针对性干预,对替换过期状态的任务提升最明显。这提示 memory 产品不应只优化召回率,还要记录 provenance、版本与 invalidation;尤其当用户偏好或外部事实变化时,正确忘记旧状态是自我改进的一部分。
ENTRY 013/016
[ AGENTHARNESS · LONGHORIZON · VERIFICATION · COMPUTERUSE · OPENSOURCE ]
LongHorizon-Harness 用外部验证状态支撑长任务
(LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks)
SOURCE · HF Papers · GitHub
LongHorizon-Harness 将任务状态显式保存在执行 context 外,只接纳环境独立验证的事实;Manage-Execute-Audit 循环分别负责规划、fresh-context 执行和只读审计。相同 Qwen3.7-Plus backbone 下,WeaveBench 从 51.8% 升至 80.7%,Terminal-Bench 2.1 从 69.7% 升至 77.2%。
长任务失败常来自三种职责挤在同一个不断增长的 context:执行过程、任务状态和完成判断互相污染。MEA 把 Executor 每轮重置为 fresh context,让 Manager 只维护已验证进度,再由独立 Auditor 检查文件、UI、日志和测试;错误的自我报告因此不会自动写入持久状态。
OSWorld 2.0 binary success 从 2.8% 到 8.3%,相对提升三倍但绝对值仍低,说明 harness 能放大模型能力,却无法填平 computer-use 的底层感知和操作缺口。项目支持 Codex、Claude Code、OpenClaw 与自定义 AgentAdapter,适合用相同模型做 A/B 测试;生产采用前仍需限定最大轮数、权限、审计模型独立性和失败后的人工 gate。
ENTRY 014/016
[ AGENTSECURITY · OBSERVABILITY · MCP · THREATDETECTION · OPENSOURCE ]
Uber 开源生产级 Agent 检测与响应系统 ADR
(ADR: Agentic AI Detection and Response)
SOURCE · GitHub · MLSys 2026
Uber 开源已在内部生产部署的 ADR Sensor、ADR-Bench 与双 Agent Detector,统一采集七种以上 coding tools 的 intent、tool use 和 execution trace。ADR-Bench 包含 303 项任务、133 个 MCP servers,并覆盖 17 类 Agent attack techniques。
ADR 把 Agent security 拆为 observability、benchmark、detection 和 prevention 四层。开源部分先用 Sensor 统一 Claude Code、Cursor、Codex 等不同运行时的遥测,再以高召回 triage 筛出可疑 session,交给更深的 agentic reasoning detector;这种两级结构避免对每条正常轨迹都支付昂贵推理成本。
项目提供 synthetic fixtures、基线和复现实验,但 prevention 与离线 red-team Explorer 尚未开源,所以它当前更适合检测与评估,而不是完整的阻断产品。接入企业环境时还要处理 trace 中的源码、secret 和用户数据,安全可见性本身不能绕过最小化采集、访问控制和 retention policy。
ENTRY 015/016
[ AGENTOPS · CONTROLPLANE · LONGRUNNINGAGENT · MULTIAGENT · OPENSOURCE ]
LoopX 为长运行 Agent 提供持久控制平面
(LoopX: The Local Control Plane for Long-Running AI Agent Work)
SOURCE · GitHub
LoopX 是独立于 Agent runtime 的本地 state kernel,把 objective、gates、todos、scope、evidence、quota 与 handoff 持久化,并通过 claim、lease 和 typed continuation 协调 Codex、Claude Code、Cursor 等执行器。v0.4.x 提供 quota-aware scheduling、证据写回、跨轮恢复和只读管理界面。
LoopX 不尝试替换 Agent loop,而是把跨轮次最容易丢失的控制信息变成独立 source of truth。执行器每次只领取 bounded slice,完成后写回 evidence 与 next todo,quota 再决定是否继续;用户判断、生产写入和发布权限则作为显式 gate 保留。这种边界比“定时唤醒一个带完整聊天记录的 Agent”更容易审计。
项目展示了超过 200 小时 wall-clock 的 issue-fix 和 AutoML 轨迹,但明确说明不是连续无人值守计算,也不是独立 benchmark。它仍处于 early usable 阶段,适合有多日研究、监控或 peer-agent handoff 的团队试验;一次性任务使用完整控制平面可能反而增加状态维护成本。
ENTRY 016/016
[ CODINGAGENT · VIDEOEDITING · MULTIMODALWORKFLOW · FFMPEG · OPENSOURCE ]
Video Use 让 Coding Agent 通过时间轴文本编辑视频
(Video Use: Edit Videos with Coding Agents)
SOURCE · GitHub
Video Use 不向 LLM 倾倒视频帧,而是把每个素材转成带 word-level timestamp、speaker diarization 与 audio event 的紧凑 transcript,仅在剪辑决策点生成 filmstrip、waveform 和 word label 复合图。Agent 产出 EDL、渲染视频,并在每个切点执行最多三轮视觉自检与修复。
项目把“让 LLM 看视频”重新表述为“让 LLM 操作可检索的时间轴”。README 给出的对比是把约 30,000 帧逐帧编码会产生约 45M tokens,而 transcript 主视图约 12KB,视觉信息只在停顿、重录比较和切点校验时按需加载。这类似用 DOM 代替网页全截图,优先暴露任务所需结构。
它适合以对白为主的 launch video、访谈和课程素材,对无对白、强视觉叙事或音乐节奏剪辑的覆盖仍需实测。pipeline 在生成前要求策略确认,渲染后用 timeline view 检查 jump、audio pop 和隐藏字幕,展示了一个可迁移的 Agent media pattern:结构化感知、明确执行计划、确定性渲染、边界级验证。
其他值得关注