════ 2026.07.23 ════
今日要点
详细内容
ENTRY 001/015
[ 大模型 · MOE · 多模态 · 长上下文 · 开源 ]
Kimi K3:2.8T 开源 MoE 进入原生多模态与百万上下文
(Kimi K3: A 2.8T Open MoE with Native Multimodality and 1M Context)
SOURCE · Moonshot AI(2026-07-16) · vLLM(2026-07-22)
Kimi K3 总参数量 2.8T,采用 16/896 experts 的 Stable LatentMoE,支持原生视觉输入和 1M context;完整权重计划于 7 月 27 日前发布。
K3 的核心不是单纯扩参,而是把 Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes)放进同一套大规模训练系统。KDA 降低百万 token 场景的 KV-cache 与解码压力,AttnRes 让网络按输入选择性聚合前层表示;Moonshot 称后者带来约 1.25× compute advantage,额外推理开销低于 2%。官方还报告 Stable LatentMoE 相对 K2 获得约 2.5× scaling efficiency。
部署门槛仍然很高:MXFP4 weights、MXFP8 activations 的推荐配置为至少 64 个 accelerators。API 定价为 cache hit 输入 $0.30/M tokens、cache miss 输入 $3/M、输出 $15/M;官方称 coding workload 的 cache hit rate 可超过 90%。DeepSWE 1.1 的 67.3 与 BrowseComp 的 90.4 都来自厂商评测,仍需独立复现,但 vLLM 已开始为 KDA-aware prefix caching、MXFP4 MoE kernel、multimodal serving 适配 NVIDIA 与 AMD,说明生态正在把新架构当成生产目标而非论文样机。
ENTRY 002/015
[ 大模型 · API · AGENT · 长上下文 · 成本 ]
Gemini 3.6 Flash 与 3.5 Flash-Lite:Google 重做高吞吐模型梯队
(Gemini 3.6 Flash and 3.5 Flash-Lite Reset Google's High-Throughput Tier)
SOURCE · Google(2026-07-21) · Google AI for Developers
Gemini 3.6 Flash 正式 GA,Gemini 3.5 Flash-Lite 同步推出;两者均提供 1,048,576-token input 与 65,536-token output,并覆盖主要 agent tools。
3.6 Flash 支持 function calling、code execution、File Search、Google Search/Maps grounding、structured outputs,以及 preview 状态的 computer use。其价格为输入 $1.50/M tokens、输出 $7.50/M;3.5 Flash-Lite 则降到 $0.30/M 与 $2.50/M。两档共享 1M context 和 64K output,使选型可以更直接地围绕任务质量、tool-call 次数与总 token 消耗展开。
Google 强调 3.6 Flash 在复杂工作流中减少 reasoning turns 和 tool calls。这比单次 benchmark 更值得关注:当 agent 需要浏览、执行代码和多轮调用工具时,一次少走弯路往往比每百万 token 的标价差更影响最终成本。GA 也意味着 3.6 Flash 已进入可承诺稳定性的产品阶段,不过 computer use 仍是 preview,涉及真实系统操作时仍应保留权限隔离和人工确认。
ENTRY 003/015
[ AI安全 · AGENT · 代码审计 · 漏洞研究 · DUAL-USE ]
Gemini 3.5 Flash Cyber:漏洞研究 Agent 进入受控实战
(Gemini 3.5 Flash Cyber Brings Vulnerability Agents into Controlled Operations)
SOURCE · Google DeepMind(2026-07-21)
Google DeepMind 针对漏洞发现、验证和修补微调了 Gemini 3.5 Flash Cyber,目前仅通过 CodeMender 向政府与可信合作方开展有限试点。
在 V8 评测中,官方称 Cyber 版本确认了 55 个独立问题,高于主线 Gemini 3.5 Flash 的 47 个和 Claude Opus 4.6 的 36 个,其中 10 个只被 Cyber 版本发现。更敏感的结果来自内部 red-team:模型在两小时内定位到公共 API 的 RCE 与生产服务的 memory corruption,并生成可绕过 ASLR 与 W^X、可靠率 100% 的 RCE 链。
这些数字来自 Google 自有环境,不能等同于通用安全能力,但已足以说明 frontier coding model 正从“提出可疑点”跨到“构造并验证利用链”。有限试点是合理约束:防守价值在于缩短复现与补丁周期,攻击价值则同样直接。组织若引入类似系统,隔离执行环境、限制目标范围、保留完整审计轨迹和补丁审批,应当与模型能力本身同时设计。
ENTRY 004/015
[ 大模型 · CODING · 强化学习 · API ]
Grok 4.5:xAI 把异步 RL 扩展到长程 coding tasks
(Grok 4.5 Scales Asynchronous RL for Long-Horizon Coding)
SOURCE · xAI(2026-07-16)
Grok 4.5 面向 coding agents 与长程软件任务训练,API 模型名为 grok-4.5,已在 API、Cursor 与 Grok Build 中提供。
xAI 称模型使用数万块 GB300 训练,并通过 asynchronous RL 同时处理数十万项任务。官方结果包括 DeepSWE 1.0 的 62、DeepSWE 1.1 的 53、Terminal-Bench 2.1 的 83.3、SWE-Bench Pro 的 64.7,以及 SWE Marathon 的 29。这组指标覆盖真实 repository 修改、terminal 操作和超长任务,方向上比只看代码补全更接近 agent 落地。
官方还报告约 80 tokens/s,并称在 SWE-Bench Pro 上平均输出 15,954 tokens,相比 Claude Opus 4.8 的 67,020 少约 4.2×。API 定价为输入 $2/M tokens、输出 $6/M。token efficiency 如果能被独立复现,会直接改变 coding agent 的成本结构;但不同模型的 harness、停止条件与成功样本分布都可能影响平均输出,不能只用厂商汇总值替代同环境评测。
ENTRY 005/015
[ 后训练 · MOE · 分布式训练 · ASCEND · 开源数据 ]
SLAI T-Rex:万卡 Ascend 上的超大 MoE 全参数后训练
(SLAI T-Rex: Full-Parameter Post-Training for Trillion-Scale MoE on Ascend)
SOURCE · arXiv · Hugging Face Daily Papers(2026-07-22)
SLAI T-Rex 给出在 Ascend SuperPOD 上对 trillion-scale MoE 做 full-parameter post-training 的系统方案,并发布 10K 条 solver-verified SFT 数据。
论文围绕 hierarchical parallelism、compute-communication orchestration 与定制 kernel 组织超大模型后训练。作者报告 34.22% MFU,相对其选定的开源 baseline 提升 2.93×;这类结果的价值不只在绝对吞吐,而在于证明非 CUDA 集群也能承载 trillion-scale MoE 的全参数更新,而不是局限于 LoRA 或少量 expert 调整。
配套 10K 条 operation-research 样本使用 solver 验证,模型 zero-shot Pass@1 达到 71.81%,作者称高于 GPT-5.4-mini 3.98 个百分点、比基础 V4 Flash 高 11.27 个百分点。需要留意,MFU 与速度比高度依赖拓扑、baseline 和 workload,跨平台不能直接横比;不过训练系统、可验证数据与任务结果同时披露,使它比单纯“国产算力适配成功”更有工程参考价值。
ENTRY 006/015
[ 图像生成 · 图像编辑 · VAE · FLOW · 推理优化 ]
Mage-Flow:4B 图像生成与编辑模型把 tokenizer 成本降一个数量级
(Mage-Flow Cuts Tokenizer Cost by an Order of Magnitude)
SOURCE · arXiv · Hugging Face Daily Papers(2026-07-21)
Mage-Flow 是覆盖 image generation 与 editing 的 4B flow model,结合 one-step diffusion encoding/decoding 的 Mage-VAE、native-resolution packing 与 CUDA fusion。
Mage-VAE 通过 anchor-latent regularization 保持可训练性,同时把 tokenizer 成本降低超过 10×;native-resolution packing 和 CUDA fusion 则让训练吞吐提升约 2.5×。项目同时给出 Base、RL 与 Turbo 路线,意味着同一基础模型可以分别服务高质量生成、偏好对齐和低延迟部署。
作者报告 1024×1024 图像在 A100 上生成约 0.59 秒、编辑约 1.02 秒。速度数字仍需在相同采样步数、batch size 与精度下比较,但“生成和编辑共用紧凑模型 + tokenizer 本身也被重做”的路线很实用:视觉模型的端到端成本不只来自 denoising backbone,编码、解码、不同分辨率 batching 同样可能成为瓶颈。
ENTRY 007/015
[ 视频生成 · DIFFUSION · 长视频 · 训练方法 ]
Self Gradient Forcing:让视频 diffusion 看见历史 context 的梯度
(Self Gradient Forcing Restores Context Gradients in Video Diffusion)
SOURCE · arXiv · Hugging Face Daily Papers(2026-07-22)
Self Gradient Forcing 修复 autoregressive video diffusion 中历史 context 不参与梯度更新的问题,使仅用 5 秒窗口训练的模型可外推到数分钟视频。
传统 autoregressive video diffusion 在训练时把历史片段当作固定条件,模型只能学习当前窗口的 denoising,却无法通过梯度纠正“如何生成更适合作为未来 context 的历史”。论文采用两阶段过程:先以 no-grad rollout 生成自身历史,再并行重建 context gradient,把后续误差反传到前序生成。
作者报告该方法改善长视频中的 identity、layout 与 temporal stability,而且训练窗口仍只有 5 秒。这里真正重要的是训练目标与推理分布更一致,而不是简单扩大 context 或堆显存。如果独立复现成立,它可能成为长程生成的通用补丁;但“数分钟”外推对场景类型、运动强度和评价协议非常敏感,仍应结合视频样例与量化指标判断。
ENTRY 008/015
[ RAG · RETRIEVAL · RERANKER · AGENT · 评测 ]
Beyond Relevance-Centric Retrieval:RAG reranker 相关,不代表文档集合好用
(Beyond Relevance-Centric Retrieval: Relevant Documents Do Not Guarantee a Useful Set)
SOURCE · arXiv · Hugging Face Daily Papers(2026-07-22)
论文提出约 28K rubrics、三层九维度的 setwise retrieval benchmark,并发现 12 个 reranker 中表现最好的系统也只能覆盖不超过 45% 的要求。
现有检索通常逐文档优化 relevance,但 agent 真正消费的是一个文档集合:它还需要 coverage、互补性、证据密度、冲突控制与上下文预算。单篇都相关的 top-k 结果,可能重复同一观点,也可能漏掉完成任务所需的关键证据。该 benchmark 把这种“集合是否足够支撑生成”拆成可检查 rubrics。
作者进一步提出 training-free 的 Rubric4Setwise,把 rubrics 转成文档集合选择信号,并报告用更少文档与更少搜索轮次改善最终 generation。对 production RAG 的启示很直接:retrieval eval 不应止于 Recall@k 或 NDCG,应把下游任务所需证据覆盖纳入测试;否则 reranker 分数上涨,agent 仍可能因为材料结构不完整而失败。
ENTRY 009/015
[ 机器人 · VLA · 具身智能 · 数据工程 ]
Xiaomi-Robotics-1:用 10 万小时真实操作轨迹扩大 VLA 后训练
(Xiaomi-Robotics-1 Scales VLA Post-Training with 100K Hours of Real Manipulation)
SOURCE · arXiv · Hugging Face Daily Papers(2026-07-16 · 2026-07-20 收录)
Xiaomi-Robotics-1 采用两阶段 VLA pre/post-training,并通过 UMI 与自动标注流水线处理超过 100K 小时的真实 manipulation trajectories。
项目的重点是把大规模真实机器人数据变得可训练:自动标注流水线描述状态变化与操作过程,随后用两阶段训练把通用视觉语言能力迁移到动作生成。相比只发布一个 checkpoint,这套数据获取与标注机制更接近机器人规模化的核心瓶颈,因为真实轨迹昂贵、噪声高且任务分布碎片化。
作者报告 RoboCasa365 得分 57.6,对比此前 46.6;RoboDojo 为 20.07,对比 13.07。跨 benchmark 的绝对值不能直接说明现实成功率,论文也仍需等代码与 checkpoints 完整落地后验证复现性。它与上期已覆盖的 Xiaomi-Robotics-U0 主题不同:U0 聚焦基础架构,本次更新的增量主要是 100K 小时数据管线与后训练配方。
ENTRY 010/015
[ 推理系统 · 模型路由 · MIXTURE-OF-MODELS · 可观测性 ]
vLLM Semantic Router:从模型路由器演进为 Mixture-of-Models runtime
(vLLM Semantic Router Evolves into a Mixture-of-Models Runtime)
SOURCE · vLLM(2026-07-21)
vLLM 将 Semantic Router 从 domain classifier 扩展为可组合的 Mixture-of-Models runtime,统一模型选择、cascade、fusion 与 workflow。
新设计把系统拆成 signals、decisions、workload、router 与 pool,并进一步区分 artifact、learning、execution、physical 四个 plane。一个 composite model 不再只是 gateway 中的条件分支,而是可版本化、可解析的运行对象:bundle 定义组件,binding 连接资源,resolution lock 固定实际模型与依赖,run record 保存一次执行的可归因轨迹。
这解决了多模型系统中常被低估的问题:同一个逻辑 agent 可能跨云、边缘和不同硬件动态选择模型,一旦缺少版本锁与 trace,结果就无法复现。v0.3 Themis 已加入 stateful routing、replayable traces、session continuity,并覆盖 ROCm、CUDA、OpenVINO 与 CPU。方向上,它把“选择哪个模型”从应用层 prompt 技巧提升为正式的 deployment primitive。
ENTRY 011/015
[ AMD · ROCM · 微调 · 强化学习 · 开源工具 ]
Unsloth 正式支持 AMD:消费级 Radeon 到 MI350 共用训练链路
(Unsloth Adds Official AMD Support from Radeon to MI350)
SOURCE · AMD · Unsloth(2026-07-20)
Unsloth Studio 与 Notebooks 现已支持 AMD RDNA/CDNA GPU,可在 Linux、WSL 和 Windows 上训练、微调、做 GRPO,并导出到 GGUF、safetensors 或 LoRA Adapter。
这次不是简单增加 device flag:custom kernels 被移植到 HIP/Triton,安装器会检测 gfx architecture 并选择 PyTorch、bitsandbytes、llama.cpp ROCm prebuild 与相应 kernel。完整支持范围包括 Radeon RX 7000/9000、Strix Halo、Instinct MI200/MI300/MI350;RDNA 2 目前仅 gfx1030 且只支持 Linux,AMD multi-GPU 也仍以 Linux/RCCL 为主。
在 MI300X 的 Llama-3.1-8B LoRA SFT 测试中,官方报告 2.07 s/step 对比 TRL + FA2 的 2.87 s/step,峰值显存 18.3 GB 对比 24.3 GB;Llama-3.2-3B GRPO steady-state step 为 1.75 秒,对比 2.01 秒。它还通过直接使用 vLLM LoRA path 避免 BF16 权重反复 merge/de-merge 导致的漂移。数据来自合作方测试,但命令、seed、token budget 与 loss curve 条件披露较完整,具备较强复现实用性。
ENTRY 012/015
[ SGLANG · SPECULATIVE · 推理优化 · 训练框架 · 开源 ]
SpecForge:SGLang 把 speculative decoding 训练与 serving 接成一条链
(SpecForge Connects Speculative-Decoding Training Directly to SGLang Serving)
SOURCE · SGLang · GitHub(文档更新于 2026-07-21)
SpecForge 提供统一 runtime 训练 EAGLE3、P-EAGLE、DFlash、Domino、DSpark 等 draft models,并直接导出到 SGLang serving。
SpecForge 的工程价值是消除“训练出 draft model 后再写一套部署转换脚本”的断层。online、offline 与 disaggregated training 共用 typed entry point,覆盖 data/tensor/sequence parallel、checkpoint selection,并支持 CUDA、ROCm 与 Ascend;specforge export 可从保留训练状态的 checkpoint 生成 SGLang 或 Hugging Face serving 目录。
最新文档还公开了单台 8×H200、Qwen3-8B Domino/DFlash draft 的调优记录:仅通过 configuration tuning,1-server + DP7 从 28.8 提升到 50.1 samples/s,增幅 74%。团队明确说明这是特定硬件、数据和 revision 的历史测量,不应当作当前版本通用性能承诺。相比只给漂亮倍数,这种同时记录拓扑、瓶颈与适用边界的 benchmark 更方便工程团队复现。
ENTRY 013/015
[ 科学计算 · 计算机视觉 · 3D成像 · SAM · 应用 ]
SYNAPS-I:Meta 与 Berkeley Lab 把 3D 成像分割压缩到 15 分钟
(SYNAPS-I Cuts 3D Imaging Segmentation to 15 Minutes)
SOURCE · Meta AI(2026-07-21)
SYNAPS-I 将 fine-tuned SAM 3 与 DINOv3 部署到 Berkeley Lab,用于 DOE beamline 的 3D scientific imaging segmentation。
传统流程需要专家为每个时间步做手工标注,完整处理可持续一个月;新系统将 3D semantic volume 的 turnaround 缩短到约 15 分钟,并计划部署在 300 张 A100 上。对同步辐射、材料和生命科学实验而言,这意味着分析速度更接近数据产生速度,研究者可以在实验尚未结束时调整采集策略,而不是数周后才发现数据缺口。
案例还展示了 open weights 的现实优势:模型可在实验室安全边界内做 on-prem fine-tuning 和 inference,不必把敏感或超大体积数据送到外部 API。需要注意,这不是通用 3D foundation model 的公开 benchmark,而是强 domain adaptation 后的系统成果;它的价值在于证明 foundation vision model 可以嵌入高吞吐科学设施的闭环。
ENTRY 014/015
[ AI · AGENT · 数据平台 · 自治实验室 ]
Microsoft Discovery GA:推理、数据与自治实验室进入同一科学 Agent 平台
(Microsoft Discovery GA Unifies Reasoning, Data, and Autonomous Labs)
SOURCE · Microsoft(2026-07-22)
Microsoft Discovery 进入 GA,整合 scientific models、agentic memory、Bookshelf 数据索引、多跳推理与 autonomous lab orchestration。
Discovery 试图覆盖从受治理数据检索、假设生成、模拟到实验执行的完整链路,而不是再提供一个通用聊天入口。Bookshelf 负责科学数据的整理与索引,agentic memory 保存持续研究状态,多跳推理跨文献与内部数据构建证据,实验室编排再把候选方案送入自动设备;桌面应用 preview 也通过 GitHub 提供。
Microsoft 引用 PNNL 案例称,一项原本可能耗时数年的分析被压缩到数周。该数字来自合作案例,任务边界和人工投入仍需更多披露,但平台 GA 说明 AI for Science 正在从单模型演示转向可治理的 workflow product。真正的落地难点会是 provenance、实验失败恢复、设备权限和结果复现,而不只是模型能否提出一个新分子。
ENTRY 015/015
[ AGENT · 自动化 · 工作流 · 产品 ]
Grok Automations:定时与邮件触发的持久化 Agent 任务
(Grok Automations Adds Scheduled and Email-Triggered Agent Jobs)
SOURCE · xAI(2026-07-16)
Grok Automations 可按时间表或入站邮件触发任务,每次运行创建新 conversation,并把结果保存在持续 thread 中。
scheduled trigger、email trigger、connectors 与 skills 的组合,让 Grok 从交互式对话扩展为后台 job runner。新 conversation 避免历史上下文无限膨胀,持久 thread 则保留跨运行结果,适合日报、监控、信息整理和周期性分析;邮件触发目前面向 SuperGrok 用户。
这种产品能力看似简单,却代表 agent 的基本单位从“消息”变成“有触发器、权限和状态的任务”。风险也随之变化:自动执行会放大错误频率,邮件输入还引入 prompt injection 与身份伪造问题。若连接外部系统,最小权限、触发来源校验、幂等设计和每次运行的可审计记录比 prompt 本身更重要。
其他值得关注
- vLLM 在 7 月 16 日公开 production-quality 流程,说明其 nightly CI 同时跟踪 accuracy、performance 与硬件回归;信息扎实,但属于持续工程机制而非本周新能力,未列入主榜。原文 — 原文
- microsoft/SkillOpt 本周进入 GitHub Trending,项目以 text-space optimization 自动改写 agent skills;核心论文与方法早于本次七日窗口,因此只记录热度变化。GitHub — GitHub
- Product Hunt 的 Basedash、Clark、Skippr AI 等近期 agent 产品获得曝光,但公开页面缺少架构、评测或可复现技术细节,未通过本期价值门槛。近期 AI Agents — 近期 AI Agents
- Hacker News 的相关讨论主要集中在 Unsloth、Kimi K3 与本地模型部署,未发现能够独立改变主条目结论的新证据;社区反馈仅用于交叉验证,没有单独成条。