════ 2026.08.16 ════
今日要点
详细内容
ENTRY 001/015
[ MODELRELEASE · XAI · AGENT · CODING · MULTIMODAL ]

Grok 4.6 强化长程 Agent 与视觉工作流

(Grok 4.6)
SOURCE · Frontier Release · xAI · AI News
xAI 发布 Grok 4.6,重点提升 long-running agent、视觉生成与编辑、coding 和 technical reasoning。官方报告其 Artificial Analysis Intelligence Index 为 61,CursorBench、DeepSWE、FrontierCode 与 TerminalBench v3 分别为 69.9、65.9、61.3 和 26;API 提供 500K context、可调 reasoning,价格为每百万 input/output tokens 2/6 美元。

这次升级没有只追求短题 benchmark,而是强调模型在较长时间内调用工具、维持任务状态和处理视觉产物。xAI 将提升归因于延长的补充训练、模型生成的 reasoning/technical data、优化器改进与 agentic RL;与同日进入 Cursor、Grok Build 和随后上线 GitHub Copilot 结合看,4.6 的核心产品定位是 coding agent backbone,而不是单纯聊天模型。

官方分数仍跨越多套 harness,不能直接视为同一条件下的横向排名,尤其 TerminalBench v3 的绝对值说明终端任务仍远未解决。生产评估应固定 agent harness、reasoning effort、工具权限和 token budget,重点观察长任务成功率、视觉返工次数与每项完成成本,而不只比较单轮准确率。

ENTRY 002/015
[ MODELRELEASE · DEEPSEEK · OPENWEIGHTS · RESPONSESAPI · AGENT ]

DeepSeek-V4-Pro-0813 更新 Agent 接口与峰谷定价

(DeepSeek-V4-Pro-0813)
SOURCE · Frontier Release · DeepSeek · HF Models · Reddit
DeepSeek 于 8 月 13 日上线 DeepSeek-V4-Pro-0813,App、Web 与 API 共用 deepseek-v4-pro model id,并提供适配 Codex 的 Responses API 与 low、high、max reasoning effort。官方列出 HLE with tools 60、TerminalBench 2.1 87.9、NL2Repo 61.5、DeepSWE 62.7 与 Toolathlon 74.1;模型支持 1M context 和最高 384K output。

0813 更像面向 Agent runtime 的生产更新:除了模型能力,关键变化是将 Responses API、reasoning effort 和更长输出正式纳入接口。对使用 Codex-style event stream 或长程工具调用的团队,这能减少自建协议适配;但 384K 最大输出并不代表应默认放宽预算,长轨迹仍需要外部状态、超时和成本 gate。

8 月 16 日起的新价格按峰谷时段区分;Pro 在 off-peak 的 cache hit、cache miss、output 分别为每百万 tokens 0.022、0.66、1.98 美元,peak 则翻倍为 0.044、1.32、3.96 美元。便宜缓存输入会鼓励稳定 prefix 和长会话复用,但真实任务成本仍由大量 reasoning output 与工具重试主导,迁移前应按完整 Agent trace 计费,而不是只比较 input 标价。

ENTRY 003/015
[ MODELUPDATE · QWEN · OPENWEIGHTS · MOE · LOCALLLM ]

🔄 Qwen3.8 兑现 Max 级与 27B 开放权重

(Qwen3.8 Open Models)
SOURCE · Frontier Release · Qwen · HF Models · Reddit
Qwen 发布 Qwen3.8-2.4T-A95B 与 Qwen3.8-27B 权重。2.4T 版本每 token 激活 95B 参数,采用 92 层 hybrid Gated DeltaNet/attention MoE、512 experts 中激活 10 routed + 1 shared,原生 262,144 context 并可扩展至约 1.01M;27B 是 dense vision-language 模型,原生 262K context,同样支持 reasoning_effort 与 preserve_thinking。

这是 8 月 5 日 Qwen3.8-Max 发布后最重要的兑现:2.4T-A95B 首次把 Qwen-Max 级 post-trained model 直接开放,官方卡给出 TerminalBench 2.1 86.6、SWE-bench Pro 67.7、PaperBench 93.0 与 CoWorkBench 74.8。开放版本与托管 Max 并不完全等价:2.4T 权重是 text-only、强制 thinking,托管 Max 另外提供视觉输入、non-thinking、默认 1M context 和内置工具。

对多数团队,更现实的部署对象是 Apache 2.0 的 27B。它在官方卡中达到 TerminalBench 2.1 73.0、SWE-bench Pro 61.7、OSWorld 84.3 与 WebArena 64.8,但 Reddit 的早期体验对速度、量化精度和实际代码质量存在分歧。应分别复测 BF16/量化版本、thinking budget 与目标 harness;2.4T 的“开放”主要解除供应商锁定,不会自动降低基础设施门槛。

ENTRY 004/015
[ OPENWEIGHTS · META · LOCALLLM · MULTIMODAL · SPECULATIVEDECODING ]

Muse Glimmer 30B 将多模态 Agent 压进单张工作站显卡

(Muse Glimmer 30B)
SOURCE · Frontier Release · Meta · HF Models · Reddit
Meta 开放 Muse Glimmer 30B:29.6B dense causal LM 搭配约 1.8B vision encoder,支持文本、图像与 131,072+ context,采用 Apache 2.0。4-bit 版本可控制在约 20GB 内;官方模型卡给出 MCP Atlas 75.5、DeepSearch 74.6、SWE-bench Pro 51.2,并以 16-token block speculative decoder DFlash 报告 RTX 5090 从 74.9 提升到 233.4 tok/s。

Glimmer 的差异化不只是 30B 规模,而是模型与 speculative decoder 一起发布。DFlash 预测 token block,再由主模型验证;官方结果在 RTX 5090 上约 3.1 倍、M4 Max 上约 1.6 倍、M5 Max 上约 1.9 倍,说明加速路径覆盖 CUDA 与 Apple Silicon,不过收益会随 prompt、acceptance rate、batch 和实现变化。

早期 Reddit 反馈两极:部分用户认可其 30B class 的 agent/tool 能力,另一些用户认为长输出和单文件 coding 不及前代 Qwen 27B。量化说明估计 dynamic 4-bit 退化约 0.2%,17GB aggressive quantization 约 1%,但这些仍是模型卡条件;本地采用前应同时测 tool-call schema、视觉理解、长 context 稳定性和 speculative acceptance,而不是只看 tok/s 峰值。

ENTRY 005/015
[ WORLDMODEL · VIDEOGENERATION · EXTERNALMEMORY · DISTILLATION · 论文 ]

Alaya-EVOKE 用外部世界状态支撑无限交互生成

(Alaya-EVOKE: From Linear-Scaling Supervision to Endless World)
SOURCE · arXiv · HF Papers
Alaya-EVOKE 将场景几何保存在 camera-indexed external world-state bank,仅检索当前视角相关信息,使 denoiser context 不随会话长度增长。teacher 以 chunk grouping、远帧检索和 linear global state 形成稀疏注意力,再用 30 秒 self-forced rollout 的 distribution matching 将能力蒸馏到 three-step student;单张 H200 上每个 384×640、1.5 秒 chunk 用时 2.11 秒。

交互式世界模型同时要求长记忆和低延迟,而把所有历史帧留在 denoiser context 或 KV cache 会让成本持续增长。Evoke 将持久世界状态与当前生成窗口拆开,并让 teacher 真正在长 rollout 中暴露局部看似合理、长期却逐渐漂移的错误;这比只在短 clip 上训练 few-step student 更贴合持续交互。

2.11 秒生成 1.5 秒视频仍未达到实时,384×640 也不是高分辨率产品条件,但“bounded context + recurrent external memory”是更可扩展的系统设计。后续关键不只是 VBench/WBench 分数,而是摄像机回访旧区域时的几何复原、状态更新冲突、memory bank 增长速度和多小时会话的 drift。

ENTRY 006/015
[ LATENTREASONING · RECURRENTMODEL · ARCAGI · EFFICIENCY · 论文 ]

BDH-CQ 以 150M 参数刷新 ARC-AGI 成本边界

(BDH-CQ: In-Context Learning with Recurrent Latent Reasoning)
SOURCE · arXiv · HF Papers · GitHub
BDH-CQ 将 in-context demonstrations 持续写入 recurrent memory,再在高维 latent space 中迭代求解而不 verbalize 中间 reasoning。150M 参数配置在 ARC-AGI-1 public evaluation 上达到 29.5% pass@2,论文估算每题 inference cost 为 0.0007 美元,形成新的 cost-accuracy Pareto point。

这个结果的价值不是用小模型击败所有 frontier model,而是在极低推理成本下建立新的效率点。模型把示例驱动的规则归纳与查询求解放进连续 recurrent state,避免显式 chain-of-thought 的 token 成本,也为“增加 latent compute、而非增加输出长度”提供了可测实例。

ARC-AGI-1 是高度结构化的抽象变换任务,29.5% pass@2 不能外推到语言、工具或真实软件工程。更有意义的后续验证是:recurrent memory 是否能处理噪声示例、长序列冲突与跨领域任务,以及 silent latent reasoning 在可解释性、安全审计和 early-exit 上需要什么替代信号。

ENTRY 007/015
[ SCIENTIFICAI · FOUNDATIONMODEL · AGENTRL · MULTIMODAL · 论文 ]

Intern-S2-Preview 训练 397B 科学 Agent 基座

(Intern-S2-Preview: Scientific Agentic Foundation Model)
SOURCE · arXiv · HF Papers · Research Blog
Intern-S2-Preview-397B 面向科学文档、多模态理解、数值预测和长程工具任务,训练管线串联 scientific multimodal pre-training、SFT、multi-task RL、black/white-box agentic RL 与 on-policy distillation。系统还引入 partial rollout with off-policy correction、adaptive length regularization、online speculative decoding 和 trace-aware experience assembly。

Intern-S2 的重点是将科学任务从“回答论文问题”扩展到异构证据、工具环境与长轨迹。时间序列模块直接承担 scientific signal understanding/forecasting,另有独立 Intern-MemDec-4B 在冻结 397B backbone 的前提下做快速领域记忆扩展,将 Biology-Instructions 平均分从 56.92 提至 60.32。

目前披露更像完整技术路线图,397B 规模、数据构成与多阶段 RL 也让独立复现困难。团队评估时应拆开检验文档理解、数值预测、工具调用和记忆扩展,避免综合 benchmark 掩盖单项失败;尤其要验证 time-series input 的校准、不确定性表达,以及 Memory Decoder 更新后的遗忘与 provenance。

ENTRY 008/015
[ ROBOTICS · WORLDMODEL · VIDEOGENERATION · GEOMETRICENCODING · 论文 ]

DreamX-Phi 1.0 用几何约束预测机器人动作后果

(DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation)
SOURCE · arXiv · HF Papers · Alibaba Research
DreamX-Phi 1.0 根据当前图像、语言指令及包含 end-effector pose 与 gripper state 的动作序列生成未来观察。模型将每条机械臂的 SE(3) transformation 通过 PRoPE-style encoding 注入 attention,并加入 depth branch、SAM3 object mask 与冻结 V-JEPA teacher,再用 distribution-matching distillation 得到 few-step student。

机器人 world model 的主要风险是画面看起来合理,却让错误机械臂运动或丢失被抓取的小物体。DreamX-Phi 分别用 per-arm geometry、scene depth 和 object-level teacher 约束三个故障面,比仅依赖像素重建更接近 policy rollout 所需的因果一致性;论文报告其在 WorldArena 2.0 两个 track 分列第一和第二。

排行榜成绩仍不足以证明可直接用于 model-based control。需要继续测 action perturbation、遮挡后物体持续性、双臂交叉和长 rollout error accumulation,并核验 few-step distillation 是否在最危险的 contact event 上牺牲细节。代码与模型尚以“将公开”表述,复现性要等实际资产落地后再判断。

ENTRY 009/015
[ WORLDMODEL · BENCHMARK · MULTIMODALAGENT · LONGHORIZON · OPENSOURCE ]

PlayWorld 让 Agent 闭环评测九个交互世界模型

(PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives)
SOURCE · arXiv · HF Papers · GitHub
PlayWorld 提供 171 个带长程目标的交互场景,由 multimodal Agent Player 持续观察生成帧和 action history,再为不同 world model 自适应选择动作。评测覆盖 geometry consistency、interaction fidelity、out-of-sight evolution、in-sight evolution 以及基础视频质量与 controllability;九个当前模型在空间一致性和持久状态演化上仍不可靠。

固定 action sequence 对交互模型并不公平:不同系统的动作粒度、响应速度和状态起点不同,同一串按键可能根本到不了同一目标。PlayWorld 改用闭环 Agent 追逐相同 objective,让评测从“复现轨迹”转成“完成任务”,更接近真人在世界模型中转身回看、进入水面或离开后重返场景的使用方式。

这种方法也引入新的 confounder:最终分数同时受 world model 与 Agent Player 能力影响。排行榜应报告玩家模型、prompt、观测采样率和重试预算,并以多种 player 复测;否则 Agent 的导航失败可能被误记为模拟器失败。即便如此,它对 persistent state 的显式拆分仍比短视频美学评分更能暴露长期世界建模缺口。

ENTRY 010/015
[ VLM · SPATIALREASONING · AGENTMEMORY · SELFEVOLUTION · 论文 ]

Spatial Memory Agent 让冻结 VLM 从可验证经验中进化

(Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence)
SOURCE · arXiv · HF Papers
Spatial Memory Agent 在可验证空间环境中收集 frozen VLM 的预测与 reward,通过 verifier-guided reflection 提炼可迁移 procedure lesson,并为每条 lesson 维护 Transfer Reliability Score。检索时联合 semantic relevance 与经后续使用结果校准的 TRS 排序,无需参数更新或外部 spatial expert tools。

传统 memory retrieval 只问“这条经验是否语义相似”,SMA 额外追踪“它过去被取回后是否真的有帮助”。这让 procedure memory 具有在线 reliability calibration,能逐渐降权表面相似但误导的经验;论文在五个 benchmark、四个 VLM 的 macro average 上均取得各 block 最优结果。

方法依赖可验证 reward,因此最适合几何关系、视角转换和有明确答案的空间题。开放环境中的 verifier error、reward sparsity 与场景分布变化可能让 TRS 固化早期偏见;工程实现需要保留 lesson provenance、访问次数和置信区间,并允许过期、冲突经验被替换,而不是把评分当永久真值。

ENTRY 011/015
[ MODELROUTING · LLMOPS · BENCHMARK · COSTOPTIMIZATION · OPENSOURCE ]

LLMRouter 统一 16+ 模型路由器的训练与评测

(LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers)
SOURCE · arXiv · HF Papers · GitHub
LLMRouter 将模型路由统一表述为由 context encoder、model encoder、scoring function、decision rule 与 learning signal 构成的 sequential decision process,覆盖单轮、多轮与个性化场景。配套 xRouteBench 涵盖通用 LLM、memory-augmented、vision、time-series 和 personalized routing,并实现 16+ representative routers。

模型越来越多后,路由研究常因任务、价格、候选模型和 objective 不同而无法公平比较。LLMRouter 将 supervision construction、quality/cost 联合评估与部署接口放在同一框架中;实验显示 learned router 相对最强 fixed-model baseline 提升 14.6%,tight budget 下 lightweight router 更具竞争力,user-conditioned routing 也稳定改善个性化。

14.6% 是特定 benchmark 与成本定义下的相对收益,不代表上线即可按同一比例降费。生产路由还要处理 provider latency、rate limit、context compatibility、tool schema 和 privacy policy;更稳妥的采用方式是先把当前 fixed rule 作为 baseline,用真实 traffic replay 验证质量下限,再逐步开放 learned decision。

ENTRY 012/015
[ AGENTHARNESS · SELFIMPROVEMENT · DESIGNAGENT · BENCHMARK · OPENSOURCE ]

AutoDesign 让 Meta-Harness 从设计 Rollout 中自我优化

(AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design)
SOURCE · arXiv · HF Papers · GitHub
AutoDesign 用 meta-harness optimizer 根据 rollout feedback 递归改进 code agent 的 DesignHarness,并以 100 篇跨五学科论文构成 PosterBench Main Track。系统得分 78.32,比 Claude Design 高 7.45;七种 agent/model 配置接入 learned harness 后平均从 54.99 升至 67.39。

相比让模型直接生成一次海报,AutoDesign 把版式先验、工具协议、检查步骤和修正策略都视为可优化 harness。完整 autonomous loop 在 40 分钟内执行 253 次 tool calls、11 次 editing turns、成本低于 3 美元,说明“改执行系统”可以跨模型迁移,而不必每次微调 backbone。

PosterBench 仍是边界清晰的单一设计任务,meta-harness 是否能避免对 benchmark style 过拟合尚不确定。值得迁移的是优化单元:将 rollout failure 转成可版本化的工具和检查策略,并在独立数据上验证;生产系统还需限制自动修改范围、保留旧 harness、记录每次演化的 evidence,防止自我改进变成不可审计的 prompt drift。

ENTRY 013/015
[ SMALLMODEL · TOOLCALLING · EDGEAI · INFERENCE · OPENSOURCE ]

Needle2 用 45M 参数在 28MB RAM 内执行工具调用

(Needle2)
SOURCE · GitHub · OpenSource
Needle2 是面向结构化提取与 tool calling 的 45M 参数小模型,发布为约 14MB 单一 binary,运行时约占 28MB RAM。系统用 256-token sliding window 搭配 tool KV sinks、top-5 tool retrieval 与 confidence gating,并以 CQ 2-bit quantization 和 Simple Attention Network 压缩部署。

Needle2 不尝试做通用聊天,而是把极小模型集中在边缘设备最常见的 schema extraction、intent routing 与有限工具选择。tool retrieval 先缩小候选集合、confidence gate 决定是否执行,使 256-token window 不必容纳完整工具目录;Hadamard MLP、GQA、engram KV memory 与 hyperconnections 则共同降低内存和计算。

这类模型的价值取决于受限任务中的 precision 与 abstention,而不是语言 benchmark。部署时必须测未见 schema、工具名称冲突、恶意参数与低置信 fallback;28MB RAM 很适合 embedded control plane,但高风险动作仍应由 deterministic validator 或更强模型复核。

ENTRY 014/015
[ FINETUNING · LOWVRAM · QLORA · EVALUATION · OPENSOURCE ]

Soup 在 4GB Laptop GPU 上流式微调 8B 模型

(Soup v0.73.2)
SOURCE · GitHub · OpenSource
Soup 通过 layer streaming 让 Llama 3.1 8B NF4 在 4GB laptop GPU 上训练,项目报告约 119.6 tok/s、3.32GB peak VRAM 与 bit-exact 更新。v0.73.2 修复 eval gate 的 tool parsing,使一组 MMLU 检查从 0.423 恢复到 0.731,并加入 over-refusal mirror 与 noise-floor repeats。

layer streaming 将不活跃 layer 留在系统内存,只把当前计算所需部分送入 GPU,因此重点不是进一步压缩模型,而是重新安排参数移动与训练顺序。对只有 4GB VRAM 的个人设备,这为小数据 adaptation 和实验打开了空间;代价则会转移到主存容量、PCIe bandwidth、训练时延与硬件兼容性。

0.73.2 的 MMLU 跳升来自 eval tool parsing 修复,而不是模型突然变强,这正说明训练工具必须把 evaluation pipeline 纳入版本验证。使用者应分别记录 optimizer、quantization、sequence length、CPU RAM 和实际 wall time,并用保存前后 checkpoint 做独立 eval;项目 benchmark 不能替代目标硬件上的端到端复测。

ENTRY 015/015
[ DOTNET · INFERENCEENGINE · GGUF · DISTRIBUTEDINFERENCE · OPENSOURCE ]

TensorSharp 为 .NET 带来原生 GGUF 分布式推理

(TensorSharp)
SOURCE · GitHub · OpenSource
TensorSharp 是原生 .NET GGUF inference engine,支持 paged KV cache、continuous batching、跨 GPU/机器 tensor parallel,以及文本、多模态与 diffusion 模型。项目报告 Muse Glimmer 在 TP=2 时 prefill/decode 分别提升 1.34×/1.57×,DeepSeek V4 的 speculative block decoding 在 multiturn 场景可提升约 1.3–1.4×、特定设置最高接近 2×。

.NET 团队通常需要通过 Python service 或 native binding 使用最新本地模型,TensorSharp 试图把 tokenizer、graph execution、KV management 和 distributed transport 都放进 C# runtime。对已有 ASP.NET、Windows desktop 或企业 .NET stack 的项目,这能简化部署与 observability 边界,并让 Muse Glimmer、DeepSeek V4 等新模型更快进入同一服务层。

项目 benchmark 受 quantization、GPU topology、prompt length、batch 和 draft acceptance 影响,尤其“最高 2×”不能外推到所有多轮请求。正式采用前需要验证数值一致性、unsupported op fallback、跨机故障恢复和 memory fragmentation;原生实现的长期成本还包括持续追赶快速变化的 GGUF metadata 与模型架构。

其他值得关注