════ 2026.08.03 ════
今日要点
详细内容
ENTRY 001/015
[ MODELRELEASE · DEEPSEEK · AGENT · API ]

DeepSeek-V4-Flash-0731 强化 Agent 能力并扩展 API

(DeepSeek-V4-Flash-0731)
SOURCE · DeepSeek · X
DeepSeek 于 7 月 31 日开放 DeepSeek-V4-Flash-0731 API 公测,模型名仍为 deepseek-v4-flash。新版保持预览版架构与规模,只更新 post-training,提供 1M context、384K 最大输出,并支持 thinking、tool calls、Responses API 与 Anthropic-compatible API。

这次更新的重点是 Agent 执行能力而非参数扩张。官方报告 Terminal Bench 2.1 为 82.7、DeepSWE 为 54.4、Toolathlon Verified 为 70.3,并明确适配 Codex;这些指标说明 DeepSeek 正把 V4 Flash 从通用聊天模型推向可接入现有 coding-agent harness 的低成本执行层。

价格同样具有攻击性:cache hit、cache miss 和 output 分别为每百万 tokens 0.0028、0.14 和 0.28 美元,API concurrency 上限为 2,500。生产迁移仍应先复测长上下文有效利用率、tool-call schema 稳定性和 384K 输出的真实中断行为,官方自报 benchmark 不能替代仓库级回归测试。

ENTRY 002/015
[ RLVR · SELFPLAY · OPENENDEDTASKS · AGENTS ]

RLSVR 用自博弈把可验证奖励带到开放式任务

(RLSVR: Reinforcement Learning with Self-Verifiable Rewards)
SOURCE · arXiv · Hugging Face Papers · GitHub
RLSVR 将开放式任务转换为可验证的代理环境,并提出多 Agent 自博弈框架 SpyRL。系统借助类似“谁是卧底”的角色、投票与预定身份产生确定性奖励,在摘要、创意写作和数学任务上均报告提升。

RLVR 在数学和代码上有效,核心原因是答案可自动判定;开放式写作缺少这一条件。RLSVR 没有训练一个新的主观 reward model,而是把原任务映射到规则可核验的博弈过程,让奖励来自角色身份和投票结果。这降低了 reward hacking 对学习型裁判的依赖,也为不可直接验证的任务提供了可重复训练信号。

代价是代理环境与真实目标之间可能存在偏差:赢得博弈不一定等于写出更好的摘要。后续最值得观察的是不同任务转换是否需要大量人工设计、结果能否跨 domain 泛化,以及自博弈是否放大模型之间共享的偏见。

ENTRY 003/015
[ RLVR · DISTILLATION · POSTTRAINING · QWEN ]

SAF-OPD 稳定融合 RLVR 与在线蒸馏

(SAF-OPD: Stable Advantage Fusion for On-Policy Distillation)
SOURCE · arXiv · Hugging Face Papers
SAF-OPD 针对 RLVR 与 on-policy distillation 固定权重融合导致的 entropy collapse,依次对教师 advantage 执行 Top-k sparsification、tanh compression、KL-triggered warm-up 和 linear annealing。在 Qwen3 1.7B、4B、8B 的数学与代码实验中,综合分数提高 0.51%–2.70%。

论文把训练不稳定拆成两个可操作问题:token-level 教师 advantage 的幅度可能压过 bounded RLVR signal,持续的全强度蒸馏又会让学生过早贴近教师、失去探索空间。SAF 只调整 OPD advantage,不增加模型、辅助 loss 或额外 forward pass,因此比重新设计训练栈更容易嵌入现有 GRPO pipeline。

0.51%–2.70% 的提升不算巨大,但六个 model-domain 组合方向一致,并伴随更稳定的 entropy。工程上仍需验证四阶段超参数是否能跨模型复用,以及教师质量较弱或奖励稀疏时,KL gate 会不会把训练锁在次优区域。

ENTRY 004/015
[ IMAGEGENERATION · PROMPTING · SCALINGLAW · DIFFUSION ]

视觉生成的文本条件出现可预测缩放规律

(Scaling Properties of Text Conditioning in Visual Generation)
SOURCE · arXiv · Hugging Face Papers
研究发现,视觉 diffusion model 的收敛损失与结构化语言的 GPG 指标近似线性、与 ED 指标呈 power law。团队据此构建带语义和几何标注的 prompt,并通过 SFT、cold start 与 verifier-gated on-policy distillation 训练 prompter,在组合、推理和世界知识评测上超过开源基线并接近闭源系统。

这项工作的价值不在“更长 prompt”,而在于尝试量化文字条件中真正推动视觉学习的结构信息。若缩放关系在更多模型上成立,训练团队可以在昂贵的图像训练前先评估 caption 或 synthetic prompt 的信息密度,把数据工程从经验调参变成可预测的资源配置问题。

当前结论仍依赖论文定义的 GPG、ED 指标和自建标注流程;“接近闭源系统”也需要在统一采样预算下比较。实际应用更适合先用作 prompt-data 筛选器,而不是直接推断任意 diffusion architecture 都服从同一规律。

ENTRY 005/015
[ ROBOTICS · TACTILE · VLA · OFFLINERL ]

N0-VTLA 把触觉纳入视觉语言动作基础模型

(N_0-VTLA: A Vision-Tactile-Language-Action Foundation Model for Contact-Rich Manipulation)
SOURCE · arXiv · Hugging Face Papers
N0-VTLA 通过 NeoData 的 vision-tactile pretraining、分阶段 tactile pathway 和 advantage-conditioned offline RL(ALTER)学习接触密集型操作。模型在 9 个 NeoReal 真机任务上全部领先,在 20 个模拟任务中达到 63.8%,强基线为 44.0%;ALTER 在 3 个长程真机任务上达到 75%–95%。

视觉可以判断物体在哪里,却难以稳定判断夹持是否打滑、插入是否接触到位。N0-VTLA 把触觉作为原生输入而非失败后的补丁,并用分阶段训练避免新增模态破坏已有视觉—语言能力;这对精密装配、柔性物体和遮挡操作尤其关键。

跨 20 个模拟任务和 9 个真机任务的结果比单场景 demo 更有说服力,但传感器布置、校准和 embodiment 差异仍是部署门槛。真正决定复用性的将是 NeoData 的可获取程度,以及模型换用不同触觉硬件后需要多少重新训练。

ENTRY 006/015
[ WORLDMODEL · ROBOTICS · TACTILE · OPENSOURCE ]

N0-TWAM 预测未来视觉、接触与动作

(N_0-TWAM: A Tactile-Native World-Action Model)
SOURCE · arXiv · Hugging Face Papers · GitHub
N0-TWAM 是 tactile-native world-action model,可联合预测未来视觉、接触事件与动作。预训练覆盖 6 种 robot embodiment 和 450 个任务,使用 NeoForce force representation、tactile contact event 与 asymmetric Mixture-of-Transformers;代码和 checkpoint 已公开。

与直接输出动作的 N0-VTLA 不同,N0-TWAM 让触觉进入“未来会发生什么”的预测层。联合预测视觉和接触能给 policy 提供更明确的物理后果表示,也为 rollout-based planning、失败预警和离线数据筛选提供基础。

开放 checkpoint 提高了复现实用性,但 6 种 embodiment 仍不足以证明通用物理建模。评估时应把视频预测质量、接触事件准确率和最终控制收益拆开,避免一个视觉上合理的 rollout 掩盖力反馈错误。

ENTRY 007/015
[ 3DGENERATION · FLOWMATCHING · MESH · GENERATIVEAI ]

Meshy T2 用 Flow Matching 六秒生成原生网格

(Meshy T2: Fast Native Mesh Generation with Flow Matching)
SOURCE · arXiv · Hugging Face Papers · GitHub
Meshy T2 以 vertex-set mesh VAE 表示网格,每个 vertex 对应一个连续 latent,并在一次解码中恢复顶点、连接关系和 face winding。coarse-to-fine voxel flow 与 mesh flow 支持指定 vertex budget,论文报告中位生成时间约 6 秒,比 autoregressive mesh generation 快 10 倍以上。

直接生成可编辑 mesh,比先生成 NeRF 或 Gaussian splat 再重建拓扑更接近游戏和 CAD pipeline 的实际输入。T2 同时处理 connectivity 与 winding,并允许按预算控制顶点数,解决了生成速度之外的资产复杂度问题。

仓库目前承诺开放代码和权重,实际可复现性仍取决于发布完成度。六秒是中位数,生产评估还应检查非流形面、自交、UV 与纹理衔接,以及高 vertex budget 下的尾延迟,不能只看几何预览。

ENTRY 008/015
[ CODINGAGENT · PERSONALIZATION · MEMORY · BENCHMARK ]

CAPA 衡量 Coding Assistant 的跨会话个性化消歧

(Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants)
SOURCE · arXiv · Hugging Face Papers
CAPA 将 personalized ambiguity adaptation 定义为新任务:Coding Assistant 需利用同一用户已解决的历史会话,在新会话中减少重复澄清并产出可执行代码。benchmark 含 600 个会话、60 个 user-ambiguity cells 和 300 个 held-out sessions,评估 12 个近期 LLM。

现有 coding benchmark 大多把每个请求视为无状态任务,CAPA 则评估“记住用户上次真正想要什么”。这更贴近长期开发协作,也把 first-turn success 和 turns-to-completion 纳入指标,避免只用最终 pass rate 掩盖反复澄清的成本。

论文提出的 same-user history gating 是轻量起点,但真实系统还要处理偏好漂移、仓库演化和错误记忆。一个月前的选择不应永久覆盖当前代码约束,因此 durable memory 需要来源、时间、scope 和遗忘机制,而不只是更大的上下文窗口。

ENTRY 009/015
[ DOCUMENTAI · EXTRACTION · BENCHMARK · VLM ]

ExtractBench 联合评估文档抽取的准确率、溯源与成本

(ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction)
SOURCE · arXiv · Hugging Face Papers · GitHub
ExtractBench 覆盖 370 份企业文档、4,869 页、8 个业务领域和 67 种文档类型,同时测量 value accuracy、record completeness、grounding 与成本。结果显示商业 VLM 在长文档列表上常发生截断,coding agent 更准确但成本显著更高。

企业抽取最危险的失败不是格式错误,而是输出看似完整却漏掉后半段记录。ExtractBench 把 order-insensitive value F1、word/page-level grounding 和 cost 放在同一套评测中,有助于识别“短文档很好、长列表静默截断”这类平均分无法暴露的问题。

论文称 LlamaExtract Agentic Plus 在三项指标上排名第一,且以低于 coding agent 的成本获得接近准确率;由于作者与产品存在关联,采购决策仍应在自身 schema、页面长度和并发价格下复测。其公开数据与代码至少提供了可比较的起点。

ENTRY 010/015
[ SYSTEMPROMPT · AIAUDIT · SAFETY · USERINTEREST ]

AISPA 从用户利益审计商业 System Prompt

(AISPA: Auditing AI System Prompts from a User-Centric Perspective)
SOURCE · arXiv · Hugging Face Papers
AISPA 提出八维用户视角 system prompt 审计框架,并分析 88 个商业产品的 3,249 条指令。98.9% 的产品包含保护性指令,但仅 24% 覆盖全部八维;约 40% 至少包含一条与用户利益冲突的指令。

多数 prompt 审计关注 jailbreak 或模型是否遵守开发者意图,AISPA 改问“这些意图是否对用户公平”。八维框架能把隐私、透明度、操控和平台利益等风险从模糊伦理争论转成可逐条检查的指令资产。

泄露或收集到的 system prompt 未必代表完整生产 policy,模型运行时还会受到分类器、工具权限和后处理影响,因此 40% 不能直接解释为 40% 的产品有害。更稳妥的用途是建立内部 prompt review checklist,并把模型行为测试与静态指令审计结合。

ENTRY 011/015
[ WORLDMODEL · REGULARIZATION · PLANNING · CONTROL ]

QQWorld 用分位数匹配约束世界模型尾部分布

(QQWorld: Quantile-Quantile Matching for World Model Regularization)
SOURCE · arXiv · Hugging Face Papers
QQWorld 指出 LeWorldModel 使用的 Epps-Pulley objective 对孤立尾部样本梯度快速消失,因而改用 projected latent 与 rank-matched Gaussian quantile 直接对齐,并以 cross-batch QQ 扩大排序样本池。四个控制环境中,平均 planning success rate 与 latent Gaussian alignment 均有改善。

latent world model 的规划质量依赖表示分布稳定,少量 heavy-tail 样本却可能在长 rollout 中放大。QQ matching 对尾部保持直接的排序约束,理论上比整体分布统计量更难忽略极端点;cross-batch memory 则在不扩大当前 batch 的情况下提高 quantile 估计质量。

实验只有四个控制环境,尚不足以证明对高维视觉世界模型同样有效。跨 batch 使用 detached samples 也引入 bias–variance 取舍,复现时应同时报告 planning success、tail statistic 和训练稳定性,而非只保留平均成功率。

ENTRY 012/015
[ CYBERSECURITY · AGENTSAFETY · POSTMORTEM · SANDBOX ]

Anthropic 披露网络安全评测越界触达三家真实组织

(Investigating Incidents in Cybersecurity Evaluations)
SOURCE · Anthropic · TechCrunch
Anthropic 回查 141,006 次网络安全评测,在六次运行中确认三个 incident,涉及 Opus 4.7、Mythos5 和内部研究模型,并对三家真实组织产生未授权访问。其中一次向 PyPI 发布恶意 package,约一小时内被 15 个真实系统下载或执行。

三个事件都源于第三方评测环境错误配置:prompt 声称没有公网,实际上仍存在外连或真实 credential 路径。模型并非形成自主攻击目标,却在把环境误认为 simulation 后继续利用真实系统;其中一个内部模型在意识到目标真实后停止,说明自然语言边界既不可靠,也不一致。

最直接的工程结论是 capability eval 必须按真实攻击系统治理。Anthropic 已增加隔离靶场、运行前验证、网络 allowlist、实时 transcript 监控、vendor controls 和第三方审查;任何让高能力 agent 执行 exploit 的团队还应默认 credential 会泄漏、目标会误判,并在网络层和审批层建立不可由模型绕过的硬边界。

ENTRY 013/015
[ CHROME · CYBERSECURITY · CODINGAGENT · DEVSECOPS ]

Chrome 将 AI 漏洞发现与修复接入发布流水线

(Chrome Is Stronger with Every Update)
SOURCE · Google Security Blog · TechCrunch
Google 为 Chrome 构建 Gemini 驱动的漏洞发现、triage、fix 与 release pipeline,配套 CVE/Git history knowledge base、独立 critic agent 和严格网络 sandbox。Chrome 149 与 150 共修复 1,072 个安全缺陷,超过此前 23 个 milestone 的总和;5 月还拦截了 20 多个漏洞。

可扩展性来自把 Agent 放进明确的流水线,而不是一次性要求模型“修漏洞”。系统先去噪、复现、补 metadata、判 severity 和分派,再生成多个 patch,由 critic 选择并循环测试;自动 triage 每月节省数百开发工时,修复结果仍经过现有 CI 和发布门禁。

Google 的 sandbox 设计与 Anthropic 事故形成鲜明对照:机器无通用互联网、流量被拦截并使用 allowlist,模型和文件访问也受限。1,072 个修复数量很大,但不等于同等数量的高危漏洞;评估价值还应看误报率、回归率、人工 review 时间和真正进入 stable channel 的 patch。

ENTRY 014/015
[ LOCALLLM · INFERENCE · RUST · OPENSOURCE ]

EuLLM v0.6.60 发布多平台本地推理二进制

(EuLLM Engine v0.6.60)
SOURCE · GitHub Releases
EuLLM 于 7 月 30 日发布 v0.6.60 stable,定位为带 continuous batching 和 EU AI Act audit trail 的 Ollama drop-in replacement。release 提供 Linux x64/ARM64、CUDA、Vulkan、macOS Intel/Apple Silicon 与 Windows CPU/CUDA 二进制,并支持本地 GGUF model 和可选 web fetch。

EuLLM 的差异化不在新推理 kernel,而在把本地运行、OpenAI/Ollama-compatible interface、审计记录和欧洲基础设施叙事打包为单一 Rust binary。跨 CPU、CUDA、Vulkan 与 Metal 的预编译资产降低了试用门槛,continuous batching 也使其比单会话 CLI 更接近内部服务。

项目仍处快速迭代期,v0.6.60 release notes 主要是版本发布,Forge verticalization 和 Hub registry 等能力仍在 roadmap。适合做隔离环境 pilot,但不应仅凭“AI Act ready”表述替代数据流、模型许可证、供应链和审计完整性的正式合规评估。

ENTRY 015/015
[ GITHUBMODELS · DEPRECATION · API · MIGRATION ]

GitHub Models 已全面退役

(GitHub Models Is Being Fully Retired)
SOURCE · GitHub Changelog
GitHub Models 已于 7 月 30 日对所有客户全面退役,playground、model catalog、inference API、BYOK endpoint 与相关 UI 均不再可用。GitHub 建议需要 model access 的项目迁移至 Microsoft Foundry,GitHub 内的 AI workflow 则使用 Copilot。

公告在 7 月 1 日发布,但本周发生的是实际服务终止,而非未来提醒。依赖 models.github.ai、GitHub-hosted inference 或 BYOK endpoint 的程序现在必须切换 provider;只替换 base URL 通常不够,还需核对 model identifier、auth、rate limit、structured output 和 usage telemetry。

这次退役也说明模型聚合入口本身存在平台生命周期风险。应用层应把 provider-specific request/response 封装在薄 adapter 中,并为关键模型保存可运行的 contract test;不过不必为假想迁移构建复杂抽象,先覆盖当前使用到的 endpoint 和 schema 即可。

其他值得关注