════ 2026.07.16 ════
今日要点
详细内容
ENTRY 001/015
[ AI SAFETY · PROMPT INJECTION · RED TEAMING · GPT-5.6 ]
GPT-Red 用自我博弈自动发现 prompt injection
(Unlocking self-improvement with GPT-Red)
SOURCE · OpenAI 官方研究
GPT-Red 通过 attacker 与 defender LLM 的自我博弈持续生成和验证攻击,并被用于 GPT-5.6 的安全训练。OpenAI 报告,在新型间接 prompt injection 场景中 GPT-Red 以 84% 对 13% 击败人工红队;GPT-5.6 Sol 在最难直接注入测试上的失败数比四个月前的最佳生产模型减少约 6 倍。
关键进展不是又增加了一套静态 jailbreak 数据,而是把攻击发现本身变成可扩展的训练循环。攻击方与防守方共同迭代,可以覆盖人工难以穷举的工具调用、网页内容和长轨迹组合。
这类结果仍主要来自 OpenAI 自建评测,不能直接等价为真实世界风险已经解决;但从 GPT-5.1 上超过 95% 的 Fake CoT 攻击成功率降到 GPT-5.6 的不足 10%,说明自动红队已开始对模型训练产生可量化影响。
ENTRY 002/015
[ WORLD MODEL · ROBOTICS · MULTIMODAL · OPEN SOURCE ]
小米开源 38B 多模态世界基础模型
(Xiaomi-Robotics-U0)
SOURCE · Xiaomi Robotics · arXiv · Hugging Face · GitHub
Xiaomi-Robotics-U0 是基于 EMU3.5 初始化的 38B 自回归多模态模型,以统一视觉 token 目标覆盖 text-to-image、图像编辑、视频生成和具身场景预测。论文报告其在 World Arena 排名第一,并把 pi_0.5 的 OOD 操作成功率从 36.9% 提升到 63.2%。
U0 的价值在于保留通用视觉生成能力,同时把多视角、不同机器人本体的数据纳入同一个世界建模目标,减少机器人数据对专用架构的绑定。对具身系统而言,这比单一机械臂上的离线指标更接近可迁移的视觉先验。
自回归视觉模型的主要短板是解码速度。团队用 FlashAR 的反对角解码与 vLLM batching,将单张 H20 上的 1024×1024 生成时间压到 5.44 秒;这仍不是实时控制延迟,但显著改善了数据生成和策略训练的吞吐瓶颈。
ENTRY 003/015
[ IMAGE GENERATION · IMAGE EDITING · OPEN WEIGHTS · INFERENCE-TIME SCALING ]
Boogu-Image-0.1 开放图像生成与编辑全栈
(Boogu-Image-0.1)
SOURCE · arXiv · Hugging Face · GitHub
Boogu-Image-0.1 提供 Base、Turbo、Edit 和 Edit-Turbo 四个 10B 模型,支持中英文字渲染、图像生成与编辑,并以 Apache-2.0 发布权重、代码和训练配方。训练使用约 2.0862 亿张去重图像,团队估算基础训练成本约 40 万美元。
它的差异点不只在开放权重,而在于同时公开数据处理、训练与加速版本,降低复现实用图像模型的门槛。Base/Edit 与 Turbo 分离,也让研究者能区分质量上限和部署效率,而不是只能评估一个黑盒 endpoint。
论文还展示 agentic inference-time scaling:系统可在生成后检查文本、布局或编辑约束,再迭代修正。它把 test-time compute 从语言推理延伸到视觉生成,但实际收益仍需要独立评测验证。
ENTRY 004/015
[ REINFORCEMENT LEARNING · REASONING · SCALING · ZERO RL ]
Ring-Zero 将 Zero RL 扩展到 1T 参数
(Ring-Zero)
SOURCE · arXiv · Hugging Face Papers
Ring-Zero 针对 1T 参数模型设计 Zero RL 训练流程,组合 clipped importance sampling、training-inference ratio correction 与 mixed precision,并把训练拆成探索和锐化两个阶段。作者报告模型在七个数学基准上达到有竞争力的结果,同时出现自检、并行推理和结构化输出等行为。
Zero RL 的吸引力是绕过昂贵的人工 CoT 数据,但扩到万亿参数后,policy drift、采样分布偏差和数值稳定性会同步放大。Ring-Zero 的贡献主要是把这些工程问题明确化,并给出一套可以持续训练的组合方案。
论文对 reasoning trace 的可理解性、可复现性和效率也做了单独评估,这是比“数学分数上涨”更重要的部分。涌现出来的自检行为是否可迁移到非数学任务,仍是下一步需要验证的问题。
ENTRY 005/015
[ CODING AGENT · CONTEXT ENGINEERING · PROGRAM ANALYSIS · AGENT HARNESS ]
Harness Handbook 为 coding agent 建立行为索引
(The Harness Handbook)
SOURCE · arXiv · Hugging Face Papers · GitHub
Harness Handbook 从 agent harness 代码中自动提取行为、触发条件和实现位置,生成面向行为的结构化手册,并通过 Behavior-Guided Progressive Disclosure 按需提供上下文。实验显示,它能以更少的 planner token 改善行为定位与修改计划,尤其适用于跨模块、分散实现的功能。
传统仓库地图按目录和 symbol 组织,但 agent 真正要修改的是“重试如何触发”“工具权限在哪里收敛”这类跨文件行为。该工作把静态分析得到的代码关系与 LLM 生成的行为描述连接起来,更贴合实际维护任务。
Progressive Disclosure 也比一次性塞入完整文档更符合 context engineering 的成本约束。风险在于自动手册会随代码变更而过期,因此它能否进入 CI 并稳定增量更新,比单次基准提升更决定实际价值。
ENTRY 006/015
[ OCR · DOCUMENT PARSING · DISTILLATION · SMALL MODEL ]
OvisOCR2 用 0.8B 模型端到端解析复杂文档
(OvisOCR2)
SOURCE · arXiv · Hugging Face
OvisOCR2 将文本、公式、表格和视觉元素直接解析为 Markdown。训练流程先在 4B 分支上进行 SFT 与 RL,再通过 on-policy distillation 压缩到 0.8B 并合并参数;论文报告 OmniDocBench v1.6 得分 96.58、PureDocBench Avg3 得分 75.06。
0.8B 规模意味着高质量文档解析不一定需要大型通用 VLM,尤其适合批量 PDF、端侧或私有化场景。真实文档过滤与从同一 HTML 生成合成页面的做法,可以让内容 ground truth 与布局变化同时可控。
需要留意的是,端到端基准分数会掩盖特定语言、扫描噪声和超长表格上的失败模式。模型已开放,后续更值得看真实业务文档上的结构保真率与吞吐,而不只是综合平均分。
ENTRY 007/015
[ GUI AGENT · MEMORY · SKILL LIBRARY · CROSS-PLATFORM ]
GUIClaw 把经验与技能迁移到跨平台 GUI agent
(KnowAct-GUIClaw)
SOURCE · arXiv · Hugging Face Papers · GitHub
KnowAct-GUIClaw 采用 Know–Route–Act–Reflect 流程,把可追溯经验记忆与自演化 skill library 作为可插拔 GUI 子 agent,覆盖 Android、iOS、HarmonyOS 和 Windows。论文报告 Kimi-2.6 在 MobileWorld 上达到 64.1%,迁移记忆与技能后再提升 8.5 个百分点。
跨平台 GUI 自动化的难点不是单步点击,而是把任务知识从一个 app、设备或模型迁移到另一个环境。将经验与 skill 分开保存,使系统能够复用“怎么判断状态”和“怎么执行动作”两类知识,也更容易追溯提升来源。
这项结果依赖具体 benchmark 与基座模型,不能直接代表真实设备的长期稳定性。不过 8.5 个百分点的迁移增益说明,结构化经验可能比继续扩大上下文更有成本效益。
ENTRY 008/015
[ AI SAFETY · POLICY ADAPTATION · MULTIMODAL · BENCHMARK ]
PolicyShiftGuard 评测并适配动态安全边界
(PolicyShiftGuard)
SOURCE · arXiv · Hugging Face Papers
PolicyShiftGuard 提出 PolicyShiftBench,以 265 张图像构造 2,000 个 policy-discriminative 样本,评估多模态模型在政策边界变化后的适应能力。其 RP-SFT 与 BP-Adapt 通过成对边界损失训练 7B 模型,论文报告 AvgF1 76.9、AvgPSS 72.1。
安全政策并非静态标签:同一图像在不同上下文、版本或地区规则下可能需要不同响应。该 benchmark 用同图多 prompt 设计隔离视觉内容与政策边界,有助于判断模型是真的理解新规则,还是只记住旧拒答模式。
这类方法的实际意义在于缩短 policy 更新到模型行为更新之间的延迟。其局限是 265 张图像的视觉覆盖仍有限,而且高 F1 不保证对边界外新分布同样稳健。
ENTRY 009/015
[ ROBOTICS · WORLD MODEL · VISION-LANGUAGE-ACTION · LOW LATENCY ]
GigaWorld-Policy-0.5 用世界模型训练 action-only 策略
(GigaWorld-Policy-0.5)
SOURCE · arXiv · Hugging Face Papers
GigaWorld-Policy-0.5 在训练时联合学习未来视觉动态与动作,在推理时只保留 action 路径;Mixture-of-Transformers 将视觉动态和动作建模分离。作者报告 RTX 4090 上推理延迟约 85ms,并用 agent-based AutoResearch 自动搜索训练配置。
把未来预测作为训练辅助任务、而非部署时必经步骤,是世界模型进入实时控制的一条务实路径。模型从动态监督中学习环境结构,同时避免推理阶段逐帧生成未来画面的成本。
85ms 已接近部分机器人闭环可用范围,但是否足够取决于硬件、控制频率和安全要求。AutoResearch 自动调参是另一个值得关注的信号:agent 正从写代码延伸到实验设计与配置搜索。
ENTRY 010/015
[ BENCHMARK · CAUSAL REASONING · DATA SCIENCE AGENT · TOOL USE ]
CausalDS 测试 data-science agent 的因果推理
(CausalDS)
SOURCE · arXiv · ArXiv TLDR
CausalDS 从采样的 structural causal model 生成观察数据与现实领域故事,任务覆盖 Pearl 因果阶梯的三个层级,并加入不完美观测、工具调用、代码执行和应当拒答的情形。评分同时考察符号因果推理、数据分析、不确定性量化与 abstention。
现有 agent benchmark 往往把数据分析和因果推理分开,导致模型可能会写代码,却不能判断问题是否可识别。CausalDS 用可控 SCM 生成完整 ground truth,减少从公开题库记忆答案的空间。
把“无充分依据时拒答”纳入一等评分尤其重要,因为真实数据科学工作的风险常来自过度结论,而不是算错一个数。后续应关注 benchmark 生成故事与真实业务语义之间是否存在明显分布差距。
ENTRY 011/015
[ AUTORESEARCH · REINFORCEMENT LEARNING · CODEX · NEMO ]
NVIDIA 用 Codex 与 NeMo 自动复现并改进 RL 实验
(AutoResearch with RL Agent Skills and NVIDIA NeMo)
SOURCE · NVIDIA Developer Blog
NVIDIA 展示由 Codex、agent skills、NeMo RL 与 NeMo Gym 组成的 AutoResearch 工作流:agent 维护实验账本、提出假设、修改代码并运行训练。在 Qwen3-VL-2B 视觉计数任务中,准确率从 25.0% 提升到 96.875%,并自动实现 OAPL 论文方法后完成约 10 小时训练。
这不是“让 agent 写一个训练脚本”,而是把 baseline、假设、分支、失败记录和算力会话纳入持续实验循环。session memory 与资源操作 skill 解决了长任务最常见的状态丢失和基础设施误用问题。
单个视觉计数任务的提升不能证明该流程普适,但完整轨迹显示 agent 已能完成 paper-to-code、排错和训练监控。更关键的评估应是跨任务复现成功率、无效 GPU 小时与人工介入次数。
ENTRY 012/015
[ WORLD FOUNDATION MODEL · FINE-TUNING · AGENT SKILLS · NVIDIA TAO ]
NVIDIA 用 agent skills 一天内后训练 Cosmos 3
(Post-train NVIDIA Cosmos 3 in One Day Using Agent Skills)
SOURCE · NVIDIA Developer Blog
NVIDIA 将 Cosmos 3、TAO agent skills、LoRA 和 AutoML 串成自动后训练流程,并通过 NIM 以 OpenAI-compatible API 部署。在 Woven Traffic Safety 数据集上,官方报告首轮准确率 87.14%,自动搜索后由基础模型的 54.41% 提升到 93.35%。
这套流程的主要价值是把数据检查、LoRA 配置、超参搜索与部署接口收敛到同一 agent 工作流,减少世界模型适配中的工具切换。对垂直视觉任务而言,一天内得到可部署 endpoint 比单纯发布 checkpoint 更贴近工程交付。
结果来自厂商案例,数据集规模与搜索预算会显著影响可复现性。使用者还需核算 AutoML 带来的额外算力,避免把“少人工时间”误解为“低总成本”。
ENTRY 013/015
[ ON-DEVICE AGENT · MOBILE · TOOL USE · PRIVACY ]
PalmClaw 将完整 agent loop 放到移动设备端
(PalmClaw)
SOURCE · arXiv · GitHub · Hugging Face Papers
PalmClaw 是原生设备端移动 agent runtime,统一管理 session、memory、skills、tools 与执行循环,并把设备能力暴露为带结构化返回值和执行边界的 typed tools。论文报告相对最强基线任务成功率提升 11.5%,完成时间减少 94.9%。
设备端 agent 的优势不仅是隐私,也包括更低的 UI 状态传输延迟和更稳定的系统能力访问。typed tools 与显式执行边界能降低纯视觉点击带来的歧义,并为权限审计提供结构化记录。
移动操作系统对后台执行、无障碍权限和厂商 API 的限制差异很大,因此开源 runtime 能否在真实机型长期运行仍需验证。不过 GitHub 的快速关注表明,local-first agent 正从桌面扩展到手机。
ENTRY 014/015
[ AGENT EVALUATION · BENCHMARK INFRASTRUCTURE · TRAJECTORY ANALYSIS · OPEN SOURCE ]
AgentCompass 解耦 benchmark、harness 与 environment
(AgentCompass)
SOURCE · arXiv · GitHub · Hugging Face Papers
AgentCompass 是轻量开放的 agent 评测基础设施,将 Benchmark、Harness 与 Environment 分离,提供容错异步 runtime 和轨迹分析,覆盖五类能力、20 多个 benchmark。轨迹检查还用于识别只提高 reward、却未真正完成任务的 reward hacking。
Agent 评测长期受环境安装、harness 差异和并发失败影响,同一个模型分数往往难以复现。三层解耦使 benchmark 逻辑可以复用到不同 agent,同时把环境故障与模型失败分开记录。
轨迹级分析比只看终局 reward 更适合长任务,因为 agent 可能利用 checker 漏洞或偶然状态得到高分。项目的真正考验将是版本固定、环境镜像与跨机构复现实验是否同样稳定。
ENTRY 015/015
[ JAVA · LOCAL AI · LLAMA.CPP · ZERO-COPY ]
libargus.cc 为 Java 提供零分配本地 AI runtime
(libargus.cc)
SOURCE · GitHub · Hacker News
libargus.cc 基于 Java 22+ Project Panama FFM 封装 llama.cpp、whisper.cpp 与 ggml,以 MemorySegment 避免在热点路径创建 JVM heap array,并共享底层 backend。它支持模型权重与 context 分离、libmtmd 多模态、原始视频、KV Q8/Q4 和 speculative decoding。
Java 本地推理常被 JNI 复制、对象分配与 GC 抖动拖累,FFM + zero-copy 能把 JVM 与 native tensor 的边界变得更薄。权重和 context 分离也便于多个会话共享模型,符合服务端 Java 应用的生命周期。
项目目前仍早期,GitHub 规模和独立 benchmark 都不足,Show HN 的讨论热度只能证明需求存在。它值得关注的原因是实现路径清晰,而不是已经达到成熟生产 runtime 的可靠性。
其他值得关注
- Nous Research 据报正以 15 亿美元估值完成至少 7,500 万美元融资;其 Hermes agent 强调内置 skills 与从使用中生成新技能,但本轮消息以融资为主,未披露新的模型或训练机制。TechCrunch — TechCrunch
- NVIDIA 发布 DeepStream 9.1 多摄像头 3D tracking 的 skill 化实现指南,适合关注视觉 agent 与视频分析部署的团队进一步检查。NVIDIA — NVIDIA
- Product Hunt 的近期 AI agent 发布包括 Agently、Osaurus、AgentKey 与 ClawTeams,但公开页面缺少可核验的模型、评测或系统机制,因此未进入主列表。Product Hunt — Product Hunt
- Reddit 上关于 ICML prompt-engineering 论文的高热讨论反映了社区对研究门槛和评审标准的分歧;讨论热度高,但不应替代论文与正式评测证据。Reddit — Reddit