Glean 拾遗
日刊 · 时间线

每天拾几条。

2026-08-15 · 周六 2 条
← 08-14
日历 ▾
2026 · 08
MoTuWeThFrSaSu ·····12345678910111213141516171819202122232425262728293031
有日刊 今天
06:00

DeepSeek Harness 速通:一切皆插件,Agent 在运行中插拔自己

DeepSeek Harness: Everything Is a Plugin on the Cordis Kernel

DeepSeek 在 V4 Pro 发布后正式推出自己的 Agent 产品 DeepSeek Harness,核心口号是一切皆插件。它的内核名为 Cordis,只负责插件的加载、卸载与依赖管理,支持在 Agent 运行中热插拔,并用 88 页论文定义了时间/空间可组合性。UI、工具、Skills、存储、Agent 循环全部以插件形式暴露,官方预设 100 多个一方插件,也开放社区插件入口。安装只需一条 `npx @deepseek-ai/dsh web`,且未锁死在自家模型上,可以接入其他厂商的 Base URL 和协议。文章拆解了标准、PTC、极简、创造四种模式,其中创造模式允许 Agent 检查自身运行环境、现场创建并挂载新插件;会话被设计成只追加事件日志,失败后可按来源查看轨迹,便于审计和复现。作者也指出 V4 Pro 涨价明显,缓存命中价涨了 12 倍、高峰输出 27 元,且 Harness 对普通用户门槛高、UX 粗糙,更适合关注 Agent 可组合性与基础设施设计的工程师。

06:00

GLM-5.3:只靠后训练扩展,代码与网络攻防能力同步提升

GLM-5.3: Post-Training Scaling Boosts Coding and Cyber

Z.ai 发布 GLM-5.3,强调与 GLM-5.2 共用同一个 base model,所有提升都来自 post-training 扩展:持续扩大长程任务环境,并用流水线合成可执行、可验证的环境与 reward,训练栈沿用 IndexShare、SAO 和 slime。代码与 agent 能力在公开榜单上普遍上升,例如 Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 升到 66.9。文章最值得注意的是“涌现式网络攻防能力”:ExploitBench 从 24.4 翻倍到 54.4;真实代码库评估中,在 269 个项目里发现 2436 个漏洞,最老的可追溯到 1981 年,Z.ai 为此建立了公开披露台账。工程侧,slime 通过本地缓存、训练-rollout logprob 对齐(1e-7)和负载感知调度,把长程 coding RL 的端到端吞吐提升 2.3×。API 上 thinking 不能再关闭,迁移需改用 reasoning_effort;权重将在安全加固完成两周后开源。适合关注 RL 后训练、agent 评测和 AI 安全披露的工程师阅读,注意所有跑分均为厂商自报。