← 返回首页
AI 情报日报 — 2026-06-13
高度相关
- HuggingFace 周榜第一:EvoArena + EvoMem(104 票) — EvoArena 是动态环境下的 LLM agent benchmark,EvoMem 是配套的"记忆演化范式",建模渐进式更新与结构化记忆变迁,在变化任务上跑出明显增益。和我们 KB 健康检查(矛盾/重复检测)、me/ 无版本历史是同一类问题。论文
- Weaviate 发布 Engram:长期记忆维护用 extract → transform → commit 替代 chat-log 追加 — 把"记忆维护"做成独立的三阶段流水线,对应了我们 me/*.md 写入 + _总览.md 重生成 + WriteProposal PR 模式正在解决的问题。来源
- AllenAI 发布 ModSleuth:追溯 LLM 依赖图,Olmo 3 = 89 模型 + 183 数据集,Nemotron 3 = 273 模型 + 560 数据集 — 现代模型已是高度组合 + 合成的栈,单"模型供应商"心智模型过时。我们 DeepSeek + GLM 双线管线属同类暴露面。来源
- Fable 5 静默降级反转之后续讨论 — Ryan Greenblatt 主张走 KYC + 监控的 access program 而非阻断;Gergely Orosz 推动"provider-agnostic 模型路由 harness"以便厂商行为变化时切换。对应我们对 DeepSeek/GLM 的单点依赖讨论。Greenblatt / Orosz
- Cursor 把 auto-review 设为新用户默认 — classifier subagent 在 agent 写动作前做 gating,自报准确率 97%。与已报的 Hermes Write Gate 同方向,现在多了"非高风险时静默放行"的产品形态。来源
- HuggingFace WeaveBench(55 票) — 计算机使用 agent 跨多界面的长时序任务 benchmark,揭示传统"按步骤"性能评估失效,要看任务编排能力。可作为三步导入流程长时序质量的对标基线。论文
中度相关
| 动态 | 相关性 | 来源 |
|---|---|---|
| Macrodata Labs 发布 Refiner,开源机器人多模态数据流水线(分片、检查点、可观测性、血缘) | 多模态数据治理与我们 me/ 文件治理同类 | 推文 |
Cognition + Cursor 开源 /handoff,本地编码 agent 把任务移交云端 Devin | 同会话本地/云协作的工程范式 | 推文 |
| Perplexity 把 Deep Research 做成 Computer 的原生 skill | 长查询作为 skill 的工程化形态 | 推文 |
| LangSmith 推出 LLM Gateway:spend limit + PII/secrets 检测 + trace 续接 + 审计日志 | 我们成本敏感 + per-user 隔离的运行参考 | 推文 |
| Goodfire 提"预测性数据调试":DPO 数据集训练前查破坏 guardrail/幻觉信号 | aha 报告数据精炼可借鉴 | 推文 |
| FORT-Searcher:合成"抗捷径"训练数据,识别深度搜索 agent 训练中 4 类捷径风险 | 三步导入"复述多于洞察"问题的相邻研究 | 论文 |
| Claude Managed Agents 加 scheduled deployments + 环境变量(凭据在网络边界注入而非暴露给模型) | 凭据隔离设计参考 | 推文 |
背景信息
- Recursive SI 与 Microsoft Arbor 同日发布"自主 AI 研究 agent":前者偏快速系统优化(NanoChat 损失 1.3× 速度),后者用持久 hypothesis tree(MLE-Bench Lite 86% Any-Medal)Latent Space
- Agents' Last Exam(ALE)公布:1500 任务覆盖 55 个职业,最难梯度全模型 0% 推文
- PostTrainBench:用 AI 训练弱模型的递归自改进 eval 推文
- 本地推理速度连发:Unsloth Gemma 4 MTP GGUFs 1.4-2.2× / 12B 162 tok/s;Inception Mercury 2 上 Baseten 1000+ tok/s Unsloth / Baseten
- MiniMax 开源 MSA kernel 库;Together 披露 M3 serving 工程(KV-block-major sparse attention + Rust 多模态 gateway)推文
- 订阅经济学被广泛传播:Claude Max 20x ≈ $8k 等值用量,ChatGPT Pro 20x ≈ $14k;OpenAI 据传考虑 token 降价 推文
- Microsoft 推出 MAI-Code-1-Flash 跨 Copilot 各档铺开,强调模型/harness 双选 推文
- 腾讯研究院本周关键词收录:阶跃星辰 Step 3.7 Flash、阿里 Qwen3.7-Plus、字节扣子 3.0、月之暗面 Kimi Work、Anthropic IPO、奥特曼"收回就业末日论"、Sutton"生成认知"等 腾讯研究院
- LabVLA:实验室自动化 VLA 模型,两阶段训练(action token 预训练 + flow matching)论文
- N-GRPO:embedding 层邻居混合做策略优化,提升数学推理多样性而保持语义一致 论文
- EurekAgent:把"环境工程"作为科研 agent 核心,结构化设计 agent 环境而非堆 agent 数量 论文
PH & GitHub Trending 深研
LMCache(GitHub 8.6k stars)
- 一句话:vLLM 的高性能 KV cache 层,定位"最快的 KV cache 层"
- 链接:GitHub
- 核心机制:把 KV cache 从单 GPU 内存外溢到 CPU / 共享内存 / 持久化层;最近一周的 PR 包括 DAX 热插拔(#3264)、CPU e2e 测试(#3590)、Blend v3 上线;vLLM 主线 + plug-in 两套接口并行演进。
- 值得注意的做法:把"cache"做成可插拔层而非耦合到推理服务;用 v2 → v3 灰度演进同时保留 legacy 路径;CI 端到端验证(vLLM + bench server);以
.claude/skills+ Codex/Gemini agent 提示词作为代码审查辅助。
pm-skills(GitHub 17k stars)
- 一句话:68 个 PM 技能 + 42 个工作流命令、分 9 个 plugin,通过 Claude Plugin marketplace 一键安装
- 链接:GitHub
- 核心机制:每个 skill 是一份"PM 框架的步骤化指南"(Teresa Torres / Marty Cagan / Alberto Savoia);commands 串联多个 skill(例如
/discover链 brainstorm → identify-assumptions → prioritize-assumptions → brainstorm-experiments);明确区分"skills 是 LLM 域知识,commands 是用户触发的工作流"。 - 值得注意的做法:把"框架"作为可分发资产;marketplace 安装路径明确(Cowork 桌面端 4 步装好);跨工具兼容(Codex / Gemini / Cursor / Kiro 都能复用 skills 目录);commands 完成后自动推荐下一条 command,把"工作流"显性化。
agency-agents(GitHub 112k stars)
- 一句话:一个完整 AI agency 的 agent 集合,231 个 agent 分布在 16 个 division,每个 agent 自带 persona、流程、产物模板
- 链接:GitHub
- 核心机制:每个 agent 文件包含 frontmatter(emoji / vibe / services)+ identity / mission / rules / process;用 lint + convert 脚本统一格式与目录注册;近期把 OpenClaw 集成成"按
##标题自动拆分为 SOUL.md / AGENTS.md / IDENTITY.md"。 - 值得注意的做法:把"性格 + 流程 + 产物"绑定到单个 markdown 文件、可被多种 agent runner 加载;新增 division 需同时注册在 convert / install / lint / CI 四处保证一致性;社区贡献跨语种 PR 持续扩库。
Action Items
- 抽时间读 EvoMem 论文与 Weaviate Engram 实现细节,与我们 KB 健康检查、_总览.md 更新机制做实现对照。
- 试着对当前 DeepSeek + GLM 管线做一次 ModSleuth 式的"上游依赖盘点",看是否能识别隐性单点。