aiself AI 情报站
← 返回首页

AI 情报日报 — 2026-06-06

🎯 命中战况(与我们正在做的事直接相关)

Microsoft Scout:大厂正式下场"always-on 个人 agent"

  • 发生了什么:微软发布 Microsoft Scout,定位为 always-on personal agent,构建在 Microsoft 365 之上,底层用的是 OpenClaw(开源)。和 Google 在 Gemini Spark 上的路线明显不同。
  • 为什么重要:战况简报里 aiself 的核心差异化定位之一就是"避开大厂'帮你做事'赛道"。Microsoft Scout 是大厂在"陪伴式个人 agent"赛道上最完整的一次表态——绑定在生产力工具栈里、帮你处理日程/邮件/文档。和 Google Gemini Spark 一起构成了"大厂个人 agent"的标准形态。
  • 对我们意味着什么:进一步验证 aiself 不能跟大厂在"帮人做事"上拼——他们有 OS 级数据接入和分发渠道。aiself 的护城河仍然必须落在"帮人认识自己"——me/ 作为用户资产、PR 模式的写入控制、数据主权这些是大厂不会做的。读者关注的不是"Scout 强不强",而是"它强了反而把我们的差异化逼得更清晰了"。
  • 想深入Microsoft 官方介绍(重点看它如何定义 always-on 的边界——是否触碰用户"自我认知",还是只停留在生产力执行层)

Harvey 用 Kimi 2.6 微调击败 Opus 4.7,成本只有 1/11

  • 发生了什么:法律 AI 公司 Harvey 在自家法律 benchmark 上,让微调的 Kimi 2.6 agent 跑赢了 Opus 4.7,且推理成本约为后者的 1/11。
  • 为什么重要:直接命中战况第 2 条——"Harvey Kimi 2.6 这条路径长期值得跟踪"。这是迄今最清晰的一次小公司证明"垂直领域微调开源模型 = 击败 frontier + 大幅降本",而不是又一次纸面 benchmark 嗨。
  • 对我们意味着什么:aiself 的 aha 报告 pipeline 当前用 DeepSeek 主力,未试微调。Harvey 这个案例把"微调开源大模型做窄领域"的可行性又往前推了一步。对我们而言,"叙事画像生成"是一个有清晰输入输出格式 + 重复结构的任务,理论上是适合微调的形态。但要看到 Harvey 是有真实法律数据+客户的——我们现在连真实用户跑通都没做完,微调还不是这一周的事,是 onboarding pipeline 稳定后的下一站。
  • 想深入Harvey 推文(重点看他们怎么定义"击败"——是端到端 agent 任务还是单次推理)

Microsoft 发布 SkillOpt 论文:让 agent 自己写 skill 文件

  • 发生了什么:微软研究院发表 SkillOpt 论文,把 agent 的明文 skill 文件当作"权重"来训练,模型本身冻结。结果:GPT-5.5 在 direct chat 上 no-skill accuracy 提升 23.5 分,Codex agentic loop 提升 24.8 分,Claude Code 内提升 19.1 分。
  • 为什么重要:战况简报里明确说"Microsoft SkillOpt(me/ 自动重写算法骨架)"是对标体系之一。这次是完整论文落地,把"如何用算法迭代一份明文文件让它越来越好"的范式做实了——这恰好是 aiself "me/ 是用户的、但 agent 能在 PR 模式下持续改进它"的算法基础。
  • 对我们意味着什么:me/ 内容的 "agent 自我优化"不再是空想。SkillOpt 的优化目标是任务 accuracy,aiself 的优化目标会是"对用户的画像准确度"——评估信号不一样,但把文本文件当可训练对象的范式可以直接迁移到 me/ 上。这给"WriteProposal → 用户确认 → 原子写入"加了一个"为什么 PR 写法值得做"的根本答案:因为 me/ 是要持续被算法迭代的,而不是一次性写成。
  • 想深入SkillOpt PDF(重点看 §3 优化目标定义和 §5 在 Claude Code 上的实验——这两节决定能不能直接搬到 me/)

高度相关

  • Television:personal agent 的视觉工作空间,Notion-like kanban,每块 tile 接一个 agent — 与 aiself "AI 个人 Wiki" 在交互形态上有交集,可看作另一种产品答案。X 推文
  • Ollie:给父母用的 AI 助手,管理琐事释放家庭时间 — 个人助手垂直化的又一例子,定位窄+具体场景。X 推文
  • Gemma 4 QAT 发布:E2B 模型可在 ~1GB 内存下运行 — 端侧/低成本部署进一步成熟,对成本敏感的 aiself onboarding 分析阶段有意义。Google 公告
  • Sakana AI 在东京成立 RSI Lab(递归自我改进) — 把 AI Scientist / Darwin Gödel Machine / ShinkaEvolve 统一成"在算力约束下做自我改进"的研究线。X 推文
  • Anthropic 疑似跨租户输出泄露事件被讨论 — 多租户隔离失败是 aiself 架构原则"不接受为 demo 绕过 user_id 隔离的代码进入主干"的现实依据。X 推文

中度相关

动态相关性来源
Cloudflare AI Gateway 支持按模型/用户设支出上限 + fallback 到便宜模型单一 LLM Gateway 出口 + 成本记账的同类思路CF 更新日志
Princeton 《Towards a Science of AI Agent Reliability》ICML 2026 加入 GPT 5.5 / Gemini 3.1 / Opus 4.7,结论:可靠性没显著提升给"前沿模型不靠谱"提供学术弹药X 推文
HuggingFace CLI vs 手写 API:手写多消耗 6x token、成功率更低"good tools are cached intelligence for agents" — aiself 7 个核心工具的设计原则印证X 推文
Factory Router:自动路由模型,benchmark 上降本 20-25%LLM Gateway 路由策略思路Factory
Agents' Last Exam (ALE):1000+ 经济价值任务,最难层全通过率仅 2.6%benchmark 转向"真实经济价值",aha 报告也应有类似评估X 推文
Anthropic Claude Cowork 用量翻倍一个月,支持更大委托任务印证 agent 长时作业是大方向X 推文
ChatGPT Lockdown Mode 全量推送,限制出站网络以防 prompt injection 数据外泄aiself me/ 数据安全可参考——本地 agent 也应有类似的"出站限制"思路X 推文

背景信息

  • 腾讯研究院本周关键词:Opus 4.8、Gemma 4 12B、Kimi Work、扣子 3.0、Hermes Agent、MiMo-V2.5 降价、MiniMax A 股上市、Anthropic 启动 IPO、OpenAI 物理学家尹希加盟。
  • Packy McCormick 长文《Riding the Leopard》在 AI 时代寻找意义,把"差异化"提升为道德义务——和 aiself "帮人成为最不可替代的自己"叙事可呼应但不必硬挂。
  • 教皇利奥十四世首份通谕谈 AI:"技术从不中立",立场鲜明。
  • Sam Kriss 文章《如果你用 AI 写作我就杀到你家》——反 AI 写作的代表性愤怒。
  • Replit ViBench 评测:Opus 4.8 在 vibe coding 性价比上击败 GPT-5.5。

Action Items

  1. SkillOpt 论文纳入 KB 加固/me 自动改写的方法论参考清单,重点判断它的 reward signal 设计能否迁移到 aiself 画像准确度评估上。
  2. Microsoft Scout 写进 aiself 的竞品定位文档——作为"大厂 always-on 个人 agent"形态的代表,对照阐明我方差异化叙事。
  3. 关注 Harvey/Kimi 2.6 微调路径,但不立项:aha 报告 pipeline 先在 DeepSeek 上跑稳真实用户,微调放到稳定之后再评估。