aiself AI 情报站
← 返回首页

AI 情报日报 — 2026-06-10

🎯 命中战况(与我们正在做的事直接相关)

ChatGPT 推出 Dreaming v3 记忆系统:可编辑、自我修正、长期偏好跟踪

  • 发生了什么:OpenAI 上线 ChatGPT 记忆系统新版本 Dreaming v3,后台进程主动保存记忆,用户可见可编辑,召回率更高,跟踪用户长期偏好,并能随时间推移自我修正。命名直接对标 Anthropic 此前发布的 "Dreams"(我们方法论的参照系之一)。
  • 为什么重要:这是 ChatGPT 第一次把"记忆"从黑盒系统升级为用户可见可编辑的资产——和我们 me/ 文件夹的核心定位几乎重叠。"长期偏好 + 自我修正"正是我们 Wiki + KB Health Check 的卖点。
  • 对我们意味着什么:① 验证了"个人 AI 记忆是值得用户花时间管理的资产"这个最底层假设——OpenAI 不会在没把握的方向上发布顶层产品。② 同时也压缩了我们"在 ChatGPT 里复用 me/"(Context Out)这条出口的窗口期——ChatGPT 已经有自己的记忆,用户没动力再粘贴我们的画像。③ 我们必须把差异化讲得更尖锐:ChatGPT Memory = 行为偏好("用户喜欢简短回答"),aiself me/ = 叙事身份("用户是谁、心理模式、人生主线")。后者是 ChatGPT 在聊天交互里观察不到的。Layer 1/2/3 的叙事画像方法论必须线上跑通验证,否则差异化讲不出。
  • 想深入OpenAI Memory Dreaming v3(重点看"用户可编辑"和"自我修正"的实现机制——和我们的 Proposal/Apply 模式怎么对比)

Claude Fable 5 发布:$10/$50 顶级定价 + RSI 限制 + 1M 上下文

  • 发生了什么:Anthropic 发布 Mythos 级模型 Fable 5(Mythos 5 的安全版),SWE-Bench Pro 80.3%(GPT-5.5 是 58.6%),FrontierCode Diamond 30.9% 比第二名 13.4% 翻倍。定价 $10/M 输入 / $50/M 输出(约 Opus 4.8 的 2 倍)。Stripe 用它一天完成了一个团队两个月才能做完的 5000 万行 Ruby 迁移。同时引入 30 天数据保留(取消 ZDR)和递归自我改进抑制。
  • 为什么重要:顶级模型价格继续往上走,和我们的成本敏感场景方向相反。Stripe 的案例说明 Fable 5 强在长任务、复杂工程,不是 onboarding 这种短窗口分析。
  • 对我们意味着什么:① 强化了挑战 #5 的紧迫性——aha 报告中期向开源微调路径走,不能等。Harvey 用 Kimi 2.6 微调以 1/11 成本击败 Opus 4.7 的对标更加成立。② 我们当前 DeepSeek 全链路的成本结构是对的,不要被 Fable 5 的 benchmark 牵着走切回 Anthropic。③ 极少数高复杂度场景(比如 KB 矛盾检测的 LLM 层、Layer 1/2/3 叙事画像的关键合成步骤)可以预留一个 Fable 5 / Opus 4.8 的"高级模式"路径,但默认必须是便宜模型。
  • 想深入Latent Space 拆解(重点看 Artificial Analysis 的 5% fallback 数据和 Stripe 案例的任务长度描述)

Anthropic 生物 Agent 文章:瓶颈不是模型,是数据基础设施

  • 发生了什么:Anthropic 发文《为生物学智能体铺平道路》,指出生物 Agent 的瓶颈不在大模型推理,而在数据基础设施太烂。同一查询 Sonnet 4 三次返回 106、15、5 条不同序列。和 NCBI 合作开发了确定性工具 gget virus——多 API 协调 + 标准化可审计输出——所有 Agent 准确率从 16.9%-91.3% 不稳定区间统一拉到 90%+,GPT-5.5 达 99.7%。
  • 为什么重要:这是 Anthropic 自己背书"无聊但可靠的底座 > 更强的模型"这个判断。和我们 KB Manager 作为 me/ 唯一入口(原子写、内容 hash、路径防穿越、PR/Apply 模式)的设计哲学完全一致。
  • 对我们意味着什么:① 我们正确——save-to-wiki 400 这种"看似无聊的路径匹配 bug"恰恰是核心壁垒所在,不是工程债。② 给 KB Health Check 的矛盾检测(挑战 #6)一个明确范式:不是让 LLM 自由判断矛盾,而是先把"什么是矛盾"用确定性结构定义清楚,LLM 只做最后那步。否则会重蹈一次返回 106 一次返回 5 的覆辙。③ 在对外讲产品时可以用这个对标——"我们做的不是更聪明的 AI,是让 AI 真正能用的可靠底座"。
  • 想深入腾讯研究院摘要(重点看 VirBench 的不稳定数据和 gget virus 的工具封装思路)

高度相关

  • Apple 发布 Siri AI(基于 Gemini) — 大厂"个人助手"主战场正式合流:Apple 个人上下文 + Google 模型 + 系统级 App 集成。验证了我们"不和大厂在外在行为数据上竞争"的避战判断,但也说明这条线投入资源越来越大。腾讯研究院
  • OpenAI 提交 S-1 并发布《Built to benefit everyone》 — 三大目标里第一条就是"为地球上每个人提供个人 AGI"。和我们的产品定位有概念层面的撞车,但他们的"个人 AGI"路径是大模型+行为数据,不是结构化自我认知 Wiki。腾讯研究院
  • NotebookLM 升级 Antigravity harness + 云端 compute — 每个 notebook 独立运行环境,用 Gemini 3.5 跑代码分析上传文件。和我们"用 agent 维护 me/"的思路同构,可以拆解他们的 tool 设计和触发逻辑。Ben's Bites
  • Loop Engineering 成为本周技术热点 — Peter Steipete、Addy Osmani、Matt Van Horn 集体讨论"如何设计 agent 的更大循环"(plan.md → 拆任务 → 验证 → 回到 plan)。和我们 agent 自研最小平台(7 tool + 上下文装配 + 10 步 loop)方向一致,可以参考他们的"plan 文件 + 验证 skill"模式。Ben's Bites 总结
  • Workera Ambient 进入"自动职业能力追踪"赛道 — 总是在听,从日常工作中捕获能力。是"外在行为数据派"的最新入场者,但聚焦职业能力——和我们的"内在叙事身份"差异化更清晰。Workera CEO 文章

中度相关

动态相关性来源
Kimi Work 桌面版上 PH(月之暗面"知识工作 AI 桌面")知识管理赛道竞品,对标我们 Context Out 路径Product Hunt
Anthropic 谈递归自我改进,开发者代码产出量是 2025 年 8 倍印证 AI Agent 取代部分编程工作,影响我们工程节奏判断Anthropic Institute
小米 MiMo V2.5 万亿参数模型突破 1000 tokens/秒,免费 API 限时申请国产 LLM 速度+成本继续打 DeepSeek,可观察是否值得纳入 LLM Gateway 备选腾讯研究院
Cognition 发布 FrontierCode 评测,强调"代码可维护性"而非"通过测试"KB Health Check LLM 层(挑战 #6)的方法论参考Cognition blog
美团 Tabbit AI 浏览器正式上线,妙招广场 300+ skill"AI + skill 调度"产品形态参考腾讯研究院
HuggingFace LatentSkill 论文:把 in-context 文本 skill 转成 LoRA 存权重长期可参考的 me/ 自动重写路径(SkillOpt 思路的实现方式)Paper

背景信息

  • Anthropic 一周前也递交 S-1,估值 9650 亿美元,反超 OpenAI 8520 亿
  • Tony Fadell(iPhone 缔造者):AI 让做出来变容易后,判断力、系统架构、品味、叙事成稀缺资源;投资人现在只投有 atoms 的公司
  • HuggingFace 本周热门:Agents' Last Exam(13 行业 1K+ 任务的 Agent 实用性基准)、SWE-Explore(代码仓库探索能力基准)
  • Conan O'Brien 哈佛毕业演讲:"我所有的成就都不是一个人完成的"——Wisereads 本周最高亮文

Action Items

  1. 本周内完成 ChatGPT Dreaming v3 对标分析:开通账号实际试用 1-2 小时,对照我们 me/ 写一份差异化清单(行为偏好 vs 叙事身份、被动观察 vs 主动构建、聊天上下文 vs 永久 Wiki)。这份清单同时也是 V2 落地页文案的弹药。
  2. 明确"高级模式"的预留位置:在 LLM Gateway 设计里给 KB 矛盾检测、Layer 1/2/3 叙事画像合成预留一个可切换的"高级模型"配置项(默认 DeepSeek,可切 Fable 5/Opus 4.8)。不立即接入,只把开关位置留好。
  3. KB Health Check 的矛盾检测设计参考 gget virus 范式:先用确定性结构定义"什么是矛盾"(同一字段不同值、时间冲突、身份冲突),LLM 只做最后语义判断。把这条作为挑战 #6 落地的设计前提写进 architecture-overview.md。