aiself AI 情报站
← 返回首页
2026-05-12·腾讯研究院AI速递·AI

AI 速递 2026-05-12 — aiself 团队关注点

来源:腾讯研究院AI速递 20260512

高度相关

Claude Mythos 突破 METR 评测上限,16 小时长任务 50% 成功率

  • 来源METR 官方评测报告(Anthropic Red Team 转载)The Decoder 报道36kr 英文版 via 腾讯研究院
  • 关键信息:METR 评测显示 Claude Mythos Preview 在人类需 16 小时完成的长线任务上达到 50% 成功率(95% 置信区间 8.5–55 小时),"已撑爆评测框架上限"——METR 测试集 228 道题里只有 5 道是 16h+ 量级。doubling time 缩短至 105 天,超过 GPT-5.2、o3、Opus 4.6。Palo Alto Networks 同步发布安全报告,Mythos 辅助渗透 3 周完成顶级团队 1 年工作量,攻击链压缩到 25 分钟。Mythos 尚未公开发布,目前走 Project Glasswing 限定开放(安全 + 企业合作方)。
  • 对 aiself 的含义:直接竞品的"agent 自主执行"能力出现质变。aiself 的核心差异化(长期记忆 + 主动行为 + 个人助理)面临一个新前提——后端模型本身已经能跑 16 小时任务。这意味着 (1) aiself 不需要自己造 agent 推理能力,只需做好 orchestration + 上下文供给即可借势;(2) 如果第三方 API 接入 Mythos 级别模型,aiself 单条 task 的"模型能干多远"被极大释放;(3) 安全攻防的 AI 化逼近,意味着 aiself 涉及用户数据、桌面控制时的安全合规门槛会被监管和媒体更早盯上。
  • 深度调研已生成调研报告

OpenClaw 接入 Peekaboo v3,桌面 Computer Use 能力补齐

  • 来源GitHub openclaw/Peekaboo v3.0.0 ReleaseOpenClaw 官方文档peekaboo.sh 官网36kr 英文版报道 via 腾讯研究院
  • 关键信息:停更数月的 Peekaboo v3.0 一日三更(v3.1.0→v3.1.2),定位为 OpenClaw 生态的 Computer Use 工具。能力栈:截屏(see)、点击、输入、滚动、热键、菜单、窗口、App、Dock、Space 一系列原生 macOS 自动化原子操作,由 natural-language agent 链式调用。默认模型 gpt-5.1,兼容 Claude 4.x / Grok 4-fast / Gemini 2.5 / 本地 Ollama。同时是 MCP server + client,默认内置 Chrome DevTools MCP,可串联 GitHub、文件系统等远端工具。OpenClaw 由此从"会聊天"补齐为"会干活",向"AI 操作个人电脑的本地控制层"演进。
  • 对 aiself 的含义:这是 aiself 直接对标的产品形态——开源、本地、跨模型的个人 AI 助手桌面层。这是好消息也是坏消息:好消息是 (1) Peekaboo 是 MIT/Apache 协议下的 CLI + MCP,aiself 可以直接复用作为"手"(执行层),不必自己造 GUI 自动化;(2) OpenClaw 没有解决记忆、长期目标管理、跨应用上下文沉淀,这些仍是 aiself 的空间。坏消息是 (1) OpenClaw 已经在抢占"AI 操作个人电脑"的心智位置,并且是开源 + 多模型,aiself 必须想清楚相对它的差异化叙事;(2) Peter(OpenClaw 作者)一日三更的执行节奏暗示这个赛道的工程密度极高。
  • 深度调研已生成调研报告

硅谷 AI 护城河新论:组织形态才是抄不走的壁垒

  • 来源Foundation Capital — When model providers eat everything: A survival guide for Service-as-Software startupsFoundation Capital — A System of Agents via 腾讯研究院
  • 关键信息:Foundation Capital 合伙人 Jaya Gupta 在 X 发文(320 万阅读)提出:AI 时代产品、技术、赛道都在快速收敛,真正抄不走的是组织形态。核心命题——"伟大的公司本质是组织发明,竞争的不只是市场或薪酬而是身份认同。最强的使命必然会让一部分人不想加入,才能让对的人极度渴望加入。每一个情绪承诺背后必须有结构承诺(职权、薪酬、决策权)支撑"。Gupta 长期论点:startup 的护城河存在于 model provider 不愿/不能拥有的那部分技术栈——越冷僻、越痛苦、越行业专属,越能成为护城河。
  • 对 aiself 的含义:直接给两人小团队提供了一个反通用产品的战略基础。aiself 不需要在"通用 AI 助手"维度跟 Anthropic/OpenAI 比综合能力,而是要在"组织形态 + 价值观差异"上建立结构性优势。具体含义:(1) 产品定位应该让一类用户"特别渴望"(如对 AI 长期记忆、个人主权、不被云端拴住有强信念的人),同时让另一类用户主动 opt-out;(2) Rik × Suke 两人的协作节奏本身就是一种护城河,不应该试图"扩张到 20 人团队"复制大厂打法;(3) 在团队公约里固化结构承诺(决策权、收益分配),把"小而对"的组织形态做实。

中度相关

动态来源与 aiself 的关系
QClaw 上线"文件空间",打通腾讯文档 + ima 知识库 + 本地文件腾讯研究院大厂 AI 助手向"个人知识闭环"集成,验证了"知识库 + AI 输出双向沉淀"是关键产品形态,aiself 的记忆系统应参考这种打法
千问 App 与淘宝完成全面打通,AI 购物全场景上线(40 亿商品库 + 20 年数据)腾讯研究院大厂 AI 助手向消费场景深度绑定的范例。aiself 如果不入电商场景,意味着早期要主动让出这块,专注非交易型助理价值(学习、决策、生活管理)
微信 4 月推九大功能,微信支付发布 AI Skill 技能包/AI 友好 API腾讯研究院微信生态在为外部 AI agent 提供"调用入口"——aiself 未来若需接入微信支付/小程序,可基于这套 Skill 体系,不必自己适配复杂协议

背景信息

动态来源类别
黄仁勋 CMU 毕业演讲:"AI 不会取代人,但会用 AI 的人会取代不会用的人"腾讯研究院观点/演讲

Action Items

  1. 【高优 · 本周】研读 Mythos 调研报告并讨论 aiself 后端策略:Mythos 走 Project Glasswing 限定开放,公开 API 可能 6–9 月开放。Rik 与 Suke 同步:aiself v0.1 是否需要"模型可换"作为核心架构假设,避免被单一模型锁定。参见 深度调研
  2. 【高优 · 本周】评估直接使用 Peekaboo 作为 aiself 执行层:跑通 Peekaboo CLI + MCP,验证 (a) 能不能让 aiself 通过 MCP 调用本地 macOS 操作;(b) 性能/稳定性是否足以作为生产依赖;(c) 是 fork 自研还是直接复用。参见 深度调研
  3. 【中优 · 本月】定义 aiself 的"组织形态护城河":在 align/ 下开一份团队公约草案,固化 Rik × Suke 的角色、决策机制、收益分配、不做什么——把 Jaya Gupta 的"结构承诺支撑情绪承诺"落到团队协议层。
  4. 【低优 · 持续】跟踪 OpenClaw 生态产品迭代:把 OpenClaw GitHub org 和 Peter 的更新频道加入信息源,每周扫一次。这是当前与 aiself 最像的开源对手。