Claude Mythos 突破 METR 评测上限——对 aiself 的含义
一、Mythos 是什么
Claude Mythos 是 Anthropic 尚未公开发布的下一代旗舰模型,目前以 Preview 形态走 Project Glasswing 限定开放——只对一组受邀的安全研究和企业合作方开放。截至 2026-05-12,未公开 API 定价或上下文窗口规格,但已在 LLM-Stats 等聚合站建档(pricing/context window 仍标为 TBD)。
Anthropic 自报数据:Mythos 在其自测的 18 个 benchmark 中拿下 17 个第一,是同期 Meta Muse Spark、OpenAI Spud 这一批前沿模型中的领跑者。
来源:Anthropic Red Team — Mythos Preview、LLM-Stats 模型条目、RD World 报道
二、METR 评测结果与意义
METR 用任务"50% 时间视野"(time horizon)作为衡量 agent 自主性的指标:找出一个人类完成时长 T,让模型在该时长任务上恰好达到 50% 成功率。Mythos 的 50% 时间视野 ≥ 16 小时,95% 置信区间 8.5–55 小时。
关键背景:METR 测试集共 228 道题,其中只有 5 道是 16h+ 量级。METR 自己承认 "this value is at the upper end of what we can measure without new tasks"——也就是说题库不够大,再往上测量就不稳定也不有意义了。Mythos 的成绩已经把 METR 的现有评测体系顶满。
doubling time(能力翻倍周期)从过去的 7 个月缩短到 105 天,曲线已经超过 2027 年 AGI 预测线。
来源:METR 评测原文(Anthropic 镜像)、The Decoder、Startup Fortune、OfficeChai
三、Palo Alto Networks 安全测试
Palo Alto Networks 与 Anthropic 联合发布的红队报告显示,Mythos 在辅助渗透测试场景中:
- 3 周完成顶级人类渗透团队约 1 年工作量
- 端到端攻击链压缩到 25 分钟(侦察 → 漏洞利用 → 横向移动 → 数据外泄)
- 在监督下能独立发现并利用复合漏洞
Palo Alto 的明确结论:"security has entered an AI-vs-AI phase"——攻防都被 AI 大幅加速,防守方如果没有同级 AI 助力将处于结构性劣势。
四、Project Glasswing:限定开放的含义
Anthropic 没有像 Opus 4.6 那样直接公开 API,而是用 Glasswing 框架做受控开放——只给企业 + 安全研究合作方。这是 Anthropic 的 Responsible Scaling Policy 在新模型上的具象化:能力越强,预披露范围越窄。
对于像 aiself 这样的下游开发者,直接含义:
- 短期(未来 1–3 个月):用不上 Mythos,aiself 的产品定位不能假设它已是可调用资源
- 中期(3–9 个月):API 可能逐步放开,但定价大概率显著高于 Opus 4.6,且 RPM 限流会更严
- 长期(> 9 个月):等到 Mythos-Lite / Mythos-Mini 类衍生品出来,价格才会回到大众可用水平
五、对 aiself 的战略含义
5.1 后端模型架构选择
Mythos 这种"能跑 16 小时任务"的能力质变,让 aiself 必须在架构上做一个明确决定:到底是"模型一体化"还是"模型可替换"。
- 如果选模型一体化(绑定单一 model provider),aiself 在 Mythos 这种代际跃迁来临时只能等 provider 适配
- 如果选模型可替换(通过抽象层接入多个 provider),aiself 在每一代领头模型出来时都可以快速切换
建议:早期默认选可替换架构。两人小团队的核心优势就是船小好调头,不应该把自己锁死在某个 provider 的节奏上。具体实现可以参考 LiteLLM / OpenRouter 这种统一接口的开源方案。
5.2 任务编排(orchestration)的价值变化
过去 agent 框架的核心价值之一是用工程手段补足模型"短视野"的缺陷——把一个 8 小时任务拆成 50 个 5 分钟子任务、用 reflection/critic loop 让模型自我纠错。Mythos 把这条价值线大幅削弱:模型自己就能跑 16 小时长任务。
aiself 应该把 orchestration 的投入重心从"补缺陷"转向"补优势"——上下文供给(feed it the right context at the right moment)、工具准入(safety gating)、长期记忆沉淀(cross-session continuity)、用户偏好对齐(personalization)。这些是模型再强也仍然要外部系统供给的能力。
5.3 安全/合规门槛前置
Palo Alto 的报告意味着监管和媒体会更早盯上"AI 助手处理用户敏感数据"的安全话题。aiself 涉及:
- 桌面/手机控制(屏幕截图、点击操作、文件读写)
- 用户长期记忆(健康、财务、关系等隐私数据)
- 跨应用授权(OAuth tokens、cookies)
建议在 v0.1 之前就把数据本地化、最小权限、可审计 log 三件事固化为架构约束——晚做不如早做,等出问题再补的成本远高于一开始就设计进去。
5.4 时间窗口判断
Mythos 公开 API 出来到普及(价格降到 Sonnet 级别)的时间窗口大约 6–12 个月。aiself 在这个窗口里的最优策略:
- 用当前可用的 Sonnet 4.6 / Opus 4.6 做 v0.1 MVP
- 把架构设计成模型可换 + 记忆/工具层独立
- 等 Mythos-Lite 类产品出来时,aiself 的"骨架"已经成熟,可以立刻吃到模型升级的红利
六、未解问题
- Mythos 的实际 API 定价是多少?(决定 aiself 是否能负担直接调用)
- Mythos 是否支持 MCP 原生协议?(决定 aiself 的工具调用层是否需要重写)
- Project Glasswing 的开放节奏?(决定 aiself 能否提前拿到 Beta 资格做兼容性测试)
- Mythos 在中文长任务上的实际表现?(METR 测试集以英文为主,aiself 用户场景包含大量中文)
待后续跟踪。