aiself AI 情报站
2026-05-12·Claude Mythos 突破 METR 评测上限——对 aiself 的含义·多源调研·AI

Claude Mythos 突破 METR 评测上限——对 aiself 的含义

一、Mythos 是什么

Claude Mythos 是 Anthropic 尚未公开发布的下一代旗舰模型,目前以 Preview 形态走 Project Glasswing 限定开放——只对一组受邀的安全研究和企业合作方开放。截至 2026-05-12,未公开 API 定价或上下文窗口规格,但已在 LLM-Stats 等聚合站建档(pricing/context window 仍标为 TBD)。

Anthropic 自报数据:Mythos 在其自测的 18 个 benchmark 中拿下 17 个第一,是同期 Meta Muse Spark、OpenAI Spud 这一批前沿模型中的领跑者。

来源:Anthropic Red Team — Mythos PreviewLLM-Stats 模型条目RD World 报道

二、METR 评测结果与意义

METR 用任务"50% 时间视野"(time horizon)作为衡量 agent 自主性的指标:找出一个人类完成时长 T,让模型在该时长任务上恰好达到 50% 成功率。Mythos 的 50% 时间视野 ≥ 16 小时,95% 置信区间 8.5–55 小时。

关键背景:METR 测试集共 228 道题,其中只有 5 道是 16h+ 量级。METR 自己承认 "this value is at the upper end of what we can measure without new tasks"——也就是说题库不够大,再往上测量就不稳定也不有意义了。Mythos 的成绩已经把 METR 的现有评测体系顶满。

doubling time(能力翻倍周期)从过去的 7 个月缩短到 105 天,曲线已经超过 2027 年 AGI 预测线

来源:METR 评测原文(Anthropic 镜像)The DecoderStartup FortuneOfficeChai

三、Palo Alto Networks 安全测试

Palo Alto Networks 与 Anthropic 联合发布的红队报告显示,Mythos 在辅助渗透测试场景中:

  • 3 周完成顶级人类渗透团队约 1 年工作量
  • 端到端攻击链压缩到 25 分钟(侦察 → 漏洞利用 → 横向移动 → 数据外泄)
  • 在监督下能独立发现并利用复合漏洞

Palo Alto 的明确结论:"security has entered an AI-vs-AI phase"——攻防都被 AI 大幅加速,防守方如果没有同级 AI 助力将处于结构性劣势。

来源:The Decoder 综合报道

四、Project Glasswing:限定开放的含义

Anthropic 没有像 Opus 4.6 那样直接公开 API,而是用 Glasswing 框架做受控开放——只给企业 + 安全研究合作方。这是 Anthropic 的 Responsible Scaling Policy 在新模型上的具象化:能力越强,预披露范围越窄。

对于像 aiself 这样的下游开发者,直接含义

  1. 短期(未来 1–3 个月):用不上 Mythos,aiself 的产品定位不能假设它已是可调用资源
  2. 中期(3–9 个月):API 可能逐步放开,但定价大概率显著高于 Opus 4.6,且 RPM 限流会更严
  3. 长期(> 9 个月):等到 Mythos-Lite / Mythos-Mini 类衍生品出来,价格才会回到大众可用水平

来源:Anthropic Models Overview

五、对 aiself 的战略含义

5.1 后端模型架构选择

Mythos 这种"能跑 16 小时任务"的能力质变,让 aiself 必须在架构上做一个明确决定:到底是"模型一体化"还是"模型可替换"

  • 如果选模型一体化(绑定单一 model provider),aiself 在 Mythos 这种代际跃迁来临时只能等 provider 适配
  • 如果选模型可替换(通过抽象层接入多个 provider),aiself 在每一代领头模型出来时都可以快速切换

建议:早期默认选可替换架构。两人小团队的核心优势就是船小好调头,不应该把自己锁死在某个 provider 的节奏上。具体实现可以参考 LiteLLM / OpenRouter 这种统一接口的开源方案。

5.2 任务编排(orchestration)的价值变化

过去 agent 框架的核心价值之一是用工程手段补足模型"短视野"的缺陷——把一个 8 小时任务拆成 50 个 5 分钟子任务、用 reflection/critic loop 让模型自我纠错。Mythos 把这条价值线大幅削弱:模型自己就能跑 16 小时长任务。

aiself 应该把 orchestration 的投入重心从"补缺陷"转向"补优势"——上下文供给(feed it the right context at the right moment)、工具准入(safety gating)、长期记忆沉淀(cross-session continuity)、用户偏好对齐(personalization)。这些是模型再强也仍然要外部系统供给的能力。

5.3 安全/合规门槛前置

Palo Alto 的报告意味着监管和媒体会更早盯上"AI 助手处理用户敏感数据"的安全话题。aiself 涉及:

  • 桌面/手机控制(屏幕截图、点击操作、文件读写)
  • 用户长期记忆(健康、财务、关系等隐私数据)
  • 跨应用授权(OAuth tokens、cookies)

建议在 v0.1 之前就把数据本地化、最小权限、可审计 log 三件事固化为架构约束——晚做不如早做,等出问题再补的成本远高于一开始就设计进去。

5.4 时间窗口判断

Mythos 公开 API 出来到普及(价格降到 Sonnet 级别)的时间窗口大约 6–12 个月。aiself 在这个窗口里的最优策略:

  • 用当前可用的 Sonnet 4.6 / Opus 4.6 做 v0.1 MVP
  • 把架构设计成模型可换 + 记忆/工具层独立
  • 等 Mythos-Lite 类产品出来时,aiself 的"骨架"已经成熟,可以立刻吃到模型升级的红利

六、未解问题

  1. Mythos 的实际 API 定价是多少?(决定 aiself 是否能负担直接调用)
  2. Mythos 是否支持 MCP 原生协议?(决定 aiself 的工具调用层是否需要重写)
  3. Project Glasswing 的开放节奏?(决定 aiself 能否提前拿到 Beta 资格做兼容性测试)
  4. Mythos 在中文长任务上的实际表现?(METR 测试集以英文为主,aiself 用户场景包含大量中文)

待后续跟踪。