aiself AI 情报站
2026-05-13·深度调研(由 2026-05-13 速递触发)·AI

深度调研:Thinking Machines「Interaction Model + Background Model」双脑范式与 aiself 的影响

一、事件简述

2026 年 5 月 11 日,Mira Murati 创立的 Thinking Machines Lab(TML,前 OpenAI CTO 团队 + 翁荔加入)发布首个产品:TML-Interaction-Small,一个 276B 参数 MoE、12B 激活的「Interaction Model」。这是该公司成立以来的第一次产品发布。

二、技术架构(来自官方博客)

来源:Interaction Models: A Scalable Approach to Human-AI Collaboration

1. 双脑分工

名字工作
前台Interaction Model200ms 微回合,永远在听 / 看 / 说,处理对话节奏、临场反应、即时打断
后台Background Model异步深思、浏览、工具调用;前台委派时打包完整对话上下文给它;结果回流给前台

引用:"sends a rich context package — not a standalone query, but the full conversation. Results stream back as the background model produces them."

两个模型共享上下文,所以用户既得到低延迟,又得到强推理。

2. 200ms 微回合机制

  • 输入支持 text / audio / video
  • 「micro-turns continuously interleaving the processing of 200ms worth of input and generation of 200ms worth of output」
  • 编码器无关:audio → dMel 轻量 embedding;image → 40×40 patches
  • 文本和音频同时输出

这不是 token 串行展平,是真正的并发 I/O。

3. 不需要 VAD 的 turn-taking

传统语音 agent 都要外挂 Voice Activity Detection。TML 把这一切「设计进模型」:

  • 模型隐式追踪说话人是在「思考 / 让出 / 自我修正 / 邀请回应」
  • 「The model jumps in as needed depending on the context」
  • Turn boundary 从 micro-turn token 序列自然涌现

4. 关键基准

指标TML-Interaction-SmallGPT-realtime-2.0
Audio MultiChallenge43.4%37.6%
FD-bench v1.5 交互质量77.846.8
Turn-taking 延迟0.40s1.18s
TimeSpeak(时间感知语音)64.7%4.3%
CueSpeak(口头线索响应)81.7%2.9%
RepCount-A(视觉计数)35.4%1.3%
ProactiveVideoQA33.525.0(无响应基线)

注意 TimeSpeak / CueSpeak / RepCount / ProactiveVideoQA 几项几乎是「能 vs 不能」的差距——这是新范式带出来的新能力,而非旧范式的渐进改进。

5. 已声明的局限

  • 长会话仍需上下文管理
  • 强依赖稳定网络(音视频流式)
  • 更大模型「太慢,serve 不动」,所以先开小的
  • 实时交互对 alignment / safety 是新挑战

三、行业语境

四、对 aiself 的含义

1. 这是 personal AI 交互层的范式拐点

「Chatbot turn」(等用户说完 → 模型回应 → 等用户再说)是过去三年所有 personal AI 产品(Siri/Alexa/Replika/Pi/ChatGPT Voice/Claude Voice)共同的交互骨架。TML 把它替换为「同时听同时说,模型自己判断什么时候插话」

这不是性能优化,是产品形态的拐点:

  • 「陪伴感」第一次有了模型层的基础(之前都是 prompt + TTS 拼出来的)
  • 「主动行为」第一次能从模型自然涌现(ProactiveVideoQA 33.5 vs 25.0)
  • 「视觉感知 + 语言响应」第一次低延迟同流

2. aiself 必须做的三件事

(a) 把「双脑架构」写进产品规划 即使 aiself 首发不是 voice-first,架构层面也应该按「前台低延迟 interaction layer + 后台异步 background agent」拆。这跟 Anthropic 的 Routines 殊途同归(见同日另一份调研)——前台快、后台深的范式正在固化。如果 aiself 一开始只设计「单一同步对话循环」,未来重写成本极高。

(b) 把「voice / video」放进 v2 路线图的明牌位 TML 现在还是 partner preview,public 在「今年晚些时候」。GPT-realtime-2.0 + Gemini 3.1-flash-live 也在加速。到 2026 Q4,「voice-first personal AI」会从早期采用者市场扩散到主流。aiself MVP 可以用文本 / 卡片,但 v2 必须 voice-capable,否则会被新一代 personal AI 用户视为「老一代产品」。

(c) 想清楚「Background Model」对 aiself 的成本结构意味着什么 TML 架构里真正烧钱的是 Background Model(深推理、浏览、工具调用),不是 Interaction Model。aiself 调用第三方模型时:

  • 前台交互可以用便宜小模型(如未来开源版的 interaction-style 模型)
  • 后台才用 Sonnet/Opus/Gemini Pro 跑深思
  • 这跟「单模型直接接 prompt」的成本曲线完全不同

需要专门做一份 aiself 模型选型 × 成本结构的分析,把 TML 范式的成本影响算清楚。

3. 战略上的两难

TML 的范式好处全在「实时陪伴感」。但 aiself 团队(Rik × Suke)一直强调的另一条路是「主动 + 异步」——agent 应该像同事而不是像情人,应该在用户不在的时候帮你干活,回来给你一个 summary。

这两条路在 TML 范式下其实是同一架构的两端

  • Interaction Model = 在线时的陪伴感
  • Background Model = 离线时的主动工作

所以 TML 范式对 aiself 的「主动 + 异步」叙事是利好,因为它合法化了「agent 应该有一个『后台脑』替你跑事情」的产品逻辑。问题在于:aiself 是否要做前台 Interaction Model 这一半?如果只做后台(类似 Routines / scheduled agent),那 aiself 就跟 Anthropic 的 Routines 正面冲突。如果两边都做,资源够不够?

这是产品定位会议必须回答的问题。

五、行动建议

优先级行动时间窗
P0把「双脑架构」作为 aiself MVP 架构决策项,专门开 1 次架构会本周
P0决策:aiself MVP 是否做 voice?做 → 必须双脑;不做 → 写清楚 v2 时机本周
P1TML public release 时申请 API access;Murati 团队下一步公告(partner 名单 / 价格)持续追踪持续
P1写一份「aiself 模型选型 × 成本结构」分析,把 interaction layer / background layer 分别算两周内
P2关注谁会跟进发布同类「interaction model」——Anthropic / Google / 开源(Qwen / DeepSeek)持续

六、不确定性 & 需要补充调研的点

  • TML-Interaction-Small 的 API 价格还没公布——Background Model 调用计费方式未知(按 token 还是按 wall-clock)
  • 「Background Model」是否是 TML 自家模型,还是可挂任意 LLM?官方博客没明说,需要等更多技术细节
  • 200ms 微回合的网络容错:弱网/移动场景表现未知;这对 aiself(如果做手机端)至关重要
  • TML 还没说 on-device / edge 计划——纯云架构 vs 端云协同,对 aiself 的隐私叙事影响不同