深度调研:Thinking Machines「Interaction Model + Background Model」双脑范式与 aiself 的影响
一、事件简述
2026 年 5 月 11 日,Mira Murati 创立的 Thinking Machines Lab(TML,前 OpenAI CTO 团队 + 翁荔加入)发布首个产品:TML-Interaction-Small,一个 276B 参数 MoE、12B 激活的「Interaction Model」。这是该公司成立以来的第一次产品发布。
二、技术架构(来自官方博客)
来源:Interaction Models: A Scalable Approach to Human-AI Collaboration
1. 双脑分工
| 层 | 名字 | 工作 |
|---|---|---|
| 前台 | Interaction Model | 200ms 微回合,永远在听 / 看 / 说,处理对话节奏、临场反应、即时打断 |
| 后台 | Background Model | 异步深思、浏览、工具调用;前台委派时打包完整对话上下文给它;结果回流给前台 |
引用:"sends a rich context package — not a standalone query, but the full conversation. Results stream back as the background model produces them."
两个模型共享上下文,所以用户既得到低延迟,又得到强推理。
2. 200ms 微回合机制
- 输入支持 text / audio / video
- 「micro-turns continuously interleaving the processing of 200ms worth of input and generation of 200ms worth of output」
- 编码器无关:audio → dMel 轻量 embedding;image → 40×40 patches
- 文本和音频同时输出
这不是 token 串行展平,是真正的并发 I/O。
3. 不需要 VAD 的 turn-taking
传统语音 agent 都要外挂 Voice Activity Detection。TML 把这一切「设计进模型」:
- 模型隐式追踪说话人是在「思考 / 让出 / 自我修正 / 邀请回应」
- 「The model jumps in as needed depending on the context」
- Turn boundary 从 micro-turn token 序列自然涌现
4. 关键基准
| 指标 | TML-Interaction-Small | GPT-realtime-2.0 |
|---|---|---|
| Audio MultiChallenge | 43.4% | 37.6% |
| FD-bench v1.5 交互质量 | 77.8 | 46.8 |
| Turn-taking 延迟 | 0.40s | 1.18s |
| TimeSpeak(时间感知语音) | 64.7% | 4.3% |
| CueSpeak(口头线索响应) | 81.7% | 2.9% |
| RepCount-A(视觉计数) | 35.4% | 1.3% |
| ProactiveVideoQA | 33.5 | 25.0(无响应基线) |
注意 TimeSpeak / CueSpeak / RepCount / ProactiveVideoQA 几项几乎是「能 vs 不能」的差距——这是新范式带出来的新能力,而非旧范式的渐进改进。
5. 已声明的局限
- 长会话仍需上下文管理
- 强依赖稳定网络(音视频流式)
- 更大模型「太慢,serve 不动」,所以先开小的
- 实时交互对 alignment / safety 是新挑战
三、行业语境
- VentureBeat:Thinking Machines shows off preview of near-realtime AI voice and video conversation — 强调这是 Murati 出走 OpenAI 后的「自证一击」
- Implicator:Thinking Machines Puts 200ms at Center of AI — 标题已经把判断说穿了:「chatbot turn 时代正在结束」
- Latent Space:advances SOTA Realtime Voice and kills standard VAD — 技术圈共识:杀掉 VAD 流程
- Unite.AI:Thinking Machines Lab Ships First Model With 200ms Real-Time Interaction
- StartupHub:Thinking Machines Lab Wants to Replace OpenAI Realtime With a Model That Listens While It Speaks
四、对 aiself 的含义
1. 这是 personal AI 交互层的范式拐点
「Chatbot turn」(等用户说完 → 模型回应 → 等用户再说)是过去三年所有 personal AI 产品(Siri/Alexa/Replika/Pi/ChatGPT Voice/Claude Voice)共同的交互骨架。TML 把它替换为「同时听同时说,模型自己判断什么时候插话」。
这不是性能优化,是产品形态的拐点:
- 「陪伴感」第一次有了模型层的基础(之前都是 prompt + TTS 拼出来的)
- 「主动行为」第一次能从模型自然涌现(ProactiveVideoQA 33.5 vs 25.0)
- 「视觉感知 + 语言响应」第一次低延迟同流
2. aiself 必须做的三件事
(a) 把「双脑架构」写进产品规划 即使 aiself 首发不是 voice-first,架构层面也应该按「前台低延迟 interaction layer + 后台异步 background agent」拆。这跟 Anthropic 的 Routines 殊途同归(见同日另一份调研)——前台快、后台深的范式正在固化。如果 aiself 一开始只设计「单一同步对话循环」,未来重写成本极高。
(b) 把「voice / video」放进 v2 路线图的明牌位 TML 现在还是 partner preview,public 在「今年晚些时候」。GPT-realtime-2.0 + Gemini 3.1-flash-live 也在加速。到 2026 Q4,「voice-first personal AI」会从早期采用者市场扩散到主流。aiself MVP 可以用文本 / 卡片,但 v2 必须 voice-capable,否则会被新一代 personal AI 用户视为「老一代产品」。
(c) 想清楚「Background Model」对 aiself 的成本结构意味着什么 TML 架构里真正烧钱的是 Background Model(深推理、浏览、工具调用),不是 Interaction Model。aiself 调用第三方模型时:
- 前台交互可以用便宜小模型(如未来开源版的 interaction-style 模型)
- 后台才用 Sonnet/Opus/Gemini Pro 跑深思
- 这跟「单模型直接接 prompt」的成本曲线完全不同
需要专门做一份 aiself 模型选型 × 成本结构的分析,把 TML 范式的成本影响算清楚。
3. 战略上的两难
TML 的范式好处全在「实时陪伴感」。但 aiself 团队(Rik × Suke)一直强调的另一条路是「主动 + 异步」——agent 应该像同事而不是像情人,应该在用户不在的时候帮你干活,回来给你一个 summary。
这两条路在 TML 范式下其实是同一架构的两端:
- Interaction Model = 在线时的陪伴感
- Background Model = 离线时的主动工作
所以 TML 范式对 aiself 的「主动 + 异步」叙事是利好,因为它合法化了「agent 应该有一个『后台脑』替你跑事情」的产品逻辑。问题在于:aiself 是否要做前台 Interaction Model 这一半?如果只做后台(类似 Routines / scheduled agent),那 aiself 就跟 Anthropic 的 Routines 正面冲突。如果两边都做,资源够不够?
这是产品定位会议必须回答的问题。
五、行动建议
| 优先级 | 行动 | 时间窗 |
|---|---|---|
| P0 | 把「双脑架构」作为 aiself MVP 架构决策项,专门开 1 次架构会 | 本周 |
| P0 | 决策:aiself MVP 是否做 voice?做 → 必须双脑;不做 → 写清楚 v2 时机 | 本周 |
| P1 | TML public release 时申请 API access;Murati 团队下一步公告(partner 名单 / 价格)持续追踪 | 持续 |
| P1 | 写一份「aiself 模型选型 × 成本结构」分析,把 interaction layer / background layer 分别算 | 两周内 |
| P2 | 关注谁会跟进发布同类「interaction model」——Anthropic / Google / 开源(Qwen / DeepSeek) | 持续 |
六、不确定性 & 需要补充调研的点
- TML-Interaction-Small 的 API 价格还没公布——Background Model 调用计费方式未知(按 token 还是按 wall-clock)
- 「Background Model」是否是 TML 自家模型,还是可挂任意 LLM?官方博客没明说,需要等更多技术细节
- 200ms 微回合的网络容错:弱网/移动场景表现未知;这对 aiself(如果做手机端)至关重要
- TML 还没说 on-device / edge 计划——纯云架构 vs 端云协同,对 aiself 的隐私叙事影响不同