aiself AI 情报站
← 返回首页

AI 情报日报 — 2026-06-12

高度相关

  • Anthropic Fable 5 在 ML/AI 研究类查询上被发现"静默降级",30 天 prompt 保留无 opt-out — SemiAnalysis 实测后社区集体反弹(natolambert/martin_casado/drfeifei/antirez/ClementDelangue/Ben's Bites/Latent Space 等多源报道),Anthropic 已部分回退"secretly"那条政策;同时 Fable 5 默认 30 天保留 prompt,无法在零保留环境(含欧洲部分场景)使用。社区共识是把前沿 API 当作"不稳定依赖"看待。来源(Latent Space 综述) / Anthropic Devs 回退说明 / SemiAnalysis 原帖
  • 谷歌开源 DiffusionGemma 26B(Apache 2.0),并行扩散生成、推理最高 4x — 基于 Gemma 4 的实验性 MoE 扩散文本模型,激活 3.8B,按 256-token 块并行去噪而非自回归;vLLM 称单卡 H200 FP8 batch=1 达 1200+ tok/s 已原生支持,llama.cpp/Unsloth 也跟进。研究者把它当成"非顺序解码"方向的开源样本,不是产品级 SOTA 替代。Google 博客 / 腾讯速递
  • Sarah Guo《The Untrainable》:能被基准测的工作都会被商品化 — 文章认为应用层价值在"不可读"工作——把客户私有现实重新组织成模型可执行的形态,靠许可、问责、信任建立壁垒;并主张"intent(选择做什么)比算力还稀缺"。与我们对"内在数据 vs 外在数据"的判断一致。原文 / Latent Space 综述
  • Hermes Agent 上线 "Write Gate":memory/skill 写入需人工审批 — Teknium 给 Hermes Agent 加了 GUI 审批控制,agent 对记忆和技能文件的任何更新都要用户显式批准才落盘(同期还发布了 Agent profiles)。与我们 save-to-wiki"写入要不要确认"是同一道设计题,可作外部参照。来源
  • Ramp AI Index:头部 1% 企业人均 AI 月支出 7500 美元,环比 +14.1% — token 单价两年降 98%,但 agent 用量推动企业 AI 总账单上涨 ~320%,前 1% 与中位数支出差距达 680 倍。差距不在订阅数量,而在工作流、数据和组织熟练度。来源
  • Claude Code 现支持嵌套 subagent,最大 5 层深度 — Boris Cherny 官宣。配合 Fable 5 长时间任务能力,做"无人值守长跑"的开发流被进一步打开。来源

中度相关

动态相关性来源
Supermemory 开源可自托管,本地部署个人记忆层赛道又一个 self-host 选项推文
Anthropic Dario 发《Policy on the AI Exponential》,主动要求政府对前沿 AI 强制第三方测试与监管,参照 FAA 适航;同步发起 2 亿研究 + 1.5 亿培训承诺模型供应商监管议程升温,影响企业用户合规心态原文
小米发布并开源 MiMo Code(MIT 协议),基于 OpenCode 二开,内置 MiMo-V2.5 限免;自带持久记忆系统 + Compose 模式跑完整工程流,同模型对比下 SWE-Bench Pro 62%、Terminal Bench 2 73%"agent 内置持久记忆"成为编程 agent 标配腾讯速递
腾讯混元开源 HPC-Ops 推理算子库(五类算子,Sampler 较 vLLM 提速 4–7.5x)推理层成本面有新选项来源
Google 发布 Gemini 3.5 Live Translate,70+ 语言实时语音对译,已在 API/Translate 上线,Meet 即将接入多模态实时对话能力又下一台阶Google 博客
Meshy 推出全球首个 3D 创作 AI Agent,多轮对话完成概念→编辑→打印检查→导出全流程,单 asset 建模成本从 ~$1000 → $1"把生成工具升级成工作流入口"是一类通用范式来源
Gergely Orosz/Hugging Face 等公开吐槽 Anthropic 模型不可控变更 + 数据保留模型 portability 重新成为话题推文
Agent Arena 公布评测方法论:从长程 trace 挖 bash 报错、工具幻觉、"insanity" 等客观信号,替代人工偏好打分评测从"结果偏好"转向"失败模式可观测",对洞察引擎对抗核查段有方法论参考推文
SemiAnalysis 买齐 Anthropic/OpenAI 各档订阅实测长任务到额度耗尽,挑战"$200 订阅≈$2000 API 等值"的流行说法(完整数据见原帖图表)订阅定价 vs 实际用量的真实剪刀差,付费定价时的参考推文

背景信息

  • OpenAI Codex 协助 UA 教授 Chi-kwan Chan 改进黑洞等离子体模拟算法,部分计算据称提速千倍。腾讯速递
  • Factory 在桌面端推出 Missions(长任务工作流)。推文
  • Perplexity 把 Claude Fable 5 列为 Computer 模式的 orchestrator 模型。推文
  • Apple 把 Claude 接入 Foundation Models 框架供开发者调用。推文
  • HuggingFace 本周 Arbor 框架登顶(77 赞)—— 用"假设树+独立测试+持久知识树"做自主科研循环。论文
  • HF 同期 Claw-SWE-Bench:为 OpenClaw 风格 agent harness 提供标准评测协议。论文
  • ChatGPT 模型选择器更新为 Instant/Medium/High/Extra High/Pro 五档,与 Codex 对齐。OpenAI 帮助
  • PH 上线 Skribe(本地优先 markdown + AI review 写作)、Juno(AI 慢病健康伴侣)、PixelForge(照片转游戏资产)等。PH 榜
  • Mainframe 的 pr.video——把 GitHub PR 转成讲解视频。链接

PH & GitHub Trending 深研

Asmi AI

  • 一句话:每天早晨 AI 主动打电话给你收集任务清单,然后用真实电话帮你打给牙医/银行/水管工/餐厅去完成预约、催账、比价等琐事,结果通过 WhatsApp/iMessage 回执。
  • 链接Product Hunt / 官网
  • 核心机制:语音入口(不靠 App、不靠 chatbot)+ Twilio 电话栈 + Gemini 2.0 推理 + ElevenLabs 语音;自动导航 IVR、等 hold、做来回多轮真人对话。技术栈对外公开(PH 页 Built With)。
  • 值得注意的做法:(1) 创始人 Rishi 自述"Tuesday cost me four hours"的具体故事开场,避开抽象口号;(2) "每日主动一通电话"作为单一固定 ritual,把不规则任务变成稳定触达节奏;(3) demo 用具体案例驱动(连打 3 个水管工比价、给妈妈用意大利语日常问候、看图片下餐厅订单),不靠功能列表;(4) Hunter Rohan 在 PH 帖里写"I met them a month ago, surprised the product is actually available"——开 launch 前先做 hunter 信任度铺垫。

Journey Now

  • 一句话:iOS 学习 copilot,把任何"想学/想做"的目标拆成约 4 周的步骤化路径,每日推送具体练习+反思,可邀朋友进 Pod 互相看到进度。
  • 链接Product Hunt / 官网
  • 核心机制:聊用户的目标 → 挖掘其底层动机 → 生成 4 周路径(含每日具体动作 + 引用来源)→ 用户反思后路径动态调整 → 朋友 Pod 看到彼此进度形成社交压力。每个任务可"Go Deeper"进入带完整上下文的对话深挖。
  • 值得注意的做法:(1) 任务给到"具体到引用源"的颗粒度而不是 prompt 式建议;(2) 朋友 Pod 不是冷启动社交,是用户主动拉自己已有的朋友进来,绑定挽留;(3) 把"想了很久但没开始的项目(一本书/一首歌/一门语言)"作为定位钩子,比"达成你的目标"具体得多;(4) Maker 在 PH 帖里直接承认"我用了 10 年做教育产品,最难的是日常练习的隐形支撑",开诚布公讲方法论而非吹功能。

Respan Gateway(原 Keywords AI)

  • 一句话:一个 OpenAI/Anthropic 兼容的端点接 1000+ 模型,同平台带 fallback、retry、cache、限额、告警、trace、eval、prompt 管理、监控。
  • 链接Product Hunt / 官网
  • 核心机制:路由只是入口,重点在 production 控制面——硬错误自动 fallback(延迟 fallback 还在路线图)、per-API-key 软硬 spend cap、eval 流量与生产流量靠 metadata/tag/env 隔离,避免 eval prompt 污染生产指标。
  • 值得注意的做法:(1) 文案明确反"2 行代码做完一切"的过度承诺,承认"agent 难的不是接入";(2) 把 fallback、cost cap、eval 隔离三件事一起卖,比单点 LLM gateway 完整一档;(3) 详细回复 PH 用户提问(多 provider 试点路径、delay-based failover 时间表、eval 与生产指标隔离方式),把客服当成 launch 内容。

agentsview(GitHub 1.7k stars)

  • 一句话:本地优先的 coding agent session 分析工具,覆盖 Claude Code/Codex 等 20+ agent,号称"ccusage 的 100x 加速替代"。
  • 链接GitHub
  • 核心机制:SQLite 作为 ingestion 主存储(本地、唯一可信源)+ 可选 PostgreSQL 共享读 + 新增 DuckDB 分析镜像(含 Quack 协议远程暴露+TLS/loopback 默认);同一 db.Store 接口适配三种后端,编译时合约检查防止三家实现漂移。
  • 值得注意的做法:(1) 把"本地数据为真"作为架构第一性原则,远程能力是 mirror 而不是 source;(2) Quack 暴露默认 loopback、非 loopback 要显式 token + --allow-insecure,安全默认值前置;(3) "100x 比 ccusage 快"作为对标钩子,先在工程社区里抢 ccusage 替代位。

Action Items

  • 实测 DiffusionGemma 26B(vLLM 或 llama.cpp)的真实生成质量与吞吐,看在"分析层/合成层"这类非 SOTA 要求场景下是否站得住。
  • 注册 Asmi AI 走完一遍完整流程(晨会电话 → 任务下派 → IVR/真人电话 → 回执),重点观察其首日 ritual、回执文案、留存钩子做法。
  • agentsview 本地起一次(自身仓库或 aiself 仓库的 Claude Code 日志),观察其 session intelligence 的可视化维度——对 LLM Gateway 的 trace UI 思路可能有镜像价值。