aiself AI 情报站
← 返回首页

AI 情报日报 — 2026-06-14

高度相关

  • Anthropic Fable 5 / Mythos 5 被美国出口管制下架 — 美国政府以国家安全名义要求 Anthropic 对所有外国国民(含美境内外籍员工)暂停 Fable 5、Mythos 5 访问,Cognition/Devin、Agent Arena 同步移除模型;Anthropic 声明只拿到"口头证据"、认为是"误解"。Artificial Analysis 称 Intelligence Frontier 图表"首次倒退"。闭源前沿 API 一夜消失的先例。来源

  • MiniMax M3 开源:428B 总 / 23B 激活 MoE,1M token 上下文,原生支持文本/图像/视频,MiniMax Sparse Attention 把每 token 注意力计算压到 1/20,prefill 比 M2 快 9×、decode 快 15×。SGLang、vLLM、Together、Baseten、Fireworks、Unsloth GGUF 全部 day-0 接入。年营收 <2000 万美元免费商用(需通报 + 标 "Build with MiniMax"),超过须商谈。来源

  • Moonshot 开源 Kimi-K2.7-Code:1T MoE / 32B 激活,256K 上下文,MLA + MoonViT 视觉支持 + 原生 INT4 量化,Kimi Code Bench v2 +21.8%、推理 token 用量 -30%,vLLM/SGLang/KTransformers 都已就绪。来源

  • 腾讯文档"人机双写" + 腾讯 WorkBuddy 企业版 + 微信 AI 生态接入 同期登上腾讯研究院本周 AI 关键词榜应用类。我们关于"微信 ClawBot 24h 活跃窗口"为对话主场景的通道判断面对的环境正在变化,需持续盯。来源

中度相关

动态相关性来源
Artificial Analysis 推出 AA-AgentPerf 基准,主指标"Agents per Megawatt",强调 KV cache reuse + 投机采样 + prefill/decode 拆分;早期数据 GB300/B300 优于 Hopper 与 AMD评测从 TPS 转向功耗归一化吞吐链接
Huawei openPangu 2.0 计划 6/30 起分阶段开源(架构+权重+推理与训练代码),Pro 505B/18B、Flash 92B/6B,512K 上下文又一国产大型 MoE 进入开源链接
SkyPilot 推出 Sandboxes:在自有 K8s 集群跑不可信 LLM 生成代码,亚秒级启动、单集群 50k+ 沙箱,Anthropic 同期推 Claude Managed Agents 跑在客户沙箱里agent 工具执行的安全容器正在成为基础设施品类链接
FrontierMath v2 修正后审计出 42% 题目存在错误,Claude Fable 5 Tier 1-3 87%、Tier 4 88%静态评测越快被刷穿,再次印证简报里"benchmark 衡量靠不住"链接
Google Research 发布 Gemini-SQL2,宣称 BIRD text-to-SQL SOTA;另有 Nature Medicine 论文显示前沿通用模型在临床评估优于专用医疗系统通用前沿模型继续吃垂类专用系统链接
Artificial Analysis 把 SWE-Bench Pro 换成 Datacurve DeepSWE,Claude Code+Fable 5 [max] 77 分登顶,Codex+GPT-5.5 [xhigh] 76 反超 Claude Code+Opus 4.8 [max] 73;评论指 harness 质量正在成为一等变量"coding agent 排行"越来越是系统评测而非纯模型评测链接

背景信息

  • 苹果 Siri AI、谷歌 Gemini 实时翻译、OpenAI"Dreaming V3"上榜腾讯每周 AI 关键词应用类,无更多公开细节。来源
  • 中国大厂 AI 产品集中露面:美团 Tabbit 浏览器、京东 JoyAI-Echo、高德 ABot-Earth、小米 MiMo Code、美图 AI 拆分图层、讯飞星火医疗 V3.5、Kimi 世界杯预测、中科院"琅琊 2.0"。来源
  • 观点榜并列:哈萨比斯"AGI 经济学"、Tony Fadell"atoms 护城河"、Palo Alto Networks 称分析型 SaaS 将被绕过、Anthropic 主张"对前沿 AI 强制监管"并提"Claude 自进化"概念。来源
  • NVIDIA 发 DiffusionGemma 26B NVFP4 量化版(此前已报开源)。Reddit 实测:4 倍速度但事实错误约是 Gemma4 的 6 倍(33 对/28 错 vs 45 对/5 错),冷门话题尤甚——被解读为缺乏 token-by-token conditional 校验。来源
  • WolfBenchAI 花 $11,081.12 评测 Fable 5,因拒答率高被压低排名。来源

PH & GitHub Trending 深研

x1xhlol/system-prompts-and-models-of-ai-tools

  • 一句话:开源汇集 30+ 主流 AI 编码/对话工具(Claude Code、Cursor、Devin、Lovable、Manus、Replit、v0、Z.ai Code、Comet、Poke、Kiro、Junie 等)的真实 system prompt 与内部工具定义,140k stars / 34.7k forks。
  • 链接GitHub
  • 核心机制:按厂商分目录,每个产品收录 prompt 全文(含工具 schema、判词、上下文协议),频繁更新——最新一次 6/12 才加入 Claude Sonnet 4.6。本质是行业 prompt 实战手册。
  • 值得注意的做法:以"逐字泄露原始 prompt"为内容主体而不是二手解读,靠真材实料长期累积 140k stars + 持续 PR;说明 prompt 工程经验本身可被聚合分发。

NVIDIA/SkillSpector

  • 一句话:NVIDIA 开源的 AI agent skill 安全扫描器,专门检测 skill / MCP server 里的安全漏洞与恶意行为,4.4k stars。
  • 链接GitHub
  • 核心机制:基于 LangGraph 编排,串联静态规则、语义(LLM 驱动)、行为(AST + 污点追踪)三类分析器;专门有 MCP 分析器(最小权限校验、tool poisoning、rug-pull 检测),集成 OSV 供应链漏洞查询。输出 SARIF 报告。
  • 值得注意的做法:把"agent skill"作为独立安全攻击面治理,拆成 prompt injection / data exfiltration / excessive agency / privilege escalation / memory poisoning / harmful content / output handling 七类规则各成 analyzer——可对照检查我们 KB Manager 的 LLM 写入提案治理覆盖了哪些类目。

andrewyng/aisuite(含 OpenCoworker 桌面 agent)

  • 一句话:吴恩达团队开源跨厂商 LLM 统一接口库,14.1k stars;今天起内置桌面 AI agent "OpenCoworker",BYOK 或 Ollama 本地运行,能读文件、收发消息、生成 PDF/文档/表格、定时自动化。
  • 链接GitHub · OpenCoworker quickstart
  • 核心机制:三层架构——Chat Completions API 统一跨厂商调用 / Agents API + Toolkits(files、git、shell)+ MCP 工具集成 / OpenCoworker 桌面 harness。Agents API 自带 RequireApprovalPolicy(工具调用人工审批)、可插拔 state store(内存/文件/Postgres)、artifact + tracing;模型名 provider:model-name 一行字符串切换厂商。
  • 值得注意的做法:① 把"个人 AI agent"做成桌面 app + 本地数据,定位与简报中我们对腾讯 Marvis/Apple/阿里那条赛道的判断高度重叠;② 工具调用治理直接落在 SDK 层(Policy / store / artifact),与我们 PR 模式写入治理同思路;③ 把 OpenCoworker 源码放在 aisuite 的 platform/ 作为"agent harness 参考实现"分发——把示例工程当文档。

Action Items

  • 装一个 OpenCoworker 跑一遍 onboarding 全流程,重点看 BYOK 引导、文件权限模型、定时自动化(如 daily news summary)的 UI/触发机制——与简报"留存钩子完全空白"同题。
  • 用 SkillSpector 类目清单对照我们 KB Manager 写入治理与 LLM gate,输出"已覆盖 / 未覆盖 / 不适用"三栏清单。