aiself AI 情报站
← 返回首页

AI 情报日报 — 2026-06-07

🎯 命中战况(与我们正在做的事直接相关)

Microsoft SkillOpt 论文实测:训练 plain-text skill 文件比微调模型涨幅更高

  • 发生了什么:微软研究院 SkillOpt 论文成为本周 Readwise 高亮 PDF。核心方法:模型本身冻结,把 agent 的纯文本 skill 文件当模型权重训练。实测在 GPT-5.5 上无 skill 基线平均准确率 +23.5 分(直接对话)、+24.8 分(Codex agentic loop 内)、+19.1 分(Claude Code 内)。
  • 为什么重要:我们简报里把 SkillOpt 列入对标体系("me/ 自动重写算法骨架"),但还停留在抽象引用。现在有了具体数据:把"个人文件被 agent 当上下文使用"这件事用迭代算法训练,跨三种 agent runtime 都拿到了两位数提升。这正面验证了 aiself 的核心赌注——me/ 文件夹本身是可以被"训练"的资产,而不只是被 RAG 召回的语料。
  • 对我们意味着什么:我们把"用户主动写 me/"和"agent 给出洞察"看作两个孤立环节,SkillOpt 提供了第三种姿势:agent 反向"训练" me/ 让自己用得更好——可以直接对应到我们"叙事画像生成 pipeline"的 Phase 2,用结果质量反向迭代 me/ 的组织结构。建议把这篇定为本季度必读,验证算法骨架能否套到 me/ 重写上。
  • 想深入SkillOpt PDF(重点读"frozen model + plain-text skill 训练"那部分的 loss 设计)

MemPalace 发 3.4.0:54k star 的开源记忆系统直接给到 96.6% LongMemEval SOTA

  • 发生了什么:MemPalace(号称"the best-benchmarked open-source AI memory system")发 3.4.0:可插拔向量后端(qdrant / pgvector / sqlite_exact)、MCP 服务器 + CLI Docker 镜像、wing 命名规范化迁移工具。架构层面:Wings(人/项目)→ Rooms(话题)→ Closets(AAAK 压缩)→ Drawers(原文档),跨 wing 用 Tunnels 连接。LongMemEval 上 96.6% Recall@5(zero-API 最高),加 Haiku 重排达 100%(500/500)。
  • 为什么重要:简报里挑战 1 明确写"MemPalace 的开源 benchmark 可能直接拿来跑"——现在它不只是 benchmark 可用,整套层级结构、矛盾检测(捕捉错代词/名字/年龄)、19 个 MCP 工具的设计都跟我们 KB Manager 思路高度同构。54k star 说明这条赛道(个人记忆系统)的用户需求是真实存在的,且对开源解决方案有强烈兴趣。
  • 对我们意味着什么:两件事:(1) 我们的 KB 健康检查 LLM 层(待实现)可以直接抄 MemPalace 的"contradiction detection"做法,不需要从零设计;(2) 它的 Wing/Room/Closet 层级是验证过的产品语言,可以拿来对比我们 me/ 的目录结构是否过于扁平。同时也要警惕:这是个 SDK/MCP 工具,不是面向终端用户的产品——和我们做"AI 个人 Wiki"的产品形态没有直接竞争,但说明纯技术层已经"卷得很深",差异化必须靠产品。
  • 想深入MemPalace GitHub(重点看 benchmarks/ 目录和 MCP server 的 19 个工具定义)

PaddleOCR 新发多语言 API SDK + PaddleOCR-VL-1.5 模型

  • 发生了什么:6 月 4 日 PR 18049 给 PaddleOCR 加了 Python/Go/TypeScript 三语言 SDK 直接调官方异步 API;同期 MCP 服务器重构为 Python SDK;默认文档解析模型升级到 PaddleOCR-VL-1.5。81k star,支持 100+ 语言,明确定位"Turn any PDF or image document into structured data for your AI"。
  • 为什么重要:简报挑战 3 卡在"截图导入的 OCR 选型未定"——各色基因/23魔方需要中文友好 OCR,PaddleOCR 是候选但没落地。现在它官方提供了 TypeScript SDK,可以直接接进我们的 Fastify 后端,不需要 Python 子进程。
  • 对我们意味着什么:这是个工程层面的解锁信号。三步导入第二步(截图导入)从"等选型"变成"今天就能集成"。PaddleOCR-VL-1.5 还是多模态版本,可以同时解析表格/图片/文字,适合各色基因报告这种含图表的截图。建议把 OCR 选型从"未定"挪进"本周决策"。
  • 想深入PaddleOCR GitHub(重点看 api_sdk/typescript/ 的接口设计)

高度相关

  • CopilotKit 33.2k star,AG-UI Protocol 制定方 — 简报挑战 8 明确点名要参考它,今天看到它 main 分支高频提交(6 月 1-6 日都有合并),插件 1.58.0 已发,是活跃维护的项目。CopilotKit GitHub
  • Daniel Miessler 的 Personal AI Infrastructure (PAI) 15k star — 同赛道竞品级项目,思路是"个人 AI 基础设施 + 40 个 skill packs(Agents / ContentAnalysis / Telos / Thinking 等)"。和 aiself 的"个人 Wiki"形态不同,但用户人群高度重叠(重度 AI 用户搭建自己的 PKM/agent 栈)。PAI GitHub
  • Anthropic 发布 ant CLI — 类似 Claude Code 的官方命令行(腾讯研究院周关键词收录)。我们的 Agent 内部架构可能多一个对标参照系。
  • Anthropic Opus 4.8 实测 + ARC-AGI-3 登顶 — 推理上限继续抬升,对成本侧(MiMo 降价/Token 紧缩)形成两端拉扯。

中度相关

动态相关性来源
微软提"Token 紧缩"观点我们成本敏感、靠 DeepSeek 主力,要关注是不是行业拐点腾讯AI周关键词
小米 MiMo-V2.5 降价又一个低价中文模型选项,可纳入 LLM Gateway 备选同上
MiniMax A 股上市 + Anthropic IPOAI 公司资本化窗口打开同上
OpenAI 产品合并大厂在收敛,对我们做窄而深产品是利好信号同上
OpenAI 成立机器人团队大厂往物理世界打,认知/Wiki 这块依然没人专做同上
Sutton 提"生成认知"学术观点,与我们 me/ 是"用户认知模型"的方向呼应同上
Anthropic 发布 Claude 用户数据分析可能有用户行为数据可参考(如有原文需补)同上
教皇 Leo XIV 首封通谕谈 AI非技术界视角:"technology is never neutral, it takes on the characteristics of those who devise..." 对我们"数据主权/认知主权"叙事可借力Wisereads Vol.145

背景信息

  • Dan Shipper(Every 联创)在 Lenny 播客上:"每次自动化一件事,就需要更多人在上面监督它工作"——FDE(Forward Deployed Engineer)成为最热岗位。
  • Packy McCormick "Riding the Leopard":在 AI 时代,"differentiation is a moral obligation"——可呼应 aiself "帮人认识自己" 的差异化叙事。
  • Sam Kriss 写了篇激烈反 AI 代笔的文章,反映用户对"AI 生成内容"的免疫力在上升。

PH & GitHub Trending 深研

MemPalace

  • 一句话:开源 AI 记忆系统,54.3k star,号称 LongMemEval zero-API SOTA。
  • 链接GitHub
  • 核心机制:四层物理结构(Wings/Rooms/Closets/Drawers)+ AAAK 30x 无损压缩方言 + 跨 wing 的 Tunnel 关联 + SQLite 知识图谱(时序实体-关系三元组)+ MCP 19 工具。提供矛盾检测(识别错代词/名字/年龄)。3.4.0 后支持 qdrant/pgvector/sqlite_exact 三种向量后端。
  • 对 aiself 的启发:直接命中简报挑战 1 的"KB 健康检查 LLM 层"——它的 contradiction detection 实现就是我们要的 checker;它的 Wing/Room/Closet 层级也是个验证过的产品语言,对照我们 me/ 结构是否过于扁平。提醒:它是 SDK/MCP 工具不是产品,所以不构成直接竞争,但说明纯技术层卷得很深,差异化必须靠产品体验。

PaddleOCR

  • 一句话:百度开源的 OCR 工具包,81k star,最新版 PaddleOCR-VL-1.5 是多模态文档解析模型。
  • 链接GitHub
  • 核心机制:异步 Job API(submit → poll → fetch)+ 多语言 SDK(Python/Go/TypeScript 全官方)+ MCP server。模型矩阵:PP-OCRv5 / PP-StructureV3 / PaddleOCR-VL / PaddleOCR-VL-1.5。支持 100+ 语言。
  • 对 aiself 的启发:直接命中简报挑战 3 的截图 OCR 选型。TypeScript SDK 可以无痛接进我们的 Fastify。建议本周就跑一遍 23魔方/各色截图,把选型从"待定"挪进"决策"。

CopilotKit

  • 一句话:Agent 前端栈 + AG-UI Protocol 制定方,33.2k star。
  • 链接GitHub
  • 核心机制:覆盖 React/Angular/Mobile/Slack 的 agent UI 组件库 + Generative UI 抽象层 + 自家协议 AG-UI(Agent-to-User Interface)。最近重构换了 lint/format 工具链(oxlint/oxfmt),节奏快。
  • 对 aiself 的启发:直接命中简报挑战 8——我们 Web 端 KB proposal 确认交互形态有限。它的"agent 输出 + 用户审批"组件抽象是现成参照。短期不必引入它整套,但要研究它的 API 设计思想,对我们自己实现 PR 模式 UI 有直接借鉴价值。

Personal AI Infrastructure (PAI)

  • 一句话:Daniel Miessler(安全圈著名播主)的"个人 AI 基础设施"开源项目,15k star。
  • 链接GitHub
  • 核心机制:以 Packs 方式组织 40 个 skill(Agents、ContentAnalysis、Telos 等),每个 pack 有 README/INSTALL/VERIFY + src/。v5.0.0 已发,自带 5-phase AI 安装向导。PULSE 模块(推测是 schedule/automation 层)。
  • 对 aiself 的启发:这是同赛道竞品级信号。用户人群(重度 AI 用户搭自己 PKM/agent 栈)和我们 V1 用户高度重叠。它走的是"自托管 + skill 市场"路线,而 aiself 走"开箱即用 + 个人 Wiki"路线——对照看,我们的差异化必须落在"无需配置即可生成自我洞察",不能也变成另一个"高级用户工具栈"。建议给团队成员(包括 Suke)做一次专项 demo 对比。

Action Items

  1. 本周决策 OCR 选型:用 PaddleOCR-VL-1.5 跑一遍真实的 23魔方/各色截图,验证中文+表格识别质量,给三步导入 step 2 解锁。
  2. 本周读完 SkillOpt 论文:判断"frozen model + plain-text skill 训练"算法骨架能不能套到 me/ 自动重写上,写 1 页笔记进 decide/
  3. 本周做一次 PAI 对比研究:clone 跑一遍,重点比对它的 onboarding 体验 vs 我们 V2 三步导入,差异化叙事要有具体支撑点。