跳到主要内容

TAG / P

评测

pingce·2 篇笔记·能力与效果的量化评估

AI / 记忆

Agent Memory 选型指南: 五大范式、评测水分与四个必补动作

NOTE 同一个记忆框架, 在自家 benchmark 上可以报到 94.4 分 —— 而这个数字来自厂商托管平台的自测. 更麻烦的是: 同一类系统换一套测试脚手架, 分数能相差几十个百分点, 变量既不是模型也不是产品, 而是 谁写的评测代码 . 那么问题就不是"该买哪个", 而是: 在一个连分数都不可比的领域里, 选

AI / Skill

SkillOpt: 把 skill 文档当参数来训练, 以及它在规范与可复现性上的边界

NOTE 如果一份 skill 文档写得不好, 为什么不能像调参一样把它"训"好? SKILL.md 是纯文本, 模型权重可以冻结, 任务分数就是现成的损失函数 —— 这条路听起来几乎无懈可击. 但真正的问题在另一头: 一个只会看任务分数的优化器, 知不知道 skill 该长成什么形状? 它怎么判断"变得更长"是进步还

相关标签与本标签共现最多