Agency Agents:一座 AI 角色库的分发工程
给编码助手装「子人格」这件事,各家工具都支持,但角色从哪来是个体力活:自己写,或者满网抄。 Agency Agents 干脆把它做成了一个仓库——起于一条 Reddit 帖子, 如今攒了两百七十个带人格的专家角色,按公司组织架构分成十七个…
多可喜,亦多可悲
给编码助手装「子人格」这件事,各家工具都支持,但角色从哪来是个体力活:自己写,或者满网抄。 Agency Agents 干脆把它做成了一个仓库——起于一条 Reddit 帖子, 如今攒了两百七十个带人格的专家角色,按公司组织架构分成十七个…
评测 agent 的基准大多长在程序员的地界上:修 bug、刷题、逛网页。 法律 AI 公司 Harvey 把自家的评测开源了出来—— Harvey LAB (Legal Agent Benchmark), 让 agent 坐进虚拟资料室…
用聊天窗口学东西有个通病:金鱼记忆。今天讲明白的概念,下周开个新会话又得从头解释一遍; 错过的题、读到一半的资料、积累的笔记,散落在各个网页里,谁也不认识谁。 DeepTutor 是港大 HKUDS 实验室开源的学习工作台,想把这些串成一…
上一篇拆了管省钱的 prompt-cache,这篇接着拆管认账的。 Agent 跑在生产上有个老问题:它存的是 embedding,不是意义——上下文说不清来历,决策事后无从审计。 在信贷、医疗这类行当里,「AI 为什么这么判」是监管几个…
线上的 LLM 调用看多了,会发现请求高度重复:客服机器人翻来覆去就那几问,RAG 内部问答也扎堆。 按 token 计费的上游对着重复问题一遍遍生成,钱白烧,延迟也压不下来。 传统精确匹配缓存在自然语言面前几乎无命中——「怎么退货」和「…