1. 介绍自己
场上三方:我在小程序硬件行业;上游是平台召回和控制;对面是品牌商家。用户一句话控家电,平台要落到一台确定设备。
已经做完:720 条硬件 Query,模糊控制大约六成;方案收成「先清单、先确认,再控制」;交过 Demo。
下一步不做全能硬件 Agent。先落一个 case:说关空调,落到正确设备,人确认后再执行。来面这个岗,是同一件事换对象:用人经理给画像,招聘方找人。
模糊需求先收成确定对象,再判断,再执行。硬件里是设备,招聘里是候选人。
任何「推荐简历 Skill / Agent」题都按这四步:先定形态 → 结果指标看值不值得用 → 过程指标看改哪一层 → 数据差了一次只改一层。约面率第一期不当主结果,更不当调参依据。
考的是:场上你是谁,事情做到哪了,下一个 case 是什么。
场上三方:我在小程序硬件行业;上游是平台召回和控制;对面是品牌商家。用户一句话控家电,平台要落到一台确定设备。
已经做完:720 条硬件 Query,模糊控制大约六成;方案收成「先清单、先确认,再控制」;交过 Demo。
下一步不做全能硬件 Agent。先落一个 case:说关空调,落到正确设备,人确认后再执行。来面这个岗,是同一件事换对象:用人经理给画像,招聘方找人。
我不是招聘专家。能带过来的是「不确定输入怎么变成可核对对象」;职级口径入职后跟招聘同步。
硬件控错设备和招聘错筛一个人,都不能靠模型看起来很懂。能写成字段的先走规则,主观的只对已确认对象取证。
下一步:跟 1 个真实职位拆耗时,看卡在画像、筛选还是理由不可核对。不先画招聘中台。不说硬件做不下去,不说追热点。
不是我一个人上线了 Agent。我把问题收成可拍板方案,平台管能力,商家管设备数据。
已走完:720 条里模糊控制约 59%;清单和确认写进方案;Demo 联调后按更稳链路,从 MCP 改成 SDK。
要落的 case 是「模糊空调控制」:命中正确设备、人确认、开关可追溯。当期没完整放量,窗口要对方同步。720 条是工具效率标签筛的,不是随机全量。训练不是我做的。
先分清评谁:这条 case 的主指标是有没有落到正确设备,平台排期不是我的指标。不打总分。人改过品牌,说明前面没落对对象。
没有确定对象就映射成常见品牌,这是失败,所以不准执行。下一个 case 只评一件事:命中正确那台空调没有。Demo 太像 Agent 就不稳,已经收窄。
会这么问:你要做推荐简历的 Skill 或 Agent,评测指标是什么?从结果和过程拆开。不好用怎么把数据做上去?
用人经理确认画像,招聘方出短名单。第一期做成 Skill:画像已确认 → 规则筛客观 → RAG 取项目段 → Prompt 判断并带原句 → 写入同一张表。
只有「内部不够人,换不换来源、停不停」写不死,才升 Agent。升了以后结果指标不变,过程多两列:工具选对没有,有没有未确认就改数据。
| 维度 | 指标 | 怎么算 | 差了说明 |
|---|---|---|---|
| 敢不敢用 | 短名单采纳率 | 实际推进 ÷ 系统给出 | 名单不可信,或没进 ATS |
| 信不信理由 | 理由查看率 | 点开原句 ÷ 展示数 | 理由没用,退化成纯规则 |
| 有没有被顶回 | 驳回率 | 点「不像」÷ 展示数 | 再抽样:原句对不上,还是段对结论不对 |
| 有没有更快 | 出短名单耗时 | 确认画像到可核对名单 | 效率没打出来 |
采纳率是链路业务结果,规则和库也会影响,不能单拿它调 Prompt。约面率第一期不进这张表。
| 环节 | 主指标 | 差了说明 | 谁改 |
|---|---|---|---|
| 客观规则 | 硬条件违约率(目标 0) | 地点年限不满足的人进了名单 | 规则,不是模型 |
| RAG 取证 | Recall@K / Precision@K | 该看的段没送到,或送来空话 | 检索 |
| Prompt 判断 | 「像」的 Precision、幻觉率 | 误放,没证据还说像 | 提示词 |
| Prompt 可信 | 引用支持率 | 理由简历里没有 | 提示词 + 必须带原句 |
| Skill 补库 | 任务成功率、有效简历率 | 登录失败,下到广告页 | 执行,不看像不像 |
| 若是 Agent | 工具选择准确率、越权次数(目标 0) | 该搜人去查待办;未确认就改数据 | 编排和权限 |
K 默认 3,和送给判断模型的段数一致。评 RAG 不看像不像。评 Prompt 必须用人工放好的段落。
| 你看到的 | 对上的过程 | 怎么提 |
|---|---|---|
| 采纳低 + 理由没人点 | 展示 / 工作流 | 去掉 99%,改成硬条件 + 证据是否充分,写回 ATS,先不动模型 |
| 驳回高,原句对不上 | RAG Precision 或幻觉 | 改检索,或门禁:没有原句只准「看不出」 |
| 驳回高,原句在 | Prompt 过宽 | 只改提示词,看 Precision 和幻觉率 |
| 库里有人没出 | 规则或 Recall@K | 先查硬条件,再改检索,不放宽「像」 |
| 补库后更脏 | Skill 有效简历率 | 分站点看补库,不调 Prompt |
| 做成 Agent 后更乱 | 选错工具 / 越权 | 先降回 Skill |
第一周只填过程三格:违约率、Recall@K、幻觉和引用。结果四列等招聘方真用再看。
不三选一。客观字段用规则;取证据用 RAG;判断用 Prompt。微调不负责更新简历。长上下文会截断,库天天更新,模型容易回忆出没有的经历。
改检索只看 Recall / Precision / nDCG。改提示词只看 F1、幻觉、引用。蒸馏只蒸已经能做对但太贵的封闭步,比如一页资料写成一行表,不蒸整个 Agent。
幻觉是过程指标:幻觉率、引用支持率,目标接近 0。结果上会变成驳回升、查看掉、采纳掉。没有片段只准「看不出」。出事故先停生成,只展示规则命中和原文。拒人、改数据必须人确认。
成本先问贵在哪一层。全库打分:先把违约率打到 0,只对 Top N 写理由。T1 开不开:同一标注集上 F1 和幻觉,F1 不升、幻觉升就关,不看理由写得更长。
会这么问:现有搜索好不好用,你用哪几列数据判断?第一期切哪?采用率一般,过程怎么拆、数据怎么提?
场上已有两条线:GUI 搜索和评估,WorkBuddy 上的招聘专家。按能看见的界面说,不编内部数据。已经做对的是先出画像再搜、按条评估、待办走工具。不另起聊天机器人替代 ATS。
还是结果四列 + 过程对层,不用 99% 当正确性。搜索看该出现的人在不在前 K、理由对不对上简历。评估看每一格准不准。查待办看条数和系统是否一致。
要切的 case:让现有搜索或评估的主观结论带原句、点得回去。采用率和流程重构,等招聘方开始核对证据再联动。名单核对留 GUI,查待办才用对话。
用人经理是需求主人,HR 是日常使用者。第一期是推荐短名单 Skill,不是开放 Agent。
过程(第一周,1 个职位、二三十份已有结论的简历):违约率到 0;Recall@K / Precision@K;幻觉接近 0;引用支持率可用。
结果(招聘方开始用之后):耗时、理由查看、驳回、采纳。约面率不进第一期看板。
不做:自动拒信、自动 offer、简介上打「皮实」、第一期 Agent。三个月:过程过关且人开始点原句、名单写回 ATS,否则停生成,退回规则加原文。
采用率是结果指标,先拆过程,再改一层。对照上面「不好用怎么提」那张表。HR 看出短名单耗时,用人经理看驳回和误放。冲突时第一期宁可慢,不准自动淘汰。
听确认过的画像,不听临时的速度。成本贵在全库生成,就先把规则层做窄,只对 Top N 写理由。
90 天交一个 case 的两张表:过程四格(违约、召回、幻觉、引用)有没有动;结果四列(耗时、查看、驳回、采纳)招聘方有没有开始用。假设不成立也要写清停在哪一层。不交大架构图。