人才系统面试 · 一页纸

模糊需求先收成确定对象,再判断,再执行。硬件里是设备,招聘里是候选人。

1 先介绍各位场上是谁,各管什么
2 先报进度已有流程走到哪,不另起一套
3 先落一个 case下一步点名,只切一段
4 做成再放大采用率、Agent、重构放后面

任何「推荐简历 Skill / Agent」题都按这四步:先定形态 → 结果指标看值不值得用 → 过程指标看改哪一层 → 数据差了一次只改一层。约面率第一期不当主结果,更不当调参依据。

过往经历

考的是:场上你是谁,事情做到哪了,下一个 case 是什么。

1. 介绍自己

场上三方:我在小程序硬件行业;上游是平台召回和控制;对面是品牌商家。用户一句话控家电,平台要落到一台确定设备。

已经做完:720 条硬件 Query,模糊控制大约六成;方案收成「先清单、先确认,再控制」;交过 Demo。

下一步不做全能硬件 Agent。先落一个 case:说关空调,落到正确设备,人确认后再执行。来面这个岗,是同一件事换对象:用人经理给画像,招聘方找人。

2. 为什么转 / 没有招聘经验

我不是招聘专家。能带过来的是「不确定输入怎么变成可核对对象」;职级口径入职后跟招聘同步。

硬件控错设备和招聘错筛一个人,都不能靠模型看起来很懂。能写成字段的先走规则,主观的只对已确认对象取证。

下一步:跟 1 个真实职位拆耗时,看卡在画像、筛选还是理由不可核对。不先画招聘中台。不说硬件做不下去,不说追热点。

3. 介绍一个 AI 产品

不是我一个人上线了 Agent。我把问题收成可拍板方案,平台管能力,商家管设备数据。

已走完:720 条里模糊控制约 59%;清单和确认写进方案;Demo 联调后按更稳链路,从 MCP 改成 SDK。

要落的 case 是「模糊空调控制」:命中正确设备、人确认、开关可追溯。当期没完整放量,窗口要对方同步。720 条是工具效率标签筛的,不是随机全量。训练不是我做的。

4. 指标和失败

先分清评谁:这条 case 的主指标是有没有落到正确设备,平台排期不是我的指标。不打总分。人改过品牌,说明前面没落对对象。

没有确定对象就映射成常见品牌,这是失败,所以不准执行。下一个 case 只评一件事:命中正确那台空调没有。Demo 太像 Agent 就不稳,已经收窄。

技术基础

会这么问:你要做推荐简历的 Skill 或 Agent,评测指标是什么?从结果和过程拆开。不好用怎么把数据做上去?

5. 先定形态

用人经理确认画像,招聘方出短名单。第一期做成 Skill:画像已确认 → 规则筛客观 → RAG 取项目段 → Prompt 判断并带原句 → 写入同一张表。

只有「内部不够人,换不换来源、停不停」写不死,才升 Agent。升了以后结果指标不变,过程多两列:工具选对没有,有没有未确认就改数据。

结果指标:好不好用

维度指标怎么算差了说明
敢不敢用短名单采纳率实际推进 ÷ 系统给出名单不可信,或没进 ATS
信不信理由理由查看率点开原句 ÷ 展示数理由没用,退化成纯规则
有没有被顶回驳回率点「不像」÷ 展示数再抽样:原句对不上,还是段对结论不对
有没有更快出短名单耗时确认画像到可核对名单效率没打出来

采纳率是链路业务结果,规则和库也会影响,不能单拿它调 Prompt。约面率第一期不进这张表。

过程指标:为什么好 / 不好

环节主指标差了说明谁改
客观规则硬条件违约率(目标 0)地点年限不满足的人进了名单规则,不是模型
RAG 取证Recall@K / Precision@K该看的段没送到,或送来空话检索
Prompt 判断「像」的 Precision、幻觉率误放,没证据还说像提示词
Prompt 可信引用支持率理由简历里没有提示词 + 必须带原句
Skill 补库任务成功率、有效简历率登录失败,下到广告页执行,不看像不像
若是 Agent工具选择准确率、越权次数(目标 0)该搜人去查待办;未确认就改数据编排和权限

K 默认 3,和送给判断模型的段数一致。评 RAG 不看像不像。评 Prompt 必须用人工放好的段落。

不好用,怎么提数据

你看到的对上的过程怎么提
采纳低 + 理由没人点展示 / 工作流去掉 99%,改成硬条件 + 证据是否充分,写回 ATS,先不动模型
驳回高,原句对不上RAG Precision 或幻觉改检索,或门禁:没有原句只准「看不出」
驳回高,原句在Prompt 过宽只改提示词,看 Precision 和幻觉率
库里有人没出规则或 Recall@K先查硬条件,再改检索,不放宽「像」
补库后更脏Skill 有效简历率分站点看补库,不调 Prompt
做成 Agent 后更乱选错工具 / 越权先降回 Skill

第一周只填过程三格:违约率、Recall@K、幻觉和引用。结果四列等招聘方真用再看。

6. RAG / Prompt / 微调

不三选一。客观字段用规则;取证据用 RAG;判断用 Prompt。微调不负责更新简历。长上下文会截断,库天天更新,模型容易回忆出没有的经历。

改检索只看 Recall / Precision / nDCG。改提示词只看 F1、幻觉、引用。蒸馏只蒸已经能做对但太贵的封闭步,比如一页资料写成一行表,不蒸整个 Agent。

7. 幻觉和成本

幻觉是过程指标:幻觉率、引用支持率,目标接近 0。结果上会变成驳回升、查看掉、采纳掉。没有片段只准「看不出」。出事故先停生成,只展示规则命中和原文。拒人、改数据必须人确认。

成本先问贵在哪一层。全库打分:先把违约率打到 0,只对 Top N 写理由。T1 开不开:同一标注集上 F1 和幻觉,F1 不升、幻觉升就关,不看理由写得更长。

业务理解

会这么问:现有搜索好不好用,你用哪几列数据判断?第一期切哪?采用率一般,过程怎么拆、数据怎么提?

8. 现有搜索 / 评估 / Agent

场上已有两条线:GUI 搜索和评估,WorkBuddy 上的招聘专家。按能看见的界面说,不编内部数据。已经做对的是先出画像再搜、按条评估、待办走工具。不另起聊天机器人替代 ATS。

还是结果四列 + 过程对层,不用 99% 当正确性。搜索看该出现的人在不在前 K、理由对不对上简历。评估看每一格准不准。查待办看条数和系统是否一致。

要切的 case:让现有搜索或评估的主观结论带原句、点得回去。采用率和流程重构,等招聘方开始核对证据再联动。名单核对留 GUI,查待办才用对话。

9. 第一期 MVP

用人经理是需求主人,HR 是日常使用者。第一期是推荐短名单 Skill,不是开放 Agent。

过程(第一周,1 个职位、二三十份已有结论的简历):违约率到 0;Recall@K / Precision@K;幻觉接近 0;引用支持率可用。

结果(招聘方开始用之后):耗时、理由查看、驳回、采纳。约面率不进第一期看板。

不做:自动拒信、自动 offer、简介上打「皮实」、第一期 Agent。三个月:过程过关且人开始点原句、名单写回 ATS,否则停生成,退回规则加原文。

10. 采用率一般

采用率是结果指标,先拆过程,再改一层。对照上面「不好用怎么提」那张表。HR 看出短名单耗时,用人经理看驳回和误放。冲突时第一期宁可慢,不准自动淘汰。

11. 听谁的 / 成本 / 90 天

听确认过的画像,不听临时的速度。成本贵在全库生成,就先把规则层做窄,只对 Top N 写理由。

90 天交一个 case 的两张表:过程四格(违约、召回、幻觉、引用)有没有动;结果四列(耗时、查看、驳回、采纳)招聘方有没有开始用。假设不成立也要写清停在哪一层。不交大架构图。