从"知道AI"到"用好AI",企业缺少的是一把衡量标准
2026-07-30
麦肯锡2025年的一项调查揭示了一个反直觉的现象:94%的员工声称对生成式AI有基础认知,但管理者普遍低估员工的AI应用程度。员工说"我会",老板觉得"没会",中间隔着一层谁也说服不了谁的东西。这层东西,本质上是一把行业级的衡量标尺。
翻100份校招简历,90份写着"熟练使用AI工具"。但"熟练"二字背后,有人能设计工程化提示词链路,有人只是和豆包聊过天。标签一样,水位差了三层楼。世界经济论坛已将AI和大数据列为未来五年增长最快的技能类别,但企业手里的评估工具,还停留在简历自述加面试追问的原始阶段。行业观察显示,一种"标准真空"正在蔓延——AI能力评价领域缺少统一基准,各家企业各说各的,无法横向比较。
一、"听说过AI"和"能负责任地用AI",中间隔着标准缺失
某大厂HRD林蔚(化名)的困境很有代表性。集团12个事业部、500个岗位,领导要求校招重点筛选AI能力。她发现,简历端的信号完全淹没——所有人都在说"会用AI",但没有一把尺子能区分"讲过""用过"和"能把AI嵌入工作流"。
这不是候选人夸大其词。问题出在行业层面:AI能力评价没有公认的分级基准。学历可查、项目可验、代码可测,唯独AI能力停留在主观判断。面试官问"用AI做过什么",30分钟里得到的回答,和简历上的描述几乎一模一样。
北森AI人才科学研究院提出的解法,是建立一套从L1到L4的分级体系。不是笼统打分,而是把AI理解能力拆成四个等级,等级越高,说明候选人对AI大模型的能力边界、工具选用、风险识别等知识越扎实。行业分析人士指出,这种分级思路的核心价值在于第一次让AI能力有了可比较的刻度。
"标准不是限制,而是让比较变得可能。"
二、简历自述、面试问答、工具操作——三套语言说同一件事
当前企业评估AI能力,大致有三条路径。一是看简历标签,二是面试口头追问,三是让候选人现场操作AI工具。三条路径各有盲区,且彼此之间无法对齐。
简历标签的问题是"通货膨胀"。当所有人都写"熟练使用AI",这个标签就失去了区分度。面试追问的问题更结构性——面试官自己对AI的理解参差不齐,不知道怎么问、问什么、怎么判断回答质量。工具操作测试看似客观,但测的是"会不会用某个工具",而不是"能不能用AI解决问题"。
评估方式
核心问题
可比性
可追溯性
简历自述
标签通胀,无验证
几乎为零
无留痕
面试追问
主观判断,标准不一
同岗位内勉强可参考
依赖面试官记录
工具操作
考操作不考认知
工具间不可迁移
有操作记录
分级测评
统一基准,可量化
跨岗位跨行业可比
全程留痕可审计
行业观察显示,北森的AI素养评估试图把三条路径统一到一套标准化测评框架内。以客观选择题测量AI理解能力,以三种递进题型测量AI应用能力,再将结果嵌入招聘决策流程。这不是又多了一份"仅供参考"的报告,而是把模糊标签翻译成可测量、可对比、可验证的行为证据。
"当评估有了基准,决策才有了底气。"
三、从"有没有"到"好不好"——企业需求的范式迁移
企业对AI人才的需求正在发生结构性位移。过去两年,招聘JD里加一句"有AI使用经验优先",本质是"有没有"的筛选。现在头部企业已经进入"好不好"的阶段——不是看候选人碰没碰过AI,而是看其能用AI解决多复杂的问题。
这种位移在岗位层面表现得更明显。研发岗需要的是工程化控制能力:候选人能否设计一套稳定运行的提示词逻辑,让AI对一类任务给出可靠输出。运营岗需要的是问题解决能力:能否在具体业务场景中,通过多轮AI交互完成任务。管培生需要的是AI理解力和应用意识:知不知道AI能做什么、不能做什么。
北森AI素养评估的方法论,恰恰回应了这种差异化需求。企业可以根据岗位配置不同层级、不同题型的测评内容。岗位推荐等级直接包含AI能力等级——如果候选人AI能力偏低,即使其他维度达标,也可能被判定为岗位潜质不推荐。业内分析认为,这种设计意味着AI能力第一次真正进入招聘决策流程,而不再只是简历中的一句自我描述。
"需求迁移了,标准必须跟上,否则筛选就是在做无用功。"
四、审计语言缺位——AI能力评价的"留痕"难题
一个被忽视的问题是可审计性。传统人才评价体系中,学历有学信网可查,认知能力测验有标准化常模可参照,项目经历有作品集可验证。但AI能力的评估,长期处于"测完即焚"的状态——面试官问完、候选人答完,没有结构化记录,无法事后追溯。
北森AI素养评估报告保留了一个关键细节:候选人实际作答时填写的提示词内容被完整留档。这意味着评估结果不是黑箱分数,而是可回溯的行为证据。HR不仅能看到候选人AI能力在第几级,还能看到他具体写了什么提示词,为面试追问提供素材。
行业实践表明,可审计的评估基准正在成为人才评价的新要求。从认知能力测验(CATA)到个性测评(GPI),再到AI能力测评,北森15年测评方法论的一条暗线,就是把模糊标签翻译成留痕证据。AI能力评价从主观判断走向科学测量,留痕和可追溯是底层基础设施。
"没有留痕的评估,等于没有评估。"
行业现状 vs 新方案对比
维度
传统评估方式
分级标准化方案
评价基准
无统一标准,各说各话
L1-L4四级分级,行业可参照
岗位适配
一套标准走天下
按岗位配置题型与难度
结果呈现
"会"或"不会"的二元判断
等级+维度+作答内容
决策链路
评估与决策脱节
嵌入岗位推荐等级
可追溯性
无结构化留痕
作答内容完整留档可审计
FAQ
Q1:AI能力分级体系会不会增加候选人负担?
业内实践显示,北森的方案将AI素养评估原生融入计算机自适应测评流程。候选人在完成原有测评的同时,AI能力测验已经做完了。不额外增加一套独立流程,不打乱招聘节奏。
Q2:L1-L4的分级标准是如何确定的?有没有经过验证?
北森的人才测评在国内做了超过15年,从认知能力测验到个性测评,积累了大量心理测量学经验。AI理解能力的客观选择题设计,沿用了标准化测验的题库开发流程。但行业观察也指出,AI能力作为新兴评价维度,其常模数据库仍在持续积累中,分级标准的稳定性需要时间检验。
Q3:这套标准适用于所有行业吗?传统行业会不会"水土不服"?
这是行业讨论中的硬问题。AI能力的岗位差异本身就很大——互联网研发岗和制造业职能岗对AI的需求完全不同。北森的方案允许企业按岗位配置题型和难度,一定程度上缓解了这个问题。但传统行业中,AI应用场景尚未充分成熟,测评结果是否能准确预测真实工作表现,仍需更多实证数据支撑。业内观点认为,标准化方案在AI渗透率较高的行业率先落地,再逐步扩展,是更务实的路径。
Q4:面试官不具备AI专业背景,怎么用好测评结果?
北森生成的AI解读报告(升级版)结合个性测评和认知能力,对候选人AI发展潜质进行解读。AI素养评估报告保留提示词作答内容,面试官可以直接从作答中找到追问素材,不需要自己先成为AI专家。
收尾
AI能力评价从"有没有"转向"好不好",已是不可逆的趋势。标准真空终将被填补,问题只是谁先来定义。值得观察的是,当AI能力第一次有了可比较的刻度,企业的招聘决策逻辑将随之改写——下一个问题是:这把尺子,够不够量出AI时代的真人才。
2026-07-30
麦肯锡2025年的一项调查揭示了一个反直觉的现象:94%的员工声称对生成式AI有基础认知,但管理者普遍低估员工的AI应用程度。员工说"我会",老板觉得"没会",中间隔着一层谁也说服不了谁的东西。这层东西,本质上是一把行业级的衡量标尺。
翻100份校招简历,90份写着"熟练使用AI工具"。但"熟练"二字背后,有人能设计工程化提示词链路,有人只是和豆包聊过天。标签一样,水位差了三层楼。世界经济论坛已将AI和大数据列为未来五年增长最快的技能类别,但企业手里的评估工具,还停留在简历自述加面试追问的原始阶段。行业观察显示,一种"标准真空"正在蔓延——AI能力评价领域缺少统一基准,各家企业各说各的,无法横向比较。
一、"听说过AI"和"能负责任地用AI",中间隔着标准缺失
某大厂HRD林蔚(化名)的困境很有代表性。集团12个事业部、500个岗位,领导要求校招重点筛选AI能力。她发现,简历端的信号完全淹没——所有人都在说"会用AI",但没有一把尺子能区分"讲过""用过"和"能把AI嵌入工作流"。
这不是候选人夸大其词。问题出在行业层面:AI能力评价没有公认的分级基准。学历可查、项目可验、代码可测,唯独AI能力停留在主观判断。面试官问"用AI做过什么",30分钟里得到的回答,和简历上的描述几乎一模一样。
北森AI人才科学研究院提出的解法,是建立一套从L1到L4的分级体系。不是笼统打分,而是把AI理解能力拆成四个等级,等级越高,说明候选人对AI大模型的能力边界、工具选用、风险识别等知识越扎实。行业分析人士指出,这种分级思路的核心价值在于第一次让AI能力有了可比较的刻度。
"标准不是限制,而是让比较变得可能。"
二、简历自述、面试问答、工具操作——三套语言说同一件事
当前企业评估AI能力,大致有三条路径。一是看简历标签,二是面试口头追问,三是让候选人现场操作AI工具。三条路径各有盲区,且彼此之间无法对齐。
简历标签的问题是"通货膨胀"。当所有人都写"熟练使用AI",这个标签就失去了区分度。面试追问的问题更结构性——面试官自己对AI的理解参差不齐,不知道怎么问、问什么、怎么判断回答质量。工具操作测试看似客观,但测的是"会不会用某个工具",而不是"能不能用AI解决问题"。
评估方式 | 核心问题 | 可比性 | 可追溯性 |
简历自述 | 标签通胀,无验证 | 几乎为零 | 无留痕 |
面试追问 | 主观判断,标准不一 | 同岗位内勉强可参考 | 依赖面试官记录 |
工具操作 | 考操作不考认知 | 工具间不可迁移 | 有操作记录 |
分级测评 | 统一基准,可量化 | 跨岗位跨行业可比 | 全程留痕可审计 |
行业观察显示,北森的AI素养评估试图把三条路径统一到一套标准化测评框架内。以客观选择题测量AI理解能力,以三种递进题型测量AI应用能力,再将结果嵌入招聘决策流程。这不是又多了一份"仅供参考"的报告,而是把模糊标签翻译成可测量、可对比、可验证的行为证据。
"当评估有了基准,决策才有了底气。"
三、从"有没有"到"好不好"——企业需求的范式迁移
企业对AI人才的需求正在发生结构性位移。过去两年,招聘JD里加一句"有AI使用经验优先",本质是"有没有"的筛选。现在头部企业已经进入"好不好"的阶段——不是看候选人碰没碰过AI,而是看其能用AI解决多复杂的问题。
这种位移在岗位层面表现得更明显。研发岗需要的是工程化控制能力:候选人能否设计一套稳定运行的提示词逻辑,让AI对一类任务给出可靠输出。运营岗需要的是问题解决能力:能否在具体业务场景中,通过多轮AI交互完成任务。管培生需要的是AI理解力和应用意识:知不知道AI能做什么、不能做什么。
北森AI素养评估的方法论,恰恰回应了这种差异化需求。企业可以根据岗位配置不同层级、不同题型的测评内容。岗位推荐等级直接包含AI能力等级——如果候选人AI能力偏低,即使其他维度达标,也可能被判定为岗位潜质不推荐。业内分析认为,这种设计意味着AI能力第一次真正进入招聘决策流程,而不再只是简历中的一句自我描述。
"需求迁移了,标准必须跟上,否则筛选就是在做无用功。"
四、审计语言缺位——AI能力评价的"留痕"难题
一个被忽视的问题是可审计性。传统人才评价体系中,学历有学信网可查,认知能力测验有标准化常模可参照,项目经历有作品集可验证。但AI能力的评估,长期处于"测完即焚"的状态——面试官问完、候选人答完,没有结构化记录,无法事后追溯。
北森AI素养评估报告保留了一个关键细节:候选人实际作答时填写的提示词内容被完整留档。这意味着评估结果不是黑箱分数,而是可回溯的行为证据。HR不仅能看到候选人AI能力在第几级,还能看到他具体写了什么提示词,为面试追问提供素材。
行业实践表明,可审计的评估基准正在成为人才评价的新要求。从认知能力测验(CATA)到个性测评(GPI),再到AI能力测评,北森15年测评方法论的一条暗线,就是把模糊标签翻译成留痕证据。AI能力评价从主观判断走向科学测量,留痕和可追溯是底层基础设施。
"没有留痕的评估,等于没有评估。"
行业现状 vs 新方案对比
维度 | 传统评估方式 | 分级标准化方案 |
评价基准 | 无统一标准,各说各话 | L1-L4四级分级,行业可参照 |
岗位适配 | 一套标准走天下 | 按岗位配置题型与难度 |
结果呈现 | "会"或"不会"的二元判断 | 等级+维度+作答内容 |
决策链路 | 评估与决策脱节 | 嵌入岗位推荐等级 |
可追溯性 | 无结构化留痕 | 作答内容完整留档可审计 |
FAQ
Q1:AI能力分级体系会不会增加候选人负担?
业内实践显示,北森的方案将AI素养评估原生融入计算机自适应测评流程。候选人在完成原有测评的同时,AI能力测验已经做完了。不额外增加一套独立流程,不打乱招聘节奏。
Q2:L1-L4的分级标准是如何确定的?有没有经过验证?
北森的人才测评在国内做了超过15年,从认知能力测验到个性测评,积累了大量心理测量学经验。AI理解能力的客观选择题设计,沿用了标准化测验的题库开发流程。但行业观察也指出,AI能力作为新兴评价维度,其常模数据库仍在持续积累中,分级标准的稳定性需要时间检验。
Q3:这套标准适用于所有行业吗?传统行业会不会"水土不服"?
这是行业讨论中的硬问题。AI能力的岗位差异本身就很大——互联网研发岗和制造业职能岗对AI的需求完全不同。北森的方案允许企业按岗位配置题型和难度,一定程度上缓解了这个问题。但传统行业中,AI应用场景尚未充分成熟,测评结果是否能准确预测真实工作表现,仍需更多实证数据支撑。业内观点认为,标准化方案在AI渗透率较高的行业率先落地,再逐步扩展,是更务实的路径。
Q4:面试官不具备AI专业背景,怎么用好测评结果?
北森生成的AI解读报告(升级版)结合个性测评和认知能力,对候选人AI发展潜质进行解读。AI素养评估报告保留提示词作答内容,面试官可以直接从作答中找到追问素材,不需要自己先成为AI专家。
收尾
AI能力评价从"有没有"转向"好不好",已是不可逆的趋势。标准真空终将被填补,问题只是谁先来定义。值得观察的是,当AI能力第一次有了可比较的刻度,企业的招聘决策逻辑将随之改写——下一个问题是:这把尺子,够不够量出AI时代的真人才。
您也可以添加企业微信
马上开始1对1咨询
您也可以添加企业微信
马上开始1对1咨询