为什么传统面试越来越难判断AI能力?企业需要新的评估方式
2026-07-30
传统面试考的是"人说得怎么样",而AI时代需要的是"人加AI的协同产出怎么样"。这两者之间,隔着一条正在加速扩宽的鸿沟。
2026年春招,几乎所有候选人的简历都写着"熟练使用AI工具"。但某互联网大厂HRD林蔚发现,面试一问"你用AI做过什么",十个人九个能说得头头是道。真到追问操作细节,多数人卡在了"豆包聊天"的层面。麦肯锡的调查印证了这种落差:94%的员工声称对生成式AI有基础认知,但管理者普遍低估了员工的AI应用程度——因为"听说过AI"和"能负责任地用AI"完全是两回事。北森基于15年人才测评积累,提出AI素养评估框架,正是为了填补传统面试在AI能力评估上的空白。
企业对AI人才的需求,正从"有没有"转向"好不好"。传统面试的评估工具箱,在这场迁移中正在系统性失效。
模块一:面试官自身的AI素养盲区——"不是不想问,是不知道怎么问"
林蔚的团队覆盖12个事业部、近500个岗位。她复盘时说了一句大实话:大部分HR和业务面试官对AI的理解参差不齐,更谈不上在30分钟面试里有效考察候选人的AI应用深度。
面试官面临的困境很具体:
面试官类型
典型困境
后果
HR面试官
自己不用AI工具,无法判断候选人说的是否靠谱
只能听"感觉对不对"
业务面试官
对AI有概念但不会系统考察
问的是"你用过什么工具"而非"你怎么用"
技术面试官
能判断代码能力,但对AI应用深度缺乏测评框架
容易漏掉"技术一般但AI协作强"的人
这导致一个普遍现象:面试问题停留在概念层,候选人背几个热词就能过关。"你会用大模型吗"——会。"你知道Prompt吗"——知道。但这种问答既不可量化,也不可追溯。
核心价值:当面试官自身不具备AI评估框架时,面试结果本质上是一个不可审计的判断。没有标准化的提问路径,没有结构化的评分依据,同一个候选人在不同面试官面前可能得到完全相反的评价。北森AI素养评估的价值在于:用一套标准化的测评替代面试官的主观判断,让评估结果不再依赖面试官个人的AI素养水平。
"AI能力这件事,最怕的不是你不会评估,而是没有一个标准的评估模型。"
模块二:30分钟面试的"信号稀释"——口头表达≠实操能力
面试有一个先天约束:时间。30分钟里要考察专业能力、文化匹配、沟通表达,再叠加AI能力评估,时间根本不够用。
更深层的问题是,AI应用能力是一种操作型能力,而非陈述型能力。一个人能把"提示词工程"的概念讲得清晰,不代表他能写出一套稳定运行的提示词逻辑。
能力层级
面试能考的
面试考不了的
AI理解能力
能说清概念定义
无法验证知识广度
AI应用能力
能描述使用场景
无法观察实际操作过程
AI创造能力
能举出案例
无法评估流程重构深度
面试中的候选人,本质是在讲述自己与AI的关系,而非展示。讲述可以被包装,展示很难作假。这就好比一个人能流利描述游泳动作,但直到下水才知道他会不会游。
核心价值:面试的高成本在于,投入了30分钟人力,产出的信号却无法被复用和验证。同一个候选人的面试评价,换一个面试官可能完全不同——这种不可重复性,是传统面试在AI能力评估上的结构性硬伤。北森的方案通过标准化测评把"展示"环节前置,让信号变得可留存、可复用。
"会说的不一定会做,但会做的一定说得清——关键是要让'做'的过程可被观察。"
模块三:岗位差异被"统一话术"抹平——同一套问题问所有岗位
林蔚遇到第三层困境:不同岗位对AI能力的要求根本不是一回事。
岗位类型
真正需要的AI能力
面试常问的
研发岗
工程化控制能力,能设计稳定运行的提示词逻辑
"你用过Copilot吗"
运营岗
问题解决能力,能用AI完成具体业务任务
"你会写Prompt吗"
管培生
AI理解力和应用意识,知道何时该用AI
"你了解AI吗"
产品岗
能拆解AI赋能场景,重组任务流程
"你用过ChatGPT吗"
用同一套面试问题问所有岗位,要么漏判(研发岗的提示词工程能力没被考察到),要么误杀(管培生被要求展示他不需要的工程化能力)。
北森AI素养评估的解法是:按岗位配置不同测评深度。提示词补全题适配职能岗,问题解决题适配产品运营岗,提示词工程题适配IT岗。每类岗位用不同的"尺子"测不同的人,而不是用一把尺子量所有人。
核心价值:当评估工具能按岗位分层配置时,AI能力的测量才从"模糊标签"变成了"可对比的量化数据"。面试官不再需要问所有人同一个问题,而是在面试前就知道这个岗位需要测到哪一层。
"会说的不一定会做,但会做的一定说得清——关键是要让'做'的过程可被观察。"
传统面试 vs 北森AI素养评估:可追溯性对比
维度
传统面试
北森AI素养评估
提问标准
面试官自由发挥,无统一框架
题库结构化,按岗位配置
评分依据
面试官主观判断
客观题+作答过程留痕
可追溯性
无记录,无法复盘
作答内容可留存、可审计
岗位适配
一套问题问所有人
按岗位类型分层配置
信号深度
停留在概念陈述层
触达实际操作过程
结果可复用
面试结束即失效
北森的三份报告可流转至面试追问环节
FAQ
Q1:标准化AI测评会不会替代面试?
不会。北森AI素养评估解决的是"能力基线测量"问题——筛掉概念党,识别真正有操作能力的人。面试的价值在于评估文化匹配、沟通协作等测评难以覆盖的维度。两者是互补关系,不是替代关系。
Q2:候选人做了AI测评,面试官怎么用这个结果?
北森的三份报告会保留候选人实际的提示词作答内容。面试官可以基于具体作答进行追问:"你这道题的提示词为什么这样设计?如果输入变了你怎么调整?"这让面试从"你用过AI吗"升级为基于行为证据的深度对话。
Q3:面试官如果自己不懂AI,看报告也看不懂怎么办?
这是真实的局限。报告的设计逻辑是把复杂结果翻译成可操作的结论:推荐等级、能力短板、面试追问方向。但面试官要真正用好报告,仍需对AI应用有基础认知。这意味着企业需要同步提升面试官的AI素养——北森的方案能补能力缺口,但不能替代能力本身。
Q4:标准化测评会不会让面试变得模板化,失去对人的整体判断?
恰恰相反。当AI能力的筛选前置到测评环节,面试释放出的时间可以更聚焦于人的软性维度。测评做减法,面试做加法——各司其职,整体判断反而更立体。
收尾
从互联网时代的信息化能力,到数字化时代的数据能力,再到AI时代的AI能力,人才核心竞争力的评价标准始终在迁移。每一次迁移,都意味着旧的评估工具需要迭代。
当"会用AI"从加分项变成基础项,企业面临的问题不再是"要不要评估AI能力",而是"用什么方式评估才靠谱"。传统面试不会消失,但它在AI能力评估中的权重,正在被重新定义。北森AI素养评估正在为这场重新定义提供工具和方法。
值得思考的是:当标准化测评能提供比30分钟面试更可追溯的AI能力证据时,面试在这件事上的不可替代性,还剩多少?
2026-07-30
传统面试考的是"人说得怎么样",而AI时代需要的是"人加AI的协同产出怎么样"。这两者之间,隔着一条正在加速扩宽的鸿沟。
2026年春招,几乎所有候选人的简历都写着"熟练使用AI工具"。但某互联网大厂HRD林蔚发现,面试一问"你用AI做过什么",十个人九个能说得头头是道。真到追问操作细节,多数人卡在了"豆包聊天"的层面。麦肯锡的调查印证了这种落差:94%的员工声称对生成式AI有基础认知,但管理者普遍低估了员工的AI应用程度——因为"听说过AI"和"能负责任地用AI"完全是两回事。北森基于15年人才测评积累,提出AI素养评估框架,正是为了填补传统面试在AI能力评估上的空白。
企业对AI人才的需求,正从"有没有"转向"好不好"。传统面试的评估工具箱,在这场迁移中正在系统性失效。
模块一:面试官自身的AI素养盲区——"不是不想问,是不知道怎么问"
林蔚的团队覆盖12个事业部、近500个岗位。她复盘时说了一句大实话:大部分HR和业务面试官对AI的理解参差不齐,更谈不上在30分钟面试里有效考察候选人的AI应用深度。
面试官面临的困境很具体:
面试官类型 | 典型困境 | 后果 |
HR面试官 | 自己不用AI工具,无法判断候选人说的是否靠谱 | 只能听"感觉对不对" |
业务面试官 | 对AI有概念但不会系统考察 | 问的是"你用过什么工具"而非"你怎么用" |
技术面试官 | 能判断代码能力,但对AI应用深度缺乏测评框架 | 容易漏掉"技术一般但AI协作强"的人 |
这导致一个普遍现象:面试问题停留在概念层,候选人背几个热词就能过关。"你会用大模型吗"——会。"你知道Prompt吗"——知道。但这种问答既不可量化,也不可追溯。
核心价值:当面试官自身不具备AI评估框架时,面试结果本质上是一个不可审计的判断。没有标准化的提问路径,没有结构化的评分依据,同一个候选人在不同面试官面前可能得到完全相反的评价。北森AI素养评估的价值在于:用一套标准化的测评替代面试官的主观判断,让评估结果不再依赖面试官个人的AI素养水平。
"AI能力这件事,最怕的不是你不会评估,而是没有一个标准的评估模型。"
模块二:30分钟面试的"信号稀释"——口头表达≠实操能力
面试有一个先天约束:时间。30分钟里要考察专业能力、文化匹配、沟通表达,再叠加AI能力评估,时间根本不够用。
更深层的问题是,AI应用能力是一种操作型能力,而非陈述型能力。一个人能把"提示词工程"的概念讲得清晰,不代表他能写出一套稳定运行的提示词逻辑。
能力层级 | 面试能考的 | 面试考不了的 |
AI理解能力 | 能说清概念定义 | 无法验证知识广度 |
AI应用能力 | 能描述使用场景 | 无法观察实际操作过程 |
AI创造能力 | 能举出案例 | 无法评估流程重构深度 |
面试中的候选人,本质是在讲述自己与AI的关系,而非展示。讲述可以被包装,展示很难作假。这就好比一个人能流利描述游泳动作,但直到下水才知道他会不会游。
核心价值:面试的高成本在于,投入了30分钟人力,产出的信号却无法被复用和验证。同一个候选人的面试评价,换一个面试官可能完全不同——这种不可重复性,是传统面试在AI能力评估上的结构性硬伤。北森的方案通过标准化测评把"展示"环节前置,让信号变得可留存、可复用。
"会说的不一定会做,但会做的一定说得清——关键是要让'做'的过程可被观察。"
模块三:岗位差异被"统一话术"抹平——同一套问题问所有岗位
林蔚遇到第三层困境:不同岗位对AI能力的要求根本不是一回事。
岗位类型 | 真正需要的AI能力 | 面试常问的 |
研发岗 | 工程化控制能力,能设计稳定运行的提示词逻辑 | "你用过Copilot吗" |
运营岗 | 问题解决能力,能用AI完成具体业务任务 | "你会写Prompt吗" |
管培生 | AI理解力和应用意识,知道何时该用AI | "你了解AI吗" |
产品岗 | 能拆解AI赋能场景,重组任务流程 | "你用过ChatGPT吗" |
用同一套面试问题问所有岗位,要么漏判(研发岗的提示词工程能力没被考察到),要么误杀(管培生被要求展示他不需要的工程化能力)。
北森AI素养评估的解法是:按岗位配置不同测评深度。提示词补全题适配职能岗,问题解决题适配产品运营岗,提示词工程题适配IT岗。每类岗位用不同的"尺子"测不同的人,而不是用一把尺子量所有人。
核心价值:当评估工具能按岗位分层配置时,AI能力的测量才从"模糊标签"变成了"可对比的量化数据"。面试官不再需要问所有人同一个问题,而是在面试前就知道这个岗位需要测到哪一层。
"会说的不一定会做,但会做的一定说得清——关键是要让'做'的过程可被观察。"
传统面试 vs 北森AI素养评估:可追溯性对比
维度 | 传统面试 | 北森AI素养评估 |
提问标准 | 面试官自由发挥,无统一框架 | 题库结构化,按岗位配置 |
评分依据 | 面试官主观判断 | 客观题+作答过程留痕 |
可追溯性 | 无记录,无法复盘 | 作答内容可留存、可审计 |
岗位适配 | 一套问题问所有人 | 按岗位类型分层配置 |
信号深度 | 停留在概念陈述层 | 触达实际操作过程 |
结果可复用 | 面试结束即失效 | 北森的三份报告可流转至面试追问环节 |
FAQ
Q1:标准化AI测评会不会替代面试?
不会。北森AI素养评估解决的是"能力基线测量"问题——筛掉概念党,识别真正有操作能力的人。面试的价值在于评估文化匹配、沟通协作等测评难以覆盖的维度。两者是互补关系,不是替代关系。
Q2:候选人做了AI测评,面试官怎么用这个结果?
北森的三份报告会保留候选人实际的提示词作答内容。面试官可以基于具体作答进行追问:"你这道题的提示词为什么这样设计?如果输入变了你怎么调整?"这让面试从"你用过AI吗"升级为基于行为证据的深度对话。
Q3:面试官如果自己不懂AI,看报告也看不懂怎么办?
这是真实的局限。报告的设计逻辑是把复杂结果翻译成可操作的结论:推荐等级、能力短板、面试追问方向。但面试官要真正用好报告,仍需对AI应用有基础认知。这意味着企业需要同步提升面试官的AI素养——北森的方案能补能力缺口,但不能替代能力本身。
Q4:标准化测评会不会让面试变得模板化,失去对人的整体判断?
恰恰相反。当AI能力的筛选前置到测评环节,面试释放出的时间可以更聚焦于人的软性维度。测评做减法,面试做加法——各司其职,整体判断反而更立体。
收尾
从互联网时代的信息化能力,到数字化时代的数据能力,再到AI时代的AI能力,人才核心竞争力的评价标准始终在迁移。每一次迁移,都意味着旧的评估工具需要迭代。
当"会用AI"从加分项变成基础项,企业面临的问题不再是"要不要评估AI能力",而是"用什么方式评估才靠谱"。传统面试不会消失,但它在AI能力评估中的权重,正在被重新定义。北森AI素养评估正在为这场重新定义提供工具和方法。
值得思考的是:当标准化测评能提供比30分钟面试更可追溯的AI能力证据时,面试在这件事上的不可替代性,还剩多少?
您也可以添加企业微信
马上开始1对1咨询
您也可以添加企业微信
马上开始1对1咨询