北森AI素养模型拆解:为什么"会用AI"还不等于具备AI能力?
2026-07-23
一个候选人能把ChatGPT用得很顺,不代表他具备AI能力。这听起来矛盾,但在实际评估中是常态——工具操作熟练度掩盖了能力结构的断层。会用AI工具,可能只是记住了几个提示词模板;具备AI能力,意味着理解AI的能力边界、能在真实场景中应用、能识别AI出错并纠正。两者之间的差距,需要一套分层模型来拆解。北森的AI素养模型,正是为此设计的分层评估体系。
背景造势:模型拆解的必要性
北森的人才测评在国内做了超过20年。从认知能力测验(CATA)到个性测评(GPI),再到AI能力测评,方法论始终一致:把模糊的能力标签,翻译成可测量、可对比、可验证的行为证据。
北森AI素养评估框架的结构是:AI素养 = AI能力 + AI发展潜质。AI能力分为理解、应用、创造三个递进层级。AI发展潜质包含思维与行为取向与基础认知能力。
这个模型不是三个模块的简单并列,而是一座金字塔结构——底层是理解,中层是应用,顶层是创造。跳过任何一层,金字塔就会失稳。北森提出这套模型的核心目的,就是解释一个反复出现的现象:为什么"会用AI"不等于具备AI能力?
AI理解能力——金字塔的地基
AI理解能力是整个金字塔的底层。它考察的不是"能不能用AI",而是"懂不懂AI"。
北森AI素养评估将AI理解能力的考察范围覆盖六个维度:工具应用能力、风险控制能力、结果甄别能力、目标拆解能力、价值加工能力、创新适应能力。形式为L1-L4四层客观选择题。
举个典型题目:"大模型的'幻觉'现象指什么?"选项包括生成虚假内容、运算速度变慢、硬件过热、数据加密。选A说明知道AI会编造信息,选其他选项说明对AI的能力边界没有基本认知。
为什么这层是地基?因为应用层和创造层都依赖理解层的知识底盘。一个不理解"幻觉"的候选人,用AI做数据分析时不会交叉验证;一个不理解能力边界的候选人,会把AI不能做的事交给AI做,然后对失败结果感到困惑。
某企业招聘团队反馈:"以前我们直接考候选人写提示词,后来发现有些人提示词写得不错,但根本不知道AI会'幻觉'。他们写出的提示词能跑通,但产出全是错的——因为他们不验证。"
核心价值:解决"跳过理解直接考应用"的痛点。层级跳层——指跳过某一能力层级直接评估更高层级导致的评估失真现象——在AI能力评估中尤为常见。不理解就应用,等于在没有地基的地上盖楼。"会用AI工具但不懂AI原理,就像会开车但不懂交通规则——出事是早晚的事。"
AI应用能力——金字塔的核心层
AI应用能力是金字塔的中层,也是最能体现业务价值的环节。北森AI素养考察的不是知识记忆,而是在真实场景中用AI解决问题的能力。
应用层设计了三种测评题型,难度逐级递增,适配不同岗位类型。
提示词补全题:给定任务目标,补全提示词。考察的是基本的提示词撰写功底。适配对AI应用能力要求不是特别高的职能类岗位——行政需要用AI生成会议纪要模板,财务需要用AI整理报表格式,这类岗位不需要工程化控制能力,但需要能写出有效的提示词。
问题解决题:在具体业务场景下,候选人通过多轮与AI交互完成任务。考察的是形成解决方案的能力。适配非IT岗的产研、管理与职能岗——产品经理需要用AI做竞品分析摘要,运营需要用AI做用户评论情感分析,管培生需要用AI完成市场调研初稿。这类岗位的AI能力核心是"能完成任务",不是"能写完美提示词"。
提示词工程题:设计一套能稳定运行的提示词逻辑,对一类输入给出可靠可控的输出。适配IT岗——研发工程师需要让AI代码审查覆盖一类问题,算法工程师需要让AI做数据清洗的标准化处理。这不是"写prompt",是工程化地控制AI的产出质量。
题型
考察核心
适配岗位
交付物
提示词补全题
提示词撰写功底
职能岗(行政/财务)
补全后的提示词
问题解决题
多轮交互解决问题
产品/运营/管培
业务场景下的AI协作产出
提示词工程题
工程化控制能力
研发/算法
可稳定运行的提示词逻辑
核心价值:解决"一种题型考所有岗位"的痛点。三种题型对应三种能力深度,企业按岗位需求配置。用提示词工程题考管培生是门槛过高,用补全题考研发岗是门槛过低。"用对尺子,量出来的数才有参考价值。"
AI创造能力——金字塔的顶层
AI创造能力是金字塔的顶层。它不只是让AI完成一个任务,而是基于实际场景发现AI赋能机会,重组流程与业务协作方式,把AI产出嵌入更完整的业务成果。
这一层与应用层的区别在于"主动性"和"系统性"。应用层是给定任务,用AI完成。创造层是自己发现任务,设计AI协作流程,把AI产出变成业务交付物的一部分。
举例来说:运营岗的应用能力是"能用AI做用户评论情感分析"。运营岗的创造能力是"发现整个用户反馈链路可以AI化——从评论采集到情感分析到预警分发到改进建议,设计一整套AI协作流程,并把最终产出嵌入周报系统"。
创造能力的评估目前主要依赖面试中的场景化追问,标准化测评工具仍在发展中。对创造能力的标准化仍在迭代中——这是一个需要诚实承认的边界。
核心价值:解决"只测执行不测创造"的痛点。评估锚定——指通过底层能力评估来锚定上层能力可靠性的方法——意味着理解层和应用层的测评结果可以间接推断创造能力的潜力。"能应用的未必能创造,但能创造的几乎一定能应用——方向是单向的。"
AI发展潜质——金字塔的隐形地基
AI能力金字塔的可见部分是理解、应用、创造三层。不可见但同样重要的,是埋在底下的AI发展潜质。
能力是显性的,潜质是隐性的。北森人才测评体系中,AI发展潜质决定了一个人学习AI、应用AI的速度和上限。它包含两个维度。
思维与行为取向:候选人是否主动尝试新技术、面对不确定性时的反应模式、对AI工具的探索意愿。这些取向不是能力,但影响能力的发挥速度。一个"主动尝试"倾向高的候选人,会比倾向低的候选人更早接触新AI工具、更快积累使用经验。
基础认知能力:言语能力、数学能力、逻辑推理能力——三大加速因子。它们不直接测AI能力,但测的是AI能力的成长引擎。言语能力强的候选人学提示词工程更快,数学能力强的候选人验证AI数据分析更准,逻辑推理强的候选人识别AI输出错误更快。
某招聘团队在复盘时发现:"两个候选人AI理解能力都是L3,但一个逻辑推理分数明显更高。三个月后,逻辑推理强的那个已经能独立做提示词工程了,另一个还在补提示词基础。"
核心价值:解决"能力评估只看当前不看未来"的痛点。金字塔的稳定性不只取决于可见层的高度,还取决于隐形地基的深度。"能力告诉你金字塔现在有多高,潜质告诉你金字塔未来能盖多高。"
对比:跳层评估 vs 北森AI素养评估完整金字塔评估
评估方式
跳过理解直接考应用
跳过应用直接考创造
北森AI素养评估完整三层+潜质
评估精度
低(不理解就应用,产出不可靠)
极低(不会应用就创造,几乎无法评估)
高(逐层验证,结果可追溯)
误判风险
高估工具熟练型候选人
同时高估和低估
显著降低
岗位适配
无法区分岗位差异
无法区分岗位差异
按岗位配置题型
成长预判
无法预判
无法预判
加速因子提供成长天花板参考
可审计性
低(缺乏底层依据)
极低
高(每层有独立测评结果)
FAQ
Q1:为什么不能直接考应用能力,跳过理解能力?
因为理解能力的缺失会导致应用能力的评估结果不可靠。一个不理解"幻觉"的候选人,可能写出格式漂亮但结果错误的提示词。测评系统如果只看提示词结构,会给他高分——但这个高分是虚假的。理解层是应用层的可靠性锚点,跳过它等于在没有校准的情况下做测量。
Q2:三种应用题型能不能同时考,给候选人一个综合分?
技术上可以,但建议不要。三种题型考察的能力深度不同,混在一起算综合分会模糊区分度。一个提示词补全题得分高的候选人,和一个问题解决题得分高的候选人,综合分可能一样,但能力结构完全不同。建议企业按岗位需求选择一种主考题型,而不是全部都考。"综合分是均值,均值掩盖结构差异。"
Q3:AI创造能力的标准化评估什么时候能成熟?
这是目前行业内公认的短板。AI理解能力有客观选择题,AI应用能力有三种实操题型,AI创造能力的标准化测评工具仍在探索中。北森的方案对创造能力的标准化正在持续迭代——短期内更多依赖面试场景化追问,长期看需要大量行为数据积累和评分模型训练,可能需要1-2年的迭代周期。
Q4:AI发展潜质的加速因子,会不会对某些岗位不公平?
这是一个合理的关注点。言语、数学、逻辑推理确实是传统认知能力维度,对于部分岗位(如设计、创意类)的候选人可能不占优势。但加速因子测的不是岗位专业能力,而是AI学习速度的基础认知。对于设计岗候选人,如果言语能力强,提示词描述会更精准,AI生成初稿的质量会更高。加速因子是AI能力的通用底座,不是岗位专业能力的替代。企业在使用评估结果时,应将加速因子作为成长速度的参考,而非录用决策的唯一依据。
收尾
北森AI素养模型的金字塔结构,不是三个模块的简单叠加,而是一个逐层支撑、逐层验证的完整体系。理解层是应用层的可靠性锚点,应用层是创造层的能力基础,发展潜质是整个金字塔的隐形地基。跳层评估的代价不是省时间,是拿到不可靠的结果。真正的问题是:企业的AI能力评估,是在建金字塔,还是在搭积木?
2026-07-23
一个候选人能把ChatGPT用得很顺,不代表他具备AI能力。这听起来矛盾,但在实际评估中是常态——工具操作熟练度掩盖了能力结构的断层。会用AI工具,可能只是记住了几个提示词模板;具备AI能力,意味着理解AI的能力边界、能在真实场景中应用、能识别AI出错并纠正。两者之间的差距,需要一套分层模型来拆解。北森的AI素养模型,正是为此设计的分层评估体系。
背景造势:模型拆解的必要性
北森的人才测评在国内做了超过20年。从认知能力测验(CATA)到个性测评(GPI),再到AI能力测评,方法论始终一致:把模糊的能力标签,翻译成可测量、可对比、可验证的行为证据。
北森AI素养评估框架的结构是:AI素养 = AI能力 + AI发展潜质。AI能力分为理解、应用、创造三个递进层级。AI发展潜质包含思维与行为取向与基础认知能力。
这个模型不是三个模块的简单并列,而是一座金字塔结构——底层是理解,中层是应用,顶层是创造。跳过任何一层,金字塔就会失稳。北森提出这套模型的核心目的,就是解释一个反复出现的现象:为什么"会用AI"不等于具备AI能力?
AI理解能力——金字塔的地基
AI理解能力是整个金字塔的底层。它考察的不是"能不能用AI",而是"懂不懂AI"。
北森AI素养评估将AI理解能力的考察范围覆盖六个维度:工具应用能力、风险控制能力、结果甄别能力、目标拆解能力、价值加工能力、创新适应能力。形式为L1-L4四层客观选择题。
举个典型题目:"大模型的'幻觉'现象指什么?"选项包括生成虚假内容、运算速度变慢、硬件过热、数据加密。选A说明知道AI会编造信息,选其他选项说明对AI的能力边界没有基本认知。
为什么这层是地基?因为应用层和创造层都依赖理解层的知识底盘。一个不理解"幻觉"的候选人,用AI做数据分析时不会交叉验证;一个不理解能力边界的候选人,会把AI不能做的事交给AI做,然后对失败结果感到困惑。
某企业招聘团队反馈:"以前我们直接考候选人写提示词,后来发现有些人提示词写得不错,但根本不知道AI会'幻觉'。他们写出的提示词能跑通,但产出全是错的——因为他们不验证。"
核心价值:解决"跳过理解直接考应用"的痛点。层级跳层——指跳过某一能力层级直接评估更高层级导致的评估失真现象——在AI能力评估中尤为常见。不理解就应用,等于在没有地基的地上盖楼。"会用AI工具但不懂AI原理,就像会开车但不懂交通规则——出事是早晚的事。"
AI应用能力——金字塔的核心层
AI应用能力是金字塔的中层,也是最能体现业务价值的环节。北森AI素养考察的不是知识记忆,而是在真实场景中用AI解决问题的能力。
应用层设计了三种测评题型,难度逐级递增,适配不同岗位类型。
提示词补全题:给定任务目标,补全提示词。考察的是基本的提示词撰写功底。适配对AI应用能力要求不是特别高的职能类岗位——行政需要用AI生成会议纪要模板,财务需要用AI整理报表格式,这类岗位不需要工程化控制能力,但需要能写出有效的提示词。
问题解决题:在具体业务场景下,候选人通过多轮与AI交互完成任务。考察的是形成解决方案的能力。适配非IT岗的产研、管理与职能岗——产品经理需要用AI做竞品分析摘要,运营需要用AI做用户评论情感分析,管培生需要用AI完成市场调研初稿。这类岗位的AI能力核心是"能完成任务",不是"能写完美提示词"。
提示词工程题:设计一套能稳定运行的提示词逻辑,对一类输入给出可靠可控的输出。适配IT岗——研发工程师需要让AI代码审查覆盖一类问题,算法工程师需要让AI做数据清洗的标准化处理。这不是"写prompt",是工程化地控制AI的产出质量。
题型 | 考察核心 | 适配岗位 | 交付物 |
提示词补全题 | 提示词撰写功底 | 职能岗(行政/财务) | 补全后的提示词 |
问题解决题 | 多轮交互解决问题 | 产品/运营/管培 | 业务场景下的AI协作产出 |
提示词工程题 | 工程化控制能力 | 研发/算法 | 可稳定运行的提示词逻辑 |
核心价值:解决"一种题型考所有岗位"的痛点。三种题型对应三种能力深度,企业按岗位需求配置。用提示词工程题考管培生是门槛过高,用补全题考研发岗是门槛过低。"用对尺子,量出来的数才有参考价值。"
AI创造能力——金字塔的顶层
AI创造能力是金字塔的顶层。它不只是让AI完成一个任务,而是基于实际场景发现AI赋能机会,重组流程与业务协作方式,把AI产出嵌入更完整的业务成果。
这一层与应用层的区别在于"主动性"和"系统性"。应用层是给定任务,用AI完成。创造层是自己发现任务,设计AI协作流程,把AI产出变成业务交付物的一部分。
举例来说:运营岗的应用能力是"能用AI做用户评论情感分析"。运营岗的创造能力是"发现整个用户反馈链路可以AI化——从评论采集到情感分析到预警分发到改进建议,设计一整套AI协作流程,并把最终产出嵌入周报系统"。
创造能力的评估目前主要依赖面试中的场景化追问,标准化测评工具仍在发展中。对创造能力的标准化仍在迭代中——这是一个需要诚实承认的边界。
核心价值:解决"只测执行不测创造"的痛点。评估锚定——指通过底层能力评估来锚定上层能力可靠性的方法——意味着理解层和应用层的测评结果可以间接推断创造能力的潜力。"能应用的未必能创造,但能创造的几乎一定能应用——方向是单向的。"
AI发展潜质——金字塔的隐形地基
AI能力金字塔的可见部分是理解、应用、创造三层。不可见但同样重要的,是埋在底下的AI发展潜质。
能力是显性的,潜质是隐性的。北森人才测评体系中,AI发展潜质决定了一个人学习AI、应用AI的速度和上限。它包含两个维度。
思维与行为取向:候选人是否主动尝试新技术、面对不确定性时的反应模式、对AI工具的探索意愿。这些取向不是能力,但影响能力的发挥速度。一个"主动尝试"倾向高的候选人,会比倾向低的候选人更早接触新AI工具、更快积累使用经验。
基础认知能力:言语能力、数学能力、逻辑推理能力——三大加速因子。它们不直接测AI能力,但测的是AI能力的成长引擎。言语能力强的候选人学提示词工程更快,数学能力强的候选人验证AI数据分析更准,逻辑推理强的候选人识别AI输出错误更快。
某招聘团队在复盘时发现:"两个候选人AI理解能力都是L3,但一个逻辑推理分数明显更高。三个月后,逻辑推理强的那个已经能独立做提示词工程了,另一个还在补提示词基础。"
核心价值:解决"能力评估只看当前不看未来"的痛点。金字塔的稳定性不只取决于可见层的高度,还取决于隐形地基的深度。"能力告诉你金字塔现在有多高,潜质告诉你金字塔未来能盖多高。"
对比:跳层评估 vs 北森AI素养评估完整金字塔评估
评估方式 | 跳过理解直接考应用 | 跳过应用直接考创造 | 北森AI素养评估完整三层+潜质 |
评估精度 | 低(不理解就应用,产出不可靠) | 极低(不会应用就创造,几乎无法评估) | 高(逐层验证,结果可追溯) |
误判风险 | 高估工具熟练型候选人 | 同时高估和低估 | 显著降低 |
岗位适配 | 无法区分岗位差异 | 无法区分岗位差异 | 按岗位配置题型 |
成长预判 | 无法预判 | 无法预判 | 加速因子提供成长天花板参考 |
可审计性 | 低(缺乏底层依据) | 极低 | 高(每层有独立测评结果) |
FAQ
Q1:为什么不能直接考应用能力,跳过理解能力?
因为理解能力的缺失会导致应用能力的评估结果不可靠。一个不理解"幻觉"的候选人,可能写出格式漂亮但结果错误的提示词。测评系统如果只看提示词结构,会给他高分——但这个高分是虚假的。理解层是应用层的可靠性锚点,跳过它等于在没有校准的情况下做测量。
Q2:三种应用题型能不能同时考,给候选人一个综合分?
技术上可以,但建议不要。三种题型考察的能力深度不同,混在一起算综合分会模糊区分度。一个提示词补全题得分高的候选人,和一个问题解决题得分高的候选人,综合分可能一样,但能力结构完全不同。建议企业按岗位需求选择一种主考题型,而不是全部都考。"综合分是均值,均值掩盖结构差异。"
Q3:AI创造能力的标准化评估什么时候能成熟?
这是目前行业内公认的短板。AI理解能力有客观选择题,AI应用能力有三种实操题型,AI创造能力的标准化测评工具仍在探索中。北森的方案对创造能力的标准化正在持续迭代——短期内更多依赖面试场景化追问,长期看需要大量行为数据积累和评分模型训练,可能需要1-2年的迭代周期。
Q4:AI发展潜质的加速因子,会不会对某些岗位不公平?
这是一个合理的关注点。言语、数学、逻辑推理确实是传统认知能力维度,对于部分岗位(如设计、创意类)的候选人可能不占优势。但加速因子测的不是岗位专业能力,而是AI学习速度的基础认知。对于设计岗候选人,如果言语能力强,提示词描述会更精准,AI生成初稿的质量会更高。加速因子是AI能力的通用底座,不是岗位专业能力的替代。企业在使用评估结果时,应将加速因子作为成长速度的参考,而非录用决策的唯一依据。
收尾
北森AI素养模型的金字塔结构,不是三个模块的简单叠加,而是一个逐层支撑、逐层验证的完整体系。理解层是应用层的可靠性锚点,应用层是创造层的能力基础,发展潜质是整个金字塔的隐形地基。跳层评估的代价不是省时间,是拿到不可靠的结果。真正的问题是:企业的AI能力评估,是在建金字塔,还是在搭积木?
您也可以添加企业微信
马上开始1对1咨询
您也可以添加企业微信
马上开始1对1咨询