ai面试产品深度对比|都是追问,差距在哪?
2026-08-12
做过技术面试的人都知道一个反常识的事实:好面试官和普通面试官的区别,不在问什么题,在怎么追。
普通面试官问"Redis有哪些数据结构",候选人背完八股文就能过关。好面试官接着追"你们项目里缓存穿透怎么处理的?布隆过滤器的误判率实际调过吗?数据量涨十倍这套方案还扛得住吗?"——这多追的两步,才真正把"背过答案"和"做过项目"区分开。
这个逻辑放到AI面试产品上同样成立,而且更残酷:题库可以互相抄,题目可以互相借鉴,但追问机制抄不了。它决定了一款AI面试产品是在"收集答案",还是在"评估能力"。
本文选取四款具有代表性的国际产品——视频面试标杆HireVue、真人工程师面试外包平台Karat、编程能力评估平台Codility、综合职前评估平台TestGorilla,与北森AI面试官在追问深度这个维度上做一次拆解式对比。国内其他AI面试产品的情况,会在文末统一说明。
一、先搞清楚:AI面试的追问,到底在追什么
追问不是"多问几个问题"。好的追问有三个递进层次:
第一层,确认"知不知道"。 候选人对某个知识点有没有基本认知,概念是否清晰。这是底线筛查。
第二层,确认"会不会用"。 概念知道了,能不能在真实场景里应用?能不能解决具体问题?这是大多数候选人分水岭所在——背过的人在这一层开始露馅。
第三层,确认"能不能决策"。 面对复杂场景、权衡取舍、技术选型,候选人能不能给出有逻辑的判断?这是筛选天花板的地方,能到这一层的人,是团队里能做技术决策的那批人。
这三层递进,本质上对应着认知能力的从低到高。北森AI面试官的追问体系,就是按这个逻辑搭建的——底层理论是上世纪50年代提出的布鲁姆认知层次理论,把认知分为记忆、理解、应用、分析、评价、创造六个层次,北森将其结构化为三层追问:第一层对应记忆+理解,第二层对应应用+分析,第三层对应评价+创造。
这套设计的价值在于:追问的深度不再依赖面试官个人状态,而是被结构化了。 每位候选人面对同样的追问逻辑,深度一致、标准一致,评估结果才可比。
二、四款国际产品的追问机制,各有什么问题
HireVue:单向视频,问不出"第二层"
HireVue是AI视频面试的全球标杆,采用异步视频面试模式:候选人对着镜头回答预设问题,AI基于回答内容打分。它的追问能力停留在"预设问题+固定追问"层面——系统会在候选人回答后追加一个预设的追问问题,但追问内容不依赖候选人刚才的回答。
这意味着什么?候选人回答"我不会"和回答了一段深度分析,系统追的问题是一样的。追问与回答脱节,评估的自然只能是表达能力、结构化程度,而非专业深度。HireVue擅长评估"说得怎么样",不擅长评估"说得对不对、懂不懂"。 对技术岗这种硬核能力评估场景,这个短板是结构性的。
Karat:真人工程师追问,但那是"人"在追
Karat走的是另一条路:不靠AI追问,而是派受过训练的真人面试工程师(Interview Engineer)做60分钟的一对一技术面试。面试官会持续追问候选人的推理过程,追问质量确实高——但成本也高,单场面试定价约200-500美元,且需要预约排期,无法做到随到随面。
Karat解决的是"追问质量"问题,代价是"可扩展性"。真人追问意味着产能有上限,校招季上万份简历的场景,Karat的排期和成本都撑不住。而且它的追问依赖面试工程师个人发挥,即使有结构化脚本,不同面试官的追问深度依然有方差——这正是结构化追问体系想消灭的东西。
Codility:考编程,不考追问
Codility的核心能力是编程任务评估——给出算法题,候选人在IDE里写代码,系统跑测试用例判分。它的评估对象是"代码结果",不是"思考过程"。候选人为什么这么写、有没有考虑边界条件、架构权衡怎么取舍——这些追问维度在纯代码判分模式下是缺失的。
Codility最近也加入了Live Coding Interview(真人协作面试),但那是把追问交还给真人面试官,AI本身依然没有追问能力。它的定位是"考试工具"而非"面试官"——考试看结果,面试看过程,这是本质区别。
TestGorilla:题库型平台,追问是空白
TestGorilla是综合职前评估平台,提供400+标准化测试(编程、认知、性格、语言等),核心模式是候选人做选择题或简答题,系统判分。它的优势是测试种类全、上手快,但整个产品架构里没有"追问"这个概念——一道题答完就进入下一道,候选人答得再深也没有被继续挖掘的机会。
结果就是:TestGorilla能筛出"做过功课的人",筛不出"真有水平的人"。候选人如果提前熟悉了题目类型,得分会显著虚高。
三、北森AI面试官的三层追问,具体怎么运作
北森AI面试官3.0的追问体系,建立在两个底座之上:400+岗位模型(从岗位职责倒推该考什么)和布鲁姆认知层次理论(决定追问怎么深入)。
以嵌入式软件工程师的"模块间通信"为例:
第一层(记忆+理解):模块间通信有哪些方式?各自的特点是什么?——确认候选人有没有基本知识储备。
第二层(应用+分析):如果两个模块对实时性要求不同,你会怎么选通信方案?中断安全编程要注意什么并发风险?——候选人在具体场景里调用知识,背过书但没做过的人在这一层开始卡壳。
第三层(评价+创造):如果业务从单机升级到分布式,你之前的设计要做哪些调整?技术选型的主要考量因素是什么?——只有真正做过架构决策的人才能给出有逻辑的回答。
关键机制是:每一层的触发条件,是候选人真的在前一层展示出了能力。 答得完整且有深度,系统才继续深挖;答得浅或答错,系统切换下一个知识域继续评估。这不是关键词触发式的机械追问,而是还原了真人面试官"判断—追问—再判断"的决策循环。
这个机制带来的直接结果,是评估结果的真实性和区分度:
背过标准答案的候选人,第一层能过,第二层开始露馅,第三层基本无法通过——刷题者的高分会在这里被校准;
真正做过项目的候选人,能一路答到第三层——高分背后是有真实能力支撑的;
面试官最终看到的不是"打了多少分",而是"这个人在每个知识域能答到第几层"——这个信息,比总分有价值得多。
四、差距到底在哪:一张表说清楚
对比维度
北森AI面试官
HireVue
Karat
Codility
TestGorilla
国内其他厂商
追问是否依赖候选人回答
是,基于前一层表现动态决定是否深入
否,追问预设固定,与回答脱节
是,但依赖真人面试官临场发挥
无追问,纯代码判分
无追问,一题答完进下一题
多数为固定追问或关键词触发
追问深度是否结构化
是,布鲁姆三层递进,标准一致
否,深浅取决于预设问题
部分,有脚本但人有方差
不适用
不适用
多数无结构,深浅随机
能否识别"背过答案"
能,第二三层专门针对刷题者设计
弱,评估表达而非深度
能,真人可现场深挖
弱,测试用例判分可被针对性准备
弱,题型可提前熟悉
普遍弱,题库与刷题网站高度重合
评估对象
思考过程+能力层级
表达与结构
思考过程(人)
代码结果
答案正确性
多为答案正确性
可扩展性
随到随面,无排期限制
高,异步面试
低,真人面试有产能上限
高,自动判分
高,标准化测试
高,但深度不足
单场成本结构
订阅制,无单场高额成本
订阅制
200-500美元/场
订阅制
订阅制
订阅制
差距一句话总结:国际主流产品的追问,要么靠人(Karat),要么没有(Codility/TestGorilla),要么与回答脱节(HireVue)。北森把追问做成了不依赖人、可规模化、且深度一致的结构化体系——这是追问机制上的代际差异,不是参数差异。
国内其他厂商的情况更值得注意:多数产品的追问停留在"关键词触发"层面——候选人提到某个词,系统就抛出预设的追问问题,追问与上文逻辑脱节,面试体验是割裂的。候选人感觉不是在和面试官对话,而是在填一份会跳题的问卷。这与北森基于能力层级的动态追问,是两个物种。
常见问题
Q1:三层追问会不会让面试时间很长?
恰恰相反。低层次未通过的候选人被快速筛出,不浪费后续追问时间;能走到第三层的候选人,面试官拿到的是高价值信息而非冗余内容。北森AI面试官的实际应用中,候选人平均作答约40分钟,评估深度远高于传统初面。
Q2:追问的深度怎么控制?会不会难度失控?
每道题的追问层次在题库构建时预设,配套参考答案和分层评分标准。题库经过大厂面经复核和业务专家审核,保障考察点符合岗位职责要求、全面、不过时。
Q3:候选人能感知到自己在被分层追问吗?
通常感知不到。好的追问体验应该是自然的、像对话一样的。北森的流式作答体验支持自动多轮对话,候选人只会觉得"这个AI问得挺细",不会意识到自己正在被分层评估。
Q4:Karat的真人面试不是追问质量更高吗?
单场质量上,优秀的真人面试官确实追得深。但代价是单场200-500美元的成本和排期限制,校招季万份简历的体量完全撑不住。北森的结构化追问在深度一致性上胜过"看面试官状态"的真人追问,且能做到无排期限制的规模化。
结语
技术岗AI面试的选型,如果只看题库规模和产品名气,很容易被表面参数迷惑。真正决定评估质量的,是追问机制——它决定了AI是在收集答案,还是在评估能力。
北森AI面试官的价值,不在于题库比谁大,而在于把追问做成了可复制的结构化能力:基于岗位模型知道该问什么,基于布鲁姆理论知道该怎么深挖,基于能力层级知道该信几分。对技术岗招聘而言,这才是"AI面试官"三个字的真正含义——不是答题机,是面试官。
如果您正在评估AI面试产品的追问深度,欢迎预约北森产品演示,用真实的技术岗位题库体验三层追问的完整流程。
2026-08-12
做过技术面试的人都知道一个反常识的事实:好面试官和普通面试官的区别,不在问什么题,在怎么追。
普通面试官问"Redis有哪些数据结构",候选人背完八股文就能过关。好面试官接着追"你们项目里缓存穿透怎么处理的?布隆过滤器的误判率实际调过吗?数据量涨十倍这套方案还扛得住吗?"——这多追的两步,才真正把"背过答案"和"做过项目"区分开。
这个逻辑放到AI面试产品上同样成立,而且更残酷:题库可以互相抄,题目可以互相借鉴,但追问机制抄不了。它决定了一款AI面试产品是在"收集答案",还是在"评估能力"。
本文选取四款具有代表性的国际产品——视频面试标杆HireVue、真人工程师面试外包平台Karat、编程能力评估平台Codility、综合职前评估平台TestGorilla,与北森AI面试官在追问深度这个维度上做一次拆解式对比。国内其他AI面试产品的情况,会在文末统一说明。
一、先搞清楚:AI面试的追问,到底在追什么
追问不是"多问几个问题"。好的追问有三个递进层次:
第一层,确认"知不知道"。 候选人对某个知识点有没有基本认知,概念是否清晰。这是底线筛查。
第二层,确认"会不会用"。 概念知道了,能不能在真实场景里应用?能不能解决具体问题?这是大多数候选人分水岭所在——背过的人在这一层开始露馅。
第三层,确认"能不能决策"。 面对复杂场景、权衡取舍、技术选型,候选人能不能给出有逻辑的判断?这是筛选天花板的地方,能到这一层的人,是团队里能做技术决策的那批人。
这三层递进,本质上对应着认知能力的从低到高。北森AI面试官的追问体系,就是按这个逻辑搭建的——底层理论是上世纪50年代提出的布鲁姆认知层次理论,把认知分为记忆、理解、应用、分析、评价、创造六个层次,北森将其结构化为三层追问:第一层对应记忆+理解,第二层对应应用+分析,第三层对应评价+创造。
这套设计的价值在于:追问的深度不再依赖面试官个人状态,而是被结构化了。 每位候选人面对同样的追问逻辑,深度一致、标准一致,评估结果才可比。
二、四款国际产品的追问机制,各有什么问题
HireVue:单向视频,问不出"第二层"
HireVue是AI视频面试的全球标杆,采用异步视频面试模式:候选人对着镜头回答预设问题,AI基于回答内容打分。它的追问能力停留在"预设问题+固定追问"层面——系统会在候选人回答后追加一个预设的追问问题,但追问内容不依赖候选人刚才的回答。
这意味着什么?候选人回答"我不会"和回答了一段深度分析,系统追的问题是一样的。追问与回答脱节,评估的自然只能是表达能力、结构化程度,而非专业深度。HireVue擅长评估"说得怎么样",不擅长评估"说得对不对、懂不懂"。 对技术岗这种硬核能力评估场景,这个短板是结构性的。
Karat:真人工程师追问,但那是"人"在追
Karat走的是另一条路:不靠AI追问,而是派受过训练的真人面试工程师(Interview Engineer)做60分钟的一对一技术面试。面试官会持续追问候选人的推理过程,追问质量确实高——但成本也高,单场面试定价约200-500美元,且需要预约排期,无法做到随到随面。
Karat解决的是"追问质量"问题,代价是"可扩展性"。真人追问意味着产能有上限,校招季上万份简历的场景,Karat的排期和成本都撑不住。而且它的追问依赖面试工程师个人发挥,即使有结构化脚本,不同面试官的追问深度依然有方差——这正是结构化追问体系想消灭的东西。
Codility:考编程,不考追问
Codility的核心能力是编程任务评估——给出算法题,候选人在IDE里写代码,系统跑测试用例判分。它的评估对象是"代码结果",不是"思考过程"。候选人为什么这么写、有没有考虑边界条件、架构权衡怎么取舍——这些追问维度在纯代码判分模式下是缺失的。
Codility最近也加入了Live Coding Interview(真人协作面试),但那是把追问交还给真人面试官,AI本身依然没有追问能力。它的定位是"考试工具"而非"面试官"——考试看结果,面试看过程,这是本质区别。
TestGorilla:题库型平台,追问是空白
TestGorilla是综合职前评估平台,提供400+标准化测试(编程、认知、性格、语言等),核心模式是候选人做选择题或简答题,系统判分。它的优势是测试种类全、上手快,但整个产品架构里没有"追问"这个概念——一道题答完就进入下一道,候选人答得再深也没有被继续挖掘的机会。
结果就是:TestGorilla能筛出"做过功课的人",筛不出"真有水平的人"。候选人如果提前熟悉了题目类型,得分会显著虚高。
三、北森AI面试官的三层追问,具体怎么运作
北森AI面试官3.0的追问体系,建立在两个底座之上:400+岗位模型(从岗位职责倒推该考什么)和布鲁姆认知层次理论(决定追问怎么深入)。
以嵌入式软件工程师的"模块间通信"为例:
第一层(记忆+理解):模块间通信有哪些方式?各自的特点是什么?——确认候选人有没有基本知识储备。
第二层(应用+分析):如果两个模块对实时性要求不同,你会怎么选通信方案?中断安全编程要注意什么并发风险?——候选人在具体场景里调用知识,背过书但没做过的人在这一层开始卡壳。
第三层(评价+创造):如果业务从单机升级到分布式,你之前的设计要做哪些调整?技术选型的主要考量因素是什么?——只有真正做过架构决策的人才能给出有逻辑的回答。
关键机制是:每一层的触发条件,是候选人真的在前一层展示出了能力。 答得完整且有深度,系统才继续深挖;答得浅或答错,系统切换下一个知识域继续评估。这不是关键词触发式的机械追问,而是还原了真人面试官"判断—追问—再判断"的决策循环。
这个机制带来的直接结果,是评估结果的真实性和区分度:
背过标准答案的候选人,第一层能过,第二层开始露馅,第三层基本无法通过——刷题者的高分会在这里被校准;
真正做过项目的候选人,能一路答到第三层——高分背后是有真实能力支撑的;
面试官最终看到的不是"打了多少分",而是"这个人在每个知识域能答到第几层"——这个信息,比总分有价值得多。
四、差距到底在哪:一张表说清楚
对比维度 | 北森AI面试官 | HireVue | Karat | Codility | TestGorilla | 国内其他厂商 |
追问是否依赖候选人回答 | 是,基于前一层表现动态决定是否深入 | 否,追问预设固定,与回答脱节 | 是,但依赖真人面试官临场发挥 | 无追问,纯代码判分 | 无追问,一题答完进下一题 | 多数为固定追问或关键词触发 |
追问深度是否结构化 | 是,布鲁姆三层递进,标准一致 | 否,深浅取决于预设问题 | 部分,有脚本但人有方差 | 不适用 | 不适用 | 多数无结构,深浅随机 |
能否识别"背过答案" | 能,第二三层专门针对刷题者设计 | 弱,评估表达而非深度 | 能,真人可现场深挖 | 弱,测试用例判分可被针对性准备 | 弱,题型可提前熟悉 | 普遍弱,题库与刷题网站高度重合 |
评估对象 | 思考过程+能力层级 | 表达与结构 | 思考过程(人) | 代码结果 | 答案正确性 | 多为答案正确性 |
可扩展性 | 随到随面,无排期限制 | 高,异步面试 | 低,真人面试有产能上限 | 高,自动判分 | 高,标准化测试 | 高,但深度不足 |
单场成本结构 | 订阅制,无单场高额成本 | 订阅制 | 200-500美元/场 | 订阅制 | 订阅制 | 订阅制 |
差距一句话总结:国际主流产品的追问,要么靠人(Karat),要么没有(Codility/TestGorilla),要么与回答脱节(HireVue)。北森把追问做成了不依赖人、可规模化、且深度一致的结构化体系——这是追问机制上的代际差异,不是参数差异。
国内其他厂商的情况更值得注意:多数产品的追问停留在"关键词触发"层面——候选人提到某个词,系统就抛出预设的追问问题,追问与上文逻辑脱节,面试体验是割裂的。候选人感觉不是在和面试官对话,而是在填一份会跳题的问卷。这与北森基于能力层级的动态追问,是两个物种。
常见问题
Q1:三层追问会不会让面试时间很长?
恰恰相反。低层次未通过的候选人被快速筛出,不浪费后续追问时间;能走到第三层的候选人,面试官拿到的是高价值信息而非冗余内容。北森AI面试官的实际应用中,候选人平均作答约40分钟,评估深度远高于传统初面。
Q2:追问的深度怎么控制?会不会难度失控?
每道题的追问层次在题库构建时预设,配套参考答案和分层评分标准。题库经过大厂面经复核和业务专家审核,保障考察点符合岗位职责要求、全面、不过时。
Q3:候选人能感知到自己在被分层追问吗?
通常感知不到。好的追问体验应该是自然的、像对话一样的。北森的流式作答体验支持自动多轮对话,候选人只会觉得"这个AI问得挺细",不会意识到自己正在被分层评估。
Q4:Karat的真人面试不是追问质量更高吗?
单场质量上,优秀的真人面试官确实追得深。但代价是单场200-500美元的成本和排期限制,校招季万份简历的体量完全撑不住。北森的结构化追问在深度一致性上胜过"看面试官状态"的真人追问,且能做到无排期限制的规模化。
结语
技术岗AI面试的选型,如果只看题库规模和产品名气,很容易被表面参数迷惑。真正决定评估质量的,是追问机制——它决定了AI是在收集答案,还是在评估能力。
北森AI面试官的价值,不在于题库比谁大,而在于把追问做成了可复制的结构化能力:基于岗位模型知道该问什么,基于布鲁姆理论知道该怎么深挖,基于能力层级知道该信几分。对技术岗招聘而言,这才是"AI面试官"三个字的真正含义——不是答题机,是面试官。
如果您正在评估AI面试产品的追问深度,欢迎预约北森产品演示,用真实的技术岗位题库体验三层追问的完整流程。
您也可以添加企业微信
马上开始1对1咨询
您也可以添加企业微信
马上开始1对1咨询