尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

简历被机器筛掉之前,发生了什么:从 PDF 文本层说起

发布时间:2026/9/25 16:17:13

资讯中心
01
ARTICLE

简历被机器筛掉之前,发生了什么:从 PDF 文本层说起

简历被机器筛掉之前,发生了什么:从 PDF 文本层说起
投了几十份没回音多数人的第一反应是HR 根本没看。这话对了一半很多简历确实没到人眼前但拦住它的通常不是人而是解析。稍具规模的招聘系统在收到附件之后不会直接把 PDF 丢给 HR 翻。它先做几件事提取文本、切分区块、抽取字段姓名、学校、工作年限、技能、再和岗位要求做匹配。这条链路上任何一环出错你的简历在系统里就是一份内容残缺的记录。对写代码的人来说这套流程其实很好理解也很好自查。第一关你的 PDF 里到底有没有文字PDF 分两种。一种带文本层文字是以字符和坐标的形式存的另一种是扫描件或者图片整页就是一张位图。后者提取出来是空的。手机拍照转的 PDF、截图拼的 PDF、某些海报类设计工具导出为图片型 PDF的结果都属于这一类。系统拿到一份提取不出任何文字的简历最好的情况是转人工常见的情况是标记为无效。还有一种更隐蔽的设计软件里把文字转曲线之后再导出视觉上一模一样本质上已经变成矢量图形同样提取不出字符。自查很简单不用装工具用任意 PDF 阅读器打开试着框选一段文字。选不中就说明没有文本层。装了命令行工具的话pdftotext resume.pdf -一行就能看到系统眼里的你。第二关阅读顺序不等于视觉顺序这是双栏简历翻车最多的地方。PDF 里的文本是按绘制顺序存储的和你看到的版面没有必然关系。左右分栏的排版如果生成时是逐行横向绘制的提取出来就会变成左栏一句、右栏一句交替穿插张三 求职意向后端开发 2022.09 - 2026.06 熟悉 Java / Go 某某大学 MySQL / Redis人能看懂正则和分段逻辑看不懂。它会认为某某大学后面紧跟着的技能词属于同一个区块字段抽取从这里开始全线错位。表格是同一类问题的加强版。很多单元格在提取后会变成一堆没有关联的短句行列关系彻底丢失。这也是为什么大量招聘方明确要求单栏、不要用表格排版不是审美偏好是解析成本。第三关中文乱码提取出来是(cid:1234)这种东西或者一堆方框说明 PDF 里嵌入的字体缺少 ToUnicode 映射表。字符能画出来但对不上 Unicode 码位。这种情况在用了非常规中文字体、或者某些在线转换工具生成的 PDF 里并不罕见。视觉正常、机器全乱是最难自己发现的一种。第四关字段抽取认的是模式不是创意抽取逻辑大量依赖标题词和格式约定。你把教育背景写成我的成长轨迹把工作经历写成这些年我在做的事把日期写成大三下学期都会让识别率明显下降。同理把关键信息放进页眉页脚、文本框、图标旁边的艺术字里提取时经常整块丢失。有人把手机号做成好看的图标行结果系统里这份简历没有联系方式。那到底该怎么做规则其实很少而且都不难用能导出真文本层的工具生成 PDF导出后自己框选验证一次主体单栏别用表格画版面投国企央企要求填的制式表格是另一回事那是人看的定式区块标题用通用词教育背景、工作/实习经历、项目经历、专业技能日期统一成2024.03 - 2024.09这种可解析格式联系方式写成纯文本别做成图技能词按岗位 JD 的原词写别自己造缩写。最后一步是验证。把导出的 PDF 反向提取一遍看看还剩下什么这一步花不了两分钟却能拦住绝大多数投出去石沉大海的技术性事故。简历这东西的特殊之处在于你永远收不到失败回执。解析炸了没人会告诉你你只会觉得市场行情不好。所以投出去之前至少确认一次机器能读懂它。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。