尽管AI火热,初级软件工程师的就业市场正在萎缩
入门级编程岗位正在企业内部持续消失,尽管AI编码智能体眼下仍然无法胜任初级工程师曾经借以成长的、需要长时间投入与丰富背景知识的复杂任务。

关于"智能体编程"——即在有限人工干预下自主编写、测试和修复代码的AI系统——是否即将取代初级软件工程师,还是仅仅取代了企业过去交给他们的那些任务,一场争论正在加剧。据MarkTechPost报道,这个问题通常被问反了:人们直接从不断上升的基准测试分数推导出劳动力市场的结论,却跳过了中间本应逐一验证的每一个环节。
基准测试衡量的比它们声称的要少
MarkTechPost援引METR关于"时间跨度"的研究,该研究测算一名熟练人类完成某项任务所需的时间,再找出AI模型有一半概率能够成功完成的任务时长。自2019年以来,这一时间跨度大约每七个月翻一番,MarkTechPost报道称,2024年至2026年间这一倍增速度还在加快,前沿系统的能力如今已以"小时"而非"分钟"计。但50%的成功率并不是雇主可以据此配置人手的标准:MarkTechPost指出,在80%的可靠性门槛下,前沿模型在人类四分钟内即可完成的任务上表现近乎完美,而在耗时超过四小时的任务上成功率不足10%。MarkTechPost还写道,METR自身的测试任务都经过刻意设计、自成一体——这恰恰与初级工程师真实的入职初期相反,那段时间几乎都花在吸收背景信息上:哪个团队负责哪项服务、某个陈旧的抽象设计为何仍然存在、遇到问题该问谁。
另一个被广泛引用的数字则让情况更加不妙。据MarkTechPost对该实验室自身声明的转述,2026年2月,OpenAI停止公布其在SWE-bench Verified上的分数,并建议其他实验室也这样做。一项针对27.6%数据集的审查发现,至少59.4%被审查的问题存在有缺陷的测试用例,会将功能上正确的解决方案判定为失败,此外还发现了训练数据污染的证据。MarkTechPost报道称,在SWE-bench Pro等更难、未受污染的测试集上,前沿模型的分数相较企业在产品发布时引用的Verified成绩大幅下滑。
验证才是真正的瓶颈,而不是写代码
关于成本最清晰的证据来自METR开展的一项随机对照实验,由MarkTechPost援引:16名经验丰富的开源开发者在自己的246个真实代码仓库任务中,随机被允许或禁止使用AI。开发者事先预测能提速24%,事后自估提速了20%——但屏幕录像显示,他们实际上慢了19%。MarkTechPost指出了该实验的局限:使用的是2025年初的工具,样本量小,且都是在自己熟悉的代码库上工作的资深开发者。尽管如此,MarkTechPost仍将"感知生产力"与"实测生产力"之间的落差视为该实验最站得住脚的发现——而这正是那种应当被清楚指出、而非被抹平的分歧。
更大范围的调查也指向同一方向。MarkTechPost援引Stack Overflow 2025年对超过49000名开发者的调查:84%的人正在使用或计划使用AI编码工具,同时46%的人对输出结果的准确性持积极怀疑态度,相比之下只有33%的人表示信任,仅3%的人表示高度信任。谷歌的DORA研究调查了约5000名从业者,发现90%的人在工作中使用AI,超过80%的人认为AI提升了自己的生产力,但30%的人表示对AI生成的代码几乎不信任或完全不信任——尽管交付吞吐量逐年提升,交付的稳定性却并未改善。MarkTechPost认为,要让智能体替代初级工程师,以下三个条件目前均未满足:
- 在具有初级工程师真实工作那种时长与前置背景的任务上保持可靠表现,而不仅是自成一体的基准测试任务
- 基准分数要能在更难、未受污染的测试集上站得住脚,而不是依赖像SWE-bench Verified这样已被停用的测试集
- 当资深工程师审核AI输出时,验证成本要低于直接把工作交给一个人去做的成本
招聘数据已经显示出这种转变
MarkTechPost指出,第四个条件并不取决于前三个:即无论"替代"是否真的能够奏效,企业是否愿意打破自己培养初级工程师成长为资深工程师的这条通路。斯坦福大学数字经济实验室追踪覆盖约六分之一美国劳动者的ADP薪资数据,发现在包括软件开发在内的、受AI影响最大的职业中,22至25岁年轻从业者的就业状况与同一职业中年长从业者明显背离:截至2025年7月的数据显示缺口为15%,到2026年6月已扩大至19%,MarkTechPost报道称,这主要是由招聘减少而非裁员驱动的。
CIO从招聘端也报道了同样的降温趋势。据CIO援引纽约联邦储备银行的预测,在美国,计算机工程专业应届毕业生的失业率为7.5%,计算机科学专业毕业生为6.1%,均远高于4.3%的全国失业率,也明显高于护理学(1.4%)或土木工程(1%)专业应届毕业生的失业率。CIO报道称,Resume.org对1000名美国企业高管的调查发现,十分之六的企业可能在2026年裁员,十分之四的企业计划用AI替代部分员工。"花9万美元雇一个初级工程师,GitHub Copilot却只要10美元,为什么还要雇人?"资深软件工程师奇拉格·阿格拉瓦尔(Chirag Agrawal)告诉CIO,并描述了自己的工作如何从编写代码转向核查AI输出中的边界情况和安全漏洞。咨询公司Tredence的AI主管拉基特·古普塔(Rachit Gupta)告诉CIO,如今AI已能处理大量曾经由初级工程师练手的调试、测试编写和样板代码工作,但架构、合规与安全方面的判断仍然依赖经验丰富的工程师。
对企业而言,现实利害是即时的:少招初级工程师能在经济下行期省钱,但MarkTechPost的核心论点是,那些"程式化"的任务——初级工程师入职时就已经会做的那部分工作——恰恰正是智能体正在自动化的内容,而资深工程师所拥有的默会判断力,正是这些任务原本应当在实践中教会他们的东西。这给雇主留下了一个几乎没人为之做预算的问题:如果最底层的台阶消失了,谁来培养下一代审核者。对于正在进入就业市场的应届毕业生而言,包括在中国等AI编码工具同样迅速普及的市场,两篇报道传递的信息是一致的:围绕编写样板代码搭建起来的岗位正在收缩,而真正被录用的人则越来越需要证明自己能够质疑、测试和修正AI生成的代码,而不只是生产更多这样的代码。
信息来源
- What Would Have to Be True for Agentic Coding to Replace Junior EngineersMarkTechPost · 2026年8月26日
- Demand for junior developers softens as AI takes overCIO · 2025年9月24日



