PLC代码生成的关键问题,已经不只是模型能否写出一个独立程序组织单元(POU),而是生成逻辑能否接入既有工程、通过编译,并在真实运行时表现正确。Hugging Face Daily Papers于2026年8月19日收录的SemaPLC,把评测重点从模型自评转向可记录的外部验证。

用验证结果定义任务完成

SemaPLC不是新模型,而是由常规工具组装的智能体执行框架。它采用严格完成规则:模型认为答案足够好,并不代表任务结束;只有外部检查留下通过记录,系统才会宣布完成。检查覆盖规格、编译和实际运行行为,使智能体能够围绕明确失败信号继续修正,而不是停在形式完整或静态上看似合理的代码上。

这种设计也把PLC代码生成放回项目上下文。除独立POU任务外,生成逻辑还必须进入真实项目编译和运行,因而接口、工程约束与执行结果都会成为验收条件。

动态行为比静态评分更能区分方法

在117个与现有基准匹配的独立POU任务上,SemaPLC对全部七个模型都取得最高的严格验证通过率,平均为72.6%。在包含65个任务的项目上下文测试中,它在集成编译、静态行为和动态行为三层指标上的平均成绩也都最高。

最明显的差距出现在动态行为。研究将生成逻辑与参考逻辑部署到真实PLC运行时,并比较执行轨迹。各方法的静态成绩相差不超过10分,但基线动态得分仅为22.4至31.4,SemaPLC达到52.2。这说明静态检查容易压缩方法间差异,真实执行更能暴露代码能否正确工作。

我的判断

SemaPLC的价值主要不在生成能力本身,而在于把“完成”改造成可审计的工程事实。它适合已有PLC项目、可用编译链和真实运行环境的场景,也提示代码智能体评测应优先采用外部闭环,而非依赖模型自我判断。

边界同样明确:摘要没有说明任务覆盖的PLC平台、项目复杂度及失败类型,执行轨迹与参考逻辑一致也不能直接等同于满足全部工业安全要求。因此,52.2更适合作为该测试设置下的相对证据,而不是现实部署可靠性的最终结论。