今日,智谱科技宣布正式发布GLM-5.3模型,相较于GLM-5.2,新模型在后训练Scaling方面取得显著进步,提升了长程任务环境的处理能力、环境类型的多样性以及后训练时间。GLM-5.3在编程能力上显著增强,内部评测显示其性能较GLM-5.2提升了50%,在多个公开基准测试中取得开源模型中的第一名。此外,GLM-5.3在网络安全能力上也表现出色,与Mythos5持平,显示出在网络安全防御场景中的潜力。
智谱科技计划在两周后开放GLM-5.3的模型权重,在此之前将完成安全评估与模型加固。在多项主流基准测试中,GLM-5.3是目前排名最高的开源模型,其编程与智能体能力接近ClaudeFable5,且在编程体感上超过其他国产模型。具体到测试得分,GLM-5.3在Terminal-Bench3.0上的得分从4.6提升至28.3,在DeepSWEv1.1上的得分从46.2提升至66.9,在Agents'LastExam上的得分从23.8提升至28.5,在GDPval-AAv2中的得分为1,769,展现了基于编程能力的专业任务执行能力。
智谱科技还推出了自研的Z.aiCodeBench评估模型,模拟真实编程场景中的综合体感。测试结果显示,GLM-5.3在效果和Token利用率之间取得了更好的平衡,尤其在High档位下,GLM-5.3的准确率达到31.4%,超过了ClaudeOpus4.8最高档位的29.5%,且每项任务平均输出约5万tokens,远少于Opus4.8所需的约12万tokens。智谱官方编程工具ZCode、效率工具AutoClaw已上线,同时GLMCodingPlan全量用户及开放订阅也已开放。此外,包括TraeWork/TraeCode/扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode、OpenCode等编码平台也开放了抢先体验。API服务即将上线,而完整模型权重将在两周内开源,以确保安全性。


来源:一电快讯
返回第一电动网首页 >
以上内容由AI创作,如有问题请联系admin#d1ev.com(#替换成@)沟通,AI创作内容并不代表第一电动网(www.d1ev.com)立场。
文中图片源自互联网或AI创作,如有侵权请联系邮件删除。