推广 热搜: 京东  联通  iPhone  iphone11  摄像头  网络安全  自动驾驶  企业存储  XSKY  京东智能采购 

方升-Code2.0发布:聚焦真实工程任务,为大模型能力评估立新标

   日期:2026-09-12     作者:itcg    浏览:2958    我要评论    
导读:方升-Code2.0发布:聚焦真实工程任务,为大模型能力评估立新标

在2026年中国国际服务贸易交易会期间,一场聚焦智能原生软件变革与创新的交流活动引发行业关注。中国信息通信研究院在此次活动上正式推出“方升-Code2.0”大模型基准测试体系,标志着我国AI代码能力评估进入更注重工程实践的新阶段。这一升级版本针对当前评测体系在产业应用中暴露的短板,构建了覆盖全流程的标准化评估框架。

据中国信通院人工智能所平台与工程化部主任曹峰介绍,原有评测体系存在三大核心问题:评测任务设计脱离真实开发场景、数据样本质量参差不齐、评估维度单一化。复旦大学计算与智能创新学院副院长彭鑫指出,行业现存的多数评测集更像“能力擂台赛”,而非检验模型能否胜任实际开发工作的“压力测试场”。这种评估导向导致部分模型在榜单上表现优异,却难以处理企业级代码库的复杂需求。

新发布的方升-Code2.0体系构建了5000余条源自真实项目的评测数据,涵盖代码生成、缺陷修复、单元测试、技术文档解析四大典型场景。测试团队特别设计了动态难度分级机制,从287条精选测试用例中划分出基础、进阶、专家三个难度层级。曹峰强调,评估重点已从“能否生成代码”转向“能否持续稳定完成复杂工程任务”,这要求模型具备更强的上下文理解能力和长周期任务处理能力。

在评估指标方面,方升-Code2.0突破传统正确率单一维度,构建了包含五类核心指标的立体化评估体系。除基础代码质量外,新增工程价值评估模块,重点考察模型生成的代码是否符合企业编码规范、能否通过静态代码扫描、是否具备可维护性等实际开发要素。效率成本分析模块则引入单位时间代码产出量、资源消耗率等量化指标,更真实反映模型在企业开发环境中的经济性。

这一评估体系的升级与我国软件产业智能化转型形成共振。工信部最新数据显示,2026年前五月软件业务收入达6.25万亿元,同比增长10.3%,智能编程工具的日均调用量突破500万亿次。刚出台的《“人工智能+软件”专项行动实施方案》明确提出,到2028年要培育100个智能体软件标杆应用,推动关键软件全面实现智能化升级。

中国信通院人工智能研究所高级业务主管秦思思在分享中指出,智能原生软件正在重塑行业研发范式。与传统功能型软件不同,新一代软件需要具备目标理解、任务拆解和自主执行能力,这对测试验证体系提出全新要求。例如在智能体协作场景中,不仅要评估单个模型的能力边界,还需测试多智能体系统的协同效率、异常处理机制等复杂指标。

据参与体系建设的专家透露,方升-Code2.0已与多家头部科技企业建立数据共建机制,未来将持续扩充高难度评测数据集。特别是在智能体协作、自动化测试等新兴领域,将开发更具挑战性的长周期任务用例,帮助企业更精准地评估模型在实际生产环境中的表现。这一评估体系的完善,将为我国软件产业智能化转型提供重要的技术参照系。

 
反对 0举报 0 收藏 0 打赏 0评论 0
 
更多>同类资讯
0相关评论

头条阅读
推荐图文
相关资讯
网站首页  |  物流配送  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  RSS订阅  |  违规举报  |  京ICP备14047533号-2