← 返回任务榜单

AI程序员:代码生成与软件开发智能体开发任务

开发一个能辅助软件需求拆解、代码生成、调试测试、部署说明和过程记录的AI程序员智能体或工作流工具

参赛对象

高水平学生团队社会AI开发者外部工作室

能力层级

L2 智能体层 · L3 流程执行层 · L5 价值治理层

任务背景

学校AI3.0改革正在快速推进,真实项目、系统开发、示范场景和智能体应用需求不断增加,现有内部开发力量难以完全支撑。启智杯第一期应将部分真实开发需求转化为公开任务,通过比赛发现能够借助AI工具完成软件开发、工作流构建和系统交付的学生团队、社会开发者和外部工作室。

任务目标

参赛团队需开发一个面向软件开发场景的AI程序员智能体或工作流工具,能够根据需求说明完成任务拆解、代码生成、代码解释、调试建议、测试用例生成、部署说明生成、开发过程记录和可审计资料沉淀。

核心功能要求

  • 1

    支持输入需求说明书或任务描述后,自动生成任务拆解、模块清单和开发计划。

  • 2

    支持根据任务拆解生成代码、接口说明、数据库表结构或关键模块。

  • 3

    支持对生成代码进行解释、调试建议、错误定位和修复建议。

  • 4

    支持生成测试用例、测试记录和部署说明。

  • 5

    支持沉淀Prompt库、AI对话记录、Token用量、工具调用记录和版本迭代记录。

  • 6

    鼓励基于Harness架构形成可复用的AI程序员工作流。

提交成果要求

成果类型最低提交要求
作品级
① 可演示Demo(界面或命令行交互); ② 核心Prompt模板及工作流定义(至少覆盖“需求→拆解→生成”链路); ③ 不少于3轮的AI对话记录(含输入、输出、修改过程); ④ 局部代码生成样例(含接口说明或表结构定义); ⑤ 使用说明文档(含环境配置、操作步骤等)。
产品级
① 可运行工具或智能体(含前后端或CLI完整实现); ② 完整代码仓库及配置文件(含依赖、环境变量); ③ 基于任务拆解的完整生成物:代码、接口文档、数据库DDL、关键模块设计说明; ④ 调试与错误定位记录:至少包含3个典型错误的自动诊断与修复建议案例; ⑤ 测试用例集(单元测试/接口测试)及对应的测试执行记录(通过率≥90%); ⑥ 部署说明(含一键启动脚本或容器化方案)。
商品级
① 可部署生产环境的稳定版本; ②提供Prompt库沉淀(含版本管理)、工具调用日志、Token消耗趋势分析; ③ 完成至少3个典型真实开发任务的端到端验证(每个任务涵盖:需求→拆解→代码生成→调试→测试→部署); ④ 明确的版本迭代计划并明确开发优先级。 ⑤ 用户试用反馈(≥5个外部开发团队,附反馈报告)。
项目级
① 可持续合作开发方案(含团队协作规范、CI/CD流程、代码评审机制); ② 项目分级路径及完整的Markdown文档(含架构设计、技术选型、接口规范、权限与审计设计); ③ 人机交互开发全流程:针对一个目标项目(需通过验收),完整记录从需求分析、任务拆解、代码生成、人工修正、回归测试到上线交付的全部交互痕迹; ④ 成果入库材料(如模型文件、知识库、配置模板); ⑤ 后续开发计划(至少包含6个迭代版本的功能规划); ⑥ 支持基于Harness架构的可复用工作流,并提供工作流编排的JSON/YAML定义。

建议奖励规则

成果等级奖励建议说明
作品级3k-1w
① Demo可顺利运行并展示核心功能; ② 至少完成一个简单任务的拆解与代码生成; ③ 提供有效的Prompt工作流原型; ④ 完整的使用说明文档(含环境配置、操作步骤)。
产品级2w-5w
① 工具在实际开发任务中成功生成可运行代码并通过自测; ② 调试与错误定位记录(≥3个错误); ③ 基于任务拆解的产出物(包括但不限于代码、接口文档、数据库ddl,测试用例及测试报告); ④ 部署文档(根据该文档能启动服务)。
商品级5w-10w
① 可部署生产环境的稳定版本(需提供公开访问地址或可安装包或部署包),目标项目通过验收并实际投产使用; ② 提供至少3个典型真实开发任务的端到端验证的证明文件; ③ 系统稳定运行7天,且处理并发请求无异常的证明文件; ④ 用户试用反馈报告“满意度”≥4分(5分制); ⑤ 明确的版本迭代计划并明确开发优先级。
项目级10w-30w
① 提供已完成的完整项目资料(包括但不限于代码、接口文档、数据库ddl,测试用例及测试报告); ② 项目分级路径及完整的Markdown文档,工作流可被第三方团队复用(附使用案例); ③ 人机交互开发全流程证明材料; ④ 提供完整可持续合作方案,确保方案的切实可行,并具备持续迭代能力; ⑤ 提供支持基于Harness架构的可复用工作流编排的JSON/YAML定义。
报名提交成果须遵守知识产权归属约定