AI产品库
SWE-agent Logo

品牌档案

SWE-agent

用接口设计让模型自己修代码

SWE-agent 把语言模型变成能处理真实 GitHub 仓库议题的软件工程智能体:通过为模型专门设计的命令与反馈格式,让它自主浏览代码、编辑文件并运行验证,也支持安全审计与竞赛类自定义任务。

深度介绍

SWE-agent详细介绍

🧭

定位:让模型自己修仓库里的问题

SWE-agent 的目标很明确:让你的语言模型自主使用工具,去修复真实 GitHub 仓库里的问题、查找网络安全漏洞,或完成任意自定义任务。官方给出的研究成绩是:在 SWE-bench 基准上解决了 12.29% 的议题,在当时取得了全量测试集上的最佳表现,并且是开源项目中领先的方案。项目由普林斯顿大学的研究者构建与维护(官方同时提到斯坦福团队参与),论文发表于 NeurIPS 2024。它的两个设计口号是「给模型最大的自主空间」和「为研究而生」。

🤖

ACI:把接口设计当成核心方法

这个项目最有影响的贡献是提出了「智能体-计算机接口」(Agent-Computer Interface,ACI)的概念:不满足于把现成命令行丢给模型,而是专门为模型设计简洁的命令与反馈格式,让浏览仓库、查看文件、编辑代码与执行程序都更容易被模型正确使用。官方给出的结果是,这种接口设计显著提升了任务完成率——也就是说,同样的模型换一套「交互界面」,表现会明显不同。这条结论后来被大量编码 Agent 采纳,是理解这个项目的关键。

🎯

能做什么:从修议题到安全演练

官方列出的用途包括三类:修真实仓库里的问题(最核心的用法)、发现网络安全漏洞(面向进攻性安全场景),以及竞赛类编程任务。除此之外,它被设计成通用框架,任何自定义任务都可以通过配置接进来。模型方面官方称「大概所有模型都支持」,包括本地模型,并且支持多模态模型与图片输入(用于阅读截图等场景)。任务以容器环境为单位运行,因此在 Windows、macOS 与 Linux 上都能用,唯一限制是所需容器镜像是否可得。

📐

配置、轨迹与批处理

官方把「可配置且文档完整」当作卖点:整个智能体由一份 YAML 配置驱动,模型、工具集、模板与历史处理方式都能在其中调整,文档里有配置参考与 API 参考两套说明。面向调试与研究,它提供轨迹检查器,可以回看每一步的命令与反馈,判断失败出在理解、编辑还是验证环节;批处理模式则用于一次跑大量实例,官方另介绍了竞赛场景下的批量运行方式。这些工具决定了它作为研究平台是否好用——能看清过程,才能改进方法。

📦

安装与上手路径

文档给出的入门路径比较友好:可以用 pip 安装,也可以从源码安装;此外还提供「在浏览器中运行」的方式,适合只想先看看效果的人。运行需要模型密钥,文档中有专门的模型与密钥章节,并包含从旧版本迁移到 1.0 的说明与常见问题排查。教程部分从「你好世界」开始,依次覆盖命令行基础、解决编程挑战、轨迹检查器、批处理模式、竞赛运行与添加自定义工具,基本是一条从零到能跑通自定义任务的完整链路。

⚠️

现状:已进入维护模式

使用前需要知道重要变更:官方文档在多处标注 SWE-agent 已被 mini-swe-agent 取代,并说明项目现在处于「仅维护」状态——大部分开发精力已转移到继任项目上。官方给出的理由是继任者「性能相当、但更简单、更灵活」。因此本页把它的定位描述为研究与方法论的起点:如果你要复现论文或研究 ACI 这类接口设计,SWE-agent 仍是直接相关的代码库;如果你只是想要一个能用的编码智能体,官方建议直接看继任项目。

🪶

继任者 mini-swe-agent 的取舍

继任项目的思路是一次反向实验:如果智能体简单一百倍,性能还差不多会怎样?官方给出的答案是——核心代码约一百行 Python(环境、模型与脚本各再加约一百行),除 bash 外不提供任何工具,甚至不使用模型的工具调用接口,因此几乎任何模型都能跑;部署上支持本地环境与多种容器与沙箱方案;模型接入通过通用网关层,兼容多家供应商。官方称其在 SWE-bench verified 上得分超过 74%,启动速度远快于同类商业编码智能体,并已被多家机构采用。

🧩

项目家族与许可

这个项目不是孤立的:官方文档列出同门项目包括继任者 mini-SWE-agent、负责执行环境的 SWE-ReX、用于数据合成的 SWE-smith、被广泛引用的基准 SWE-bench,以及命令行工具 sb-cli。对研究者而言,这套组合覆盖了「造数据—搭环境—跑智能体—评成绩」的完整链路。许可是 MIT,可商用与二次开发;核验时 SWE-agent 仓库约 2.04 万星标,继任者约 7,800 星标。官方在继任项目文档中还提到了一个新的高难度基准 ProgramBench。

产品特点

核心功能与独有价值

01

提出并验证了 ACI 这条路

核心贡献不是某个提示词技巧,而是证明「为模型专门设计的命令与反馈接口」能实质提升编码任务完成率,这一结论影响了后来大量编码智能体。

02

研究血统清晰、可复现

论文发表于 NeurIPS 2024,SWE-bench 成绩与实验设置公开,配合单文件 YAML 配置、轨迹检查器与批处理模式,适合做对照实验与复现。

03

官方明确指向继任者

项目已进入仅维护状态,文档多处建议改用 mini-swe-agent;选型时可以直接对比「复现研究」与「日常使用」两种目的再决定用哪个。

04

MIT 许可且模型无关

许可是 MIT,可商用也可二次开发;支持包括本地模型在内的多种模型,多模态输入同样可用,使用成本仅为所选模型的调用费用。

最近动态

重要更新

进入仅维护状态,继任者取代(核验时点)

官方文档在顶部横幅与 API 参考页明确说明:SWE-agent 已被 mini-swe-agent 取代,继任者在性能相当的前提下更简单、更灵活,因此 SWE-agent 现在处于维护模式,大部分开发精力已转移到继任项目。文档同时引导读者查看继任项目的常见问题,以了解两者的具体差异与迁移方式。

NeurIPS 2024 论文与 SWE-bench 成绩

项目论文的标题是《SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering》,发表于 NeurIPS 2024;官方总览页给出的成绩是:在 SWE-bench 上解决 12.29% 的议题,在当时取得全量测试集上的最佳表现。论文与文档中提出的「智能体-计算机接口」(ACI)是这项工作的主要贡献,也是后来编码智能体的通用设计思路。

继任项目的进展(核验时点)

继任项目文档显示其已迭代到 v2 并提供迁移指南,自我描述是「一百行、但确实有用」的智能体:核心约一百行 Python,除 bash 外不提供工具、也不依赖模型的工具调用接口,支持本地与多种容器沙箱、通过通用网关接入多家模型;官方称在 SWE-bench verified 上得分超过 74%,并已被多家机构采用,同时推出了新的高难度基准 ProgramBench。

产品总结

SWE-agent 是一个把语言模型变成软件工程智能体的开源项目:它让模型自主使用工具,去修复真实 GitHub 仓库里的问题、查找网络安全漏洞,或完成任意自定义任务。官方给出的研究成绩是:在 SWE-bench 基准上解决 12.29% 的议题,在当时取得全量测试集上的最佳表现,并且是开源方案中领先的一个;项目由普林斯顿大学研究者构建与维护(官方同时提到斯坦福团队参与),论文发表于 NeurIPS 2024。 它最有影响的贡献是提出「智能体-计算机接口」(ACI):与其把现成命令行直接丢给模型,不如专门为模型设计简洁的命令与反馈格式,让浏览仓库、查看文件、编辑代码与执行程序都更容易被正确使用;官方称这种接口设计显著提升了任务完成率。用法上支持修议题、安全漏洞挖掘与竞赛编程三类场景,也支持自定义任务、多模态输入与本地模型;任务在容器环境中运行,因此三个主流桌面系统都可用。工程侧强调可配置与可复现:整个智能体由一份 YAML 配置驱动,提供轨迹检查器回看每一步交互、批处理模式一次跑大量实例,文档覆盖安装、模型与密钥、1.0 迁移、教程与 API 参考。 使用前需要了解现状:官方文档多处标注 SWE-agent 已被 mini-swe-agent 取代,项目处于仅维护状态,开发精力已转移到继任者;理由是继任者性能相当但更简单灵活。继任项目的思路是反向实验——核心约一百行 Python,除 bash 外不提供任何工具,也不使用模型的工具调用接口,因而几乎任何模型都能跑,并支持本地与多种沙箱部署;官方称其在 SWE-bench verified 上得分超过 74%,已被多家机构采用。此外,官方还列出同门项目:执行环境 SWE-ReX、数据合成 SWE-smith、被广泛引用的基准 SWE-bench 与命令行工具 sb-cli。项目以 MIT 许可开源,核验时主仓库约 2.04 万星标、继任者约 7,800 星标。若目标是复现研究或理解接口设计,SWE-agent 仍是对口代码库;若目标是直接使用,建议从继任项目入手。

产品类型
软件工程智能体框架
支持平台
命令行(pip 安装) / 源码安装与浏览器内运行 / 云端执行环境 / 容器化沙箱(Docker 等)
资费模式
开源免费(MIT 许可);成本仅为所选模型的调用费用,可接本地模型。

核验信息

参考文章与数据来源

本页事实来自 SWE-agent 与 mini-SWE-agent 官方渠道:SWE-agent 文档首页(继任建议横幅、定位与三项用途、模型与多模态支持、SWE-bench 成绩、配置与文档特性)、项目总览页(ACI 概念与 12.29% 成绩、维护团队与论文引用)、常见问题页(系统支持、配置报错、图片处理与模型支持说明)、API 参考页(维护模式与继任说明),以及 GitHub 仓库(星标数与 MIT 许可);继任项目部分来自其官方文档首页(版本与迁移、采用机构、代码规模、性能口径、部署与模型接入方式、新基准)与仓库页面。价格与状态核验于 2026 年 9 月 22 日。

  1. 官方文档SWE-agent 官方文档
  2. 官方文档项目总览(架构与研究目标)
  3. 官方文档常见问题
  4. 官方文档API 参考(含维护模式说明)
  5. 其他GitHub 仓库
  6. 官方文档继任项目 mini-SWE-agent
  7. 其他继任项目仓库
  8. 其他项目论文

用户体验调查

SWE-agent介绍页面对您是否有帮助?