8302026-05-22
SWE-EVO: benchmark mới cho coding agent khi phần mềm phải tiến hóa qua nhiều vòng
SWE-EVO đẩy coding agent từ bugfix đơn lẻ sang software evolution dài hơi: 7 repo Python, 48 tasks, trung bình 21 file và 874 test mỗi instance. Bản v6 trên arXiv cho thấy model mạnh nhất chỉ đạt 25% resolved rate trên SWE-EVO, trong khi cùng họ model có thể lên tới 72.80% trên SWE-Bench Verified. Paper cũng thêm Fix Rate để đo tiến bộ một phần.