Agent xử lý xong một issue trong benchmark. Nhưng nếu không thể replay lần chạy đó, bạn đang merge một patch hay chỉ đang cược vào may rủi?
Một kết quả benchmark tốt cho thấy agent xử lý được một nhóm task trong một setup cụ thể. Nó chưa trả lời câu hỏi quan trọng hơn: khi chạm vào codebase thật, team có biết agent đã làm gì, vì sao nó sai và chặn nó ở đâu không?
Có thể nhìn một AI coding agent qua 4 lớp B/T/R/G:
– B, Benchmark: agent có giải được task mẫu với tiêu chí rõ ràng không?
– T, Continuous Test: khi codebase hoặc dependency thay đổi, kết quả còn ổn định không?
– R, Trace & Replay: có lưu tool call, trạng thái và log để tái hiện lần chạy không?
– G, Merge/Deploy Gate: patch có qua test, review, policy và workspace cô lập trước khi merge hoặc deploy không?
OpenHands SDK dùng event làm nền cho trạng thái hội thoại và hỗ trợ replay. AgentLab là framework để phát triển và đánh giá web agent qua benchmark, thí nghiệm quy mô lớn và các tính năng reproducibility. Hai ví dụ này gợi ra một cách làm thực tế: xây vòng đánh giá quanh agent, thay vì chỉ nhìn một con số trên leaderboard.
SWE-bench Verified là một bộ đánh giá tĩnh. Khác biệt về release và setup có thể khiến kết quả khó so sánh. Vì vậy, benchmark pass chỉ nên là tín hiệu đầu vào. Quyền merge vẫn cần thuộc về quy trình kiểm thử, truy vết và review của team.
Câu hỏi đáng hỏi không chỉ là “agent đạt bao nhiêu điểm?”. Mà là: “Nếu agent sai, tôi có tái hiện được, giải thích được và chặn được lần chạy đó không?”
Trong quy trình của bạn, lớp nào còn thiếu: B, T, R hay G? Comment một chữ và nói ngắn lý do. Nếu thấy hữu ích, hãy lưu bài viết để dùng khi review AI coding agent và chia sẻ cho người đang cân nhắc merge patch do agent tạo.
#SuijinGreenverse #AIAgent #DevTools #SoftwareEngineering
Nguồn tham khảo:
https://github.com/OpenHands/software-agent-sdk
https://github.com/ServiceNow/AgentLab/blob/main/README.md
https://openai.com/index/introducing-swe-bench-verified/
https://www.swebench.com/verified.html
