🤖 AI & LLM (AI & Machine Learning) DeepSWE 이후 AI 코딩 에이전트를 고를 때 벤치마크 숫자만 보면 위험한 이유 2026 2026년 5월 Datacurve가 공개한 DeepSWE는 91개 오픈소스 저장소와 5개 언어에서 뽑은 113개 장기 소프트웨어 엔지니어링 과제로 AI 코딩 에이전트를 평가한다. 공개 리더보드 기준 GPT-5.5 xhigh는 70%, Claude Opus 4.7 max는 …