🤖 AI & LLM (AI & Machine Learning) DeepSWE 이후 AI 코딩 에이전트를 고를 때 벤치마크 숫자만 보면 위험한 이유 2026 2026년 5월 Datacurve가 공개한 DeepSWE는 91개 오픈소스 저장소와 5개 언어에서 뽑은 113개 장기 소프트웨어 엔지니어링 과제로 AI 코딩 에이전트를 평가한다. 공개 리더보드 기준 GPT-5.5 xhigh는 70%, Claude Opus 4.7 max는 …
🤖 AI & LLM (AI & Machine Learning) 에이전트 스킬은 만들기보다 검증이 더 중요하다 2026 — SkillsBench로 본 Claude Code·Codex·Gemini 차이 처음엔 스킬을 많이 만드는 게 핵심이라고 생각했다. SKILL.md 파일을 잘 쓰고, 폴더 구조를 깔끔하게 잡으면 에이전트가 알아서 잘 따라올 거라고. 그래서 40개 넘는 스킬을 만들었다. 블로그 파이프라인, 트레이딩 분석, 온톨로지 …