Skip to content

TECHTAEK

AI를 내 일에 붙이는 실전 작업실

Menu
  • 소개
  • 🛠️ IT & 테크 트렌드 (Tech & IT Trends)

Tag: 벤치마크

🤖 AI & LLM (AI & Machine Learning)

DeepSWE 이후 AI 코딩 에이전트를 고를 때 벤치마크 숫자만 보면 위험한 이유 2026

2026년 5월 Datacurve가 공개한 DeepSWE는 91개 오픈소스 저장소와 5개 언어에서 뽑은 113개 장기 소프트웨어 엔지니어링 과제로 AI 코딩 에이전트를 평가한다. 공개 리더보드 기준 GPT-5.5 xhigh는 70%, Claude Opus 4.7 max는 …

🤖 AI & LLM (AI & Machine Learning)

에이전트 스킬은 만들기보다 검증이 더 중요하다 2026 — SkillsBench로 본 Claude Code·Codex·Gemini 차이

처음엔 스킬을 많이 만드는 게 핵심이라고 생각했다. SKILL.md 파일을 잘 쓰고, 폴더 구조를 깔끔하게 잡으면 에이전트가 알아서 잘 따라올 거라고. 그래서 40개 넘는 스킬을 만들었다. 블로그 파이프라인, 트레이딩 분석, 온톨로지 …

Recent Posts

  • AI 에이전트 프레임워크 3가지 실무 도입 전 비용·보안 비교 2026 — MCP 표준 기준
  • Google Flow AI 건축 쇼츠 만드는 법 2026 – 공식 문서 기반 7단계
  • Google Search Console 생성형 AI 리포트가 생겼다 2026 – 블로거는 무엇을 봐야 하나
  • 그래프 엔지니어링은 언제 필요하고 언제 과한가 2026 – 내 발행 파이프라인에서 찾은 구멍 3개
  • AI로 블로그를 1100편 넘게 자동 발행하고 알게 된 것 2026 — URL 742개 중 86개가 서로 잡아먹고 있었다

Categories

  • 프롬프트 엔지니어링
  • 🍏 애플 & IT 기기 (Apple & Gadgets)
  • 🎉 재미있는 이야기 (Fun Facts & Insights)
  • 💡 How-To & 가이드 (How-To & Guides)
  • 🛠️ IT & 테크 트렌드 (Tech & IT Trends)
  • 🤖 AI & LLM (AI & Machine Learning)
Copyright © 2026 TECHTAEK – OnePress theme by FameThemes