Cheondi

Independent Technology Review

Cheondi Review

Issue 08 August 2026

  • Agent Loop
  • Evals
  • Harness
  • Open Source

Agent Engineering

Codex의 Agent Loop는 어떻게 한 바퀴를 도는가

모델 호출만으로는 에이전트가 움직이지 않는다. 컨텍스트를 만들고 도구 결과를 다시 입력으로 연결하는 하네스의 핵심 흐름을 실제 Codex 코드와 함께 살펴본다.

좋은 모델보다 먼저 필요한 건, 실패했을 때 멈추고 다시 이어갈 수 있는 실행 경계라고 생각한다.

OpenAI Engineering · Michael Bolin ·

Agent Evaluation

AI Agent 평가는 왜 일반 테스트보다 어려운가

여러 번 도구를 호출하고 상태를 바꾸는 에이전트는 한 번의 정답만으로 평가하기 어렵다. transcript와 grader를 어떤 기준으로 나눠야 하는지 읽어볼 만하다.

에이전트 테스트는 정답률보다 어떤 과정과 증거로 결론에 도달했는지를 함께 봐야 한다.

Anthropic Engineering · Anthropic ·

Framework Watch

AI SDK 7과 HarnessAgent의 등장

모델만 바꾸는 추상화를 넘어 Codex와 Claude Code 같은 하네스까지 같은 인터페이스에서 실행하려는 접근을 소개한다.

공통 인터페이스는 시작점일 뿐이고 권한과 복구 방식의 차이는 어댑터 밖으로 숨기면 안 된다.

Vercel · Gregor Martynus 외 4명 ·

Source Code Shelf

이번 호와 함께 펼쳐볼 저장소

OpenAI Rust

openai/codex

로컬에서 실행되는 코딩 에이전트의 실제 하네스와 도구 실행 흐름을 읽을 수 있다.

저장소 보기

Vercel TypeScript

vercel/ai

여러 모델과 에이전트 실행 방식을 하나의 TypeScript 인터페이스로 다루는 구현을 확인할 수 있다.

저장소 보기

Anthropic Python

anthropics/anthropic-cookbook

도구 사용과 평가 방식을 직접 실행해 볼 수 있는 예제와 노트북을 모아 둔 저장소다.

저장소 보기

Cheondi's Desk

Editor's Note

AI 에이전트 개발의 현실적인 도입 순서

Agent Loop, 평가, 하네스를 실제 개발 흐름에 붙인다면 어느 단계부터 시작해야 할지 정리한 기록이다.

참고 자료 3개 · 코드 저장소 3개

개인 기록 읽기

직접 읽고 고른 글을 짧게 소개합니다. 원문의 저작권은 각 작성자와 발행처에 있으며, 전문 대신 출처와 연결되는 독서 메모만 남깁니다.