Part III: GPT-5.5 시대의 Codex 실전 가이드

Chapter 8: GPT-5.5 출시 후 — 커뮤니티가 발견한 패턴

집필일: 2026-04-28 최종수정일: 2026-06-11

8.1 하나의 호: 4월 16일 → 4월 23일 → 첫 한 달

7장은 4월 23일 GPT-5.5의 Codex 착지로 끝났다. 하지만 커뮤니티가 왜 그렇게 반응했는지 이해하려면 4월 23일이 아니라 4월 16일에서 시작해야 한다.

Opus 4.7이 4월 16일에 "fewer subagents by default" 변경과 함께 출시됐을 때, 단순한 기능 변경이 아니었다 — 모호성 세금을 만들어냈다. 7일 동안 4.6에서 작동하던 프롬프트가 이제 명시적 지시를 요구한다는 것을 발견한 개발자들이 r/ClaudeAI, HN, X에 불만을 쌓아갔다 [14].

그 7일 후, 4월 23일에 GPT-5.5가 Codex에 탑재되어 등장했다. Reddit 500개 이상의 댓글 종합 [1]이 내놓은 핵심 문장: "Claude Code는 품질이 더 높지만 쓸 수가 없다. Codex는 품질이 약간 낮지만 실제로 쓸 수 있다."

"쓸 수가 없다"는 말은 4월 23일에 생겨난 게 아니다. 4월 16일에 씨앗이 뿌려진 것이다.

이미 2025년 9월부터, Codex 채택 가속기가 시작될 때 Sam Altman은 같은 우려를 표한 바 있다 [2]: "Codex에 유리한 Reddit 분위기가 매우 가짜처럼 느껴진다."

두 관측이 동시에 맞을 수 있다. 모호성 세금 불만은 진짜이고 유기적이었다; Codex 열광의 일부는 증폭됐을 수 있다. 이 챕터는 두 관점을 모두 열어두고, 독립적으로 검증된 실용적 패턴에 집중한다 — Reddit 투표가 아니라.

소스 사용에 대한 메모. 이 챕터는 2026년 4~5월의 Reddit 쓰레드, HN 토론, X 포스트를 인용한다. 이 소스들은 눈을 뜨고 사용한다. Sam Altman은 2025년 9월 Codex에 유리한 Reddit sentiment가 "매우 가짜처럼 느껴진다"고 표한 바 있으며 [2], 그 우려는 GPT-5.5 출시와 함께 사라지지 않았다. 코퍼스에 조직적으로 증폭된 목소리가 섞여 있을 수 있다. 아래의 레시피는 각각 독립적 실험이나 여러 소스의 수렴으로 뒷받침되며, Reddit 투표 수만으로는 포함하지 않았다. 커뮤니티 sentiment에만 의존하는 소스는 그렇게 표시한다.

2026-04-28 이후 1주 업데이트

이 책의 초판이 2026-04-28에 만들어진 뒤, 2026-04-30의 Codex CLI 0.128.0이 가장 중요한 업데이트였다. 공식 changelog 기준 변화는 다섯 가지다 [19]:

  • persisted /goal workflows: 목표 생성, pause, resume, clear, runtime continuation
  • permission profiles: built-in defaults, sandbox CLI profile selection, cwd controls
  • plugin workflows: marketplace install, remote caching, plugin-bundled hooks
  • external agent session import: background import와 imported-session title handling
  • MultiAgentV2 설정 명시화: thread cap, wait time, root/subagent hints, depth handling

Simon Willison은 /goal을 "Ralph loop의 Codex 내장 버전"으로 해석했다 [10]. 커뮤니티 실험도 같은 방향을 가리켰다. 5월 1일 Tecton & Tide의 실험은 /goal이 긴 pause 이후에도 목표 상태를 보존하고 재개될 수 있음을 보고했다 [17]. 단, 이 기능은 "무조건 오래 맡기라"는 신호가 아니다. 검증 기준이 분명한 작업, 예를 들어 테스트 통과·체크리스트 완료·문서 일괄 정리처럼 done condition이 명확한 작업에서만 안전하다.

2026-06-11 업데이트: 사용 경험은 표면 선택으로 이동했다

5월 이후의 공식 업데이트는 Codex 사용 경험을 "CLI에서 프롬프트를 치는 일"보다 넓게 만들었다. Chrome extension은 로그인된 브라우저 상태가 필요한 웹앱 작업을 열었고, remote/mobile access는 Mac/Windows host의 프로젝트·파일·credential·plugin·skill·config를 모바일에서 이어 쓰게 했다. Goal mode는 App/IDE/CLI 공통 표면이 되었고, Sites는 웹앱 preview/deploy를 Codex app 안으로 끌어왔다 [19]. 따라서 실전 패턴도 바뀐다. 이제 질문은 "Codex가 좋은가?"가 아니라 "이 작업에는 CLI, Local, Worktree, Cloud, Chrome, Computer Use, Sites 중 어느 표면이 맞는가?"다.

8.2 레시피 1: 하이브리드 사용 — Claude(설계·하네스) + Codex(구현·검증)

가장 많이 보인 패턴은 "갈아타기"가 아니라 역할 분담이다.

  • Claude Code: 설계, 하네스 작성(CLAUDE.md / AGENTS.md 초안), 아키텍처 리뷰
  • Codex: 구현, 리팩터링, 테스트 생성, 자율 장기 태스크

Mejba Ahmed의 실험 [4]이 이 패턴의 극단적 버전이다: Codex를 Claude Code의 서브에이전트로 실행. Addy Osmani의 "Code Orchestra" [5]는 멀티모델 라우팅으로 확장한다 — 계획에는 cheap 모델, 구현에는 frontier, 보안 리뷰에는 전용 모델.

실제 적용:

  1. Claude Code에서 기존 하네스의 목적과 제약을 HANDOFF.md로 정리한다
  2. 범용 규칙만 AGENTS.md로 옮긴다. .claude/CLAUDE.md는 삭제하지 않는다
  3. Codex CLI를 Read Only로 시작해 계획만 받는다
  4. 작은 구현 태스크 하나를 실행한다
  5. /diff, /review, 테스트를 확인한다
  6. 필요하면 Claude Code로 다시 리뷰한다
Figure 8.1: 하이브리드 워크플로우 — Claude(설계) → AGENTS.md 커밋 → Codex(구현) → Claude(리뷰). 다른 에이전트가 검토하니 맹점이 줄어든다. illustration by author Gemini assisted

8.3 레시피 2: 비용 인식 멀티모델

모든 작업에 frontier 모델을 쓰는 것은 낭비다. 커뮤니티가 수렴한 3-tier 전략:

Tier 1 (계획, 설계): cheaper/faster 모델 또는 lower effort

Tier 2 (구현): frontier 모델 (GPT-5.5, Opus 4.7)

Tier 3 (보안, 리뷰): 전용 작업 지시가 있는 서브에이전트

Luong의 "Local LLMs with Frontier" 가이드 [6]는 더 급진적 버전: Tier 1에 local LLM(llama, deepseek-coder)을 쓰고, Tier 2에만 API를 쓴다. 비용을 70-80% 줄일 수 있다는 보고다.

Osmani의 접근 [5]: 같은 태스크에 3개 모델을 라우팅하고 결과의 신뢰도가 높을 때만 merge한다.

Figure 8.2: 비용 인식 3-Tier 전략 — Tier 1 계획용 cheap/local, Tier 2 구현용 frontier, Tier 3 리뷰 전용 서브에이전트. 70-80% 비용 절감 보고. illustration by author Gemini assisted

8.4 레시피 3: Sandbox-first 기본값

GPT-5.5 출시 후 한 달간 가장 많이 공유된 설정 [7]:


sandbox_mode = "workspace-write"
approval_policy = "on-request"

Branch-per-task가 기본 안전망이다. 각 태스크가 독립 브랜치에서 실행되므로, 잘못된 변경은 main을 건드리지 않는다.

실패 사례: Codex GitHub issue #11354 [8]. 서브에이전트가 실행 중 특정 조건에서 무한 루프에 빠지는 버그. 이 버그의 존재는 두 가지를 말해준다: (1) Codex의 서브에이전트 시스템은 아직 초기 단계이고, (2) approval_policy = "on-request" 설정이 이런 케이스에서 구명줄이 된다.

Figure 8.3: Sandbox-first 기본값 — workspace-write + on-request가 워크스페이스 경계, 브랜치 격리, 실패 게이트, 되돌림 경로 4중 안전망을 만든다. illustration by author Gemini assisted

8.5 레시피 4: 자신의 벤치마크를 믿지 마라

MorphLLM의 결과 [3]:

  • Terminal-Bench: Codex 77.3 > Claude Code 65.4
  • 블라인드 리뷰 선호도: Claude Code 67% > Codex 25%

벤치마크에서 이긴 도구가 실제 사람이 선호하는 출력을 내지 않는다. 자신의 작업에서 직접 측정하지 않은 벤치마크는 참고만 한다.

실용적 방법: 자신이 실제로 하는 태스크 3-5개를 선정하고, 두 도구로 실행한 결과를 직접 비교한다. 자신의 맥락에서의 선호가 어떤 벤치마크보다 더 정확한 지표다.

8.6 CLI/App/Cloud 표면 선택

2026-05-04 기준으로 가장 실용적인 구분은 CLI/App/Cloud다 [19]. CLI는 기존 로컬 repo를 가장 자연스럽게 이어받는다. App의 Local/Worktree 모드는 같은 컴퓨터에서 foreground 작업과 격리된 worktree 작업을 나눈다. Cloud는 랩탑을 닫아도 계속 돌아가야 하는 unattended 작업에 맞다.

목적 권장 표면
기존 Claude Code repo를 처음 읽고 작은 diff 만들기 Codex CLI
같은 repo에서 독립 실험을 병렬로 돌리기 Codex app Worktree
평소 IDE/개발서버에서 직접 검증하기 Codex app Local 또는 CLI
랩탑을 닫아도 계속 돌아가야 하는 작업 Codex Cloud
GitHub/Slack/Linear와 이어지는 운영 흐름 Codex Cloud + integrations
로그인된 SaaS나 내부 웹앱 검증 Codex Chrome extension
desktop 앱/OS UI가 필요한 확인 Computer Use
웹앱 초안·preview·배포 실험 Sites
같은 thread를 모바일에서 점검·steer Remote/mobile Codex

Claude Code의 /remote-control 경험을 Codex CLI 하나로 그대로 기대하면 안 된다. 그 목적은 Codex Cloud나 GitHub/Slack/Linear integration 쪽에 가깝다.

이 표면 선택은 비용·권한·감사 가능성과 연결된다. 연구 사례에서도 비슷한 신호가 나온다. Einstein Telescope 시뮬레이션 비교 논문은 Claude Code가 더 빠르게 결과를 냈지만 silent deviation을 보였고, Codex는 더 오래 걸리되 self-correcting restart와 literal specification following을 남겼다고 보고했다 [20]. 단일 과학 워크플로우 사례라 일반화하면 안 되지만, Codex의 강점을 "빠름"이 아니라 "감사 가능한 느린 경로"로 보는 데 도움이 된다.

8.7 방법론적 정직성: Altman의 경고를 진지하게 받아들이기

Sam Altman의 "가짜 봇 느낌" 발언 [2]은 단순한 경쟁사 비방이 아니다. 이것은 커뮤니티 sentiment를 소스로 쓸 때의 방법론적 주의다.

이 책이 Reddit / HN / Medium에서 인용하는 "커뮤니티 반응"은 선택적 표본이다. 조직적으로 증폭된 목소리가 섞여 있을 수 있다. 이 챕터의 레시피들은 "커뮤니티가 이렇게 말했다"가 아니라 독립적 실험([4])이나 여러 소스의 수렴([5], [6])에 기반한 것만 포함했다.


참고문헌

  1. Dev.to, "Claude Code Reddit 500+ comments synthesis," 2026. [contributor, 2026]
  2. Altman, Sam, "Fake bots on Reddit," X, 2025-09-08. [News, 2025]
  3. MorphLLM, "Codex vs Claude Code Benchmark," 2026. [MorphLLM, 2026]
  4. Mejba Ahmed, "I ran Codex inside Claude Code," 2026. [Ahmed, 2026]
  5. Osmani, Addy, "Code orchestra — multi-model routing," 2026. [Osmani, 2026]
  6. Luong, "Local LLMs with frontier models — 3-tier setup," 2026. [NGUYEN, 2026]
  7. Zack Proser, "Codex daily-use review," 2026. [Proser, 2026]
  8. GitHub, "Codex subagents issue #11354," 2026. [contributors, 2026]
  9. OpenAI, "Codex app features — Local, Worktree, Cloud," 2026. [OpenAI, 2026]
  10. Willison, Simon, "Codex CLI 0.128.0 adds /goal," 2026-04-30. [Willison, 2026]
  11. Matthew Berman, "GPT-5.5 two-week prerelease review," 2026. [Berman, 2026]
  12. LLM Stats, "GPT-5.5 vs Opus 4.7," 2026. [Stats, 2026]
  13. Intuition, "Codex as superapp," 2026. [IntuitionLabs, 2026]
  14. MerchMind, "Claude Opus 4.7 Backlash Explained," 2026. [AI, 2026]
  15. Xlork, "Why Developers Are Frustrated with Opus 4.7," 2026. [Blog, 2026]
  16. OpenAI, "Codex CLI changelog — 0.128.0," 2026-04-30. [OpenAI, 2026]
  17. Tecton & Tide, "/goal: The Six-Hour Codex Run That Survived a Five-Hour Pause," 2026-05-01. [Tecton & Tide, 2026]
  18. OpenAI, "Codex changelog," 2026. [OpenAI, 2026]
  19. OpenAI, "Codex Chrome extension," 2026. [OpenAI, 2026]
  20. researchers, "Comparing Claude Code and Codex on Einstein Telescope simulation," arXiv, 2026. [researchers, 2026]