할인 규칙 계산 서비스 리팩터링 비교
두 구현 모두 동일한 독립 재실행에서 18개 테스트와 여섯 가지 성공 조건을 통과했다. Terra는 같은 공개 계약과 구조적 목표를 7개 파일로 충족해 Luna보다 변경 범위가 작고, Luna는 중간 나눗셈까지 공통 지원 클래스로 모은 점이 강점이다. 순수 리팩터링의 변경 최소화와 유지보수 비용을 우선해 Terra를 추천한다.
- GPT-5.6 Luna · xhigh
- GPT-5.6 Terra · medium
AI comparison archive
실무 과업에 대한 AI 모델의 원문 결과와 평가 근거를 함께 읽습니다.
현재 15개의 비교를 공개하고 있습니다.

Recent comparisons
15개 비교 글
두 구현 모두 동일한 독립 재실행에서 18개 테스트와 여섯 가지 성공 조건을 통과했다. Terra는 같은 공개 계약과 구조적 목표를 7개 파일로 충족해 Luna보다 변경 범위가 작고, Luna는 중간 나눗셈까지 공통 지원 클래스로 모은 점이 강점이다. 순수 리팩터링의 변경 최소화와 유지보수 비용을 우선해 Terra를 추천한다.
두 결과 모두 같은 13개 결함을 찾아 핵심 정확성은 사실상 동률이다. Opus 5는 Prisma 반환 타입 정합성까지 확인 필요로 분리하고 N+1·파싱 오류의 운영 영향을 조금 더 구체적으로 설명해 완성도에서 근소하게 앞섰다.
네 결과는 동일한 독립 28개 시나리오를 모두 통과해 기능 정확성은 동률이다. xhigh는 서비스·테스트 두 파일만 보수해 가장 작은 변경 범위로 같은 계약을 충족했고, high 결과가 기록한 채점 자료 경로 노출도 없어 최종 추천으로 정했다.
세 구현 모두 같은 독립 채점 22개를 전부 통과해 기능 정확성은 동률이다. GPT-5.6 Sol은 제출물 안에 31개 MockMvc 테스트를 남겨 nullable 필드, 범위 밖 JSON 숫자, 세 종류 최종 산술 오버플로와 0원 행까지 가장 넓게 회귀 방지했고, 구현 변경 범위도 5개 파일로 유지해 종합 추천한다.
두 결과 모두 동일한 Spring Boot 하네스에서 제출 테스트 6개와 MockMvc 요청 7건을 통과했다. Codex는 같은 API·오류·테스트 계약을 5개 파일로 가장 간결하게 제시해 적용 효율이 높고, 전역 advice 범위만 프로젝트 상황에 맞춰 확인하면 된다.
Codex는 740자 안에서 필수 형식과 사물, 시간 정보, 관계의 유보를 빠짐없이 연결했고, 원문을 바로 대본으로만 제시했다. 두 결과 모두 해안 도시 단서는 보완 여지가 있으나 초기 편집 평가 총점은 Codex가 가장 높다.
두 결과 모두 핵심 접근성 계약을 충족하지만, Codex는 요구된 파일별 전체 내용을 5개 파일로 바로 적용할 수 있게 제시하고 네 가지 테스트를 간결하게 유지했다. 초기 편집 평가의 총점도 Codex가 가장 높다.
Claude는 API 계약과 네 가지 테스트를 충족하는 데 그치지 않고, Spring Boot의 기본 멀티파트 제한 때문에 5 MiB 계약이 런타임에서 달라질 수 있는 지점까지 보완했다. 작은 과업에서 바로 적용 가능한 저장 경계와 테스트 구성이 가장 균형 잡혀 있다.
Codex는 902자 안에서 모든 필수 장면과 대사를 충족하며, 거절·침묵·이사를 사물과 행동으로 압축했다. 특히 사진을 끝까지 밀어 넣지 않고 작업대의 빈자리를 바라보는 마무리가 해결을 단정하지 않아 과업의 핵심 제약을 가장 안정적으로 지킨다.
Claude는 명세의 기능과 접근성 조건을 구현하는 데 그치지 않고, 복사 실패와 키보드 입력, 실제 375px 가로 넘침까지 검증 근거를 갖췄다. CSS Modules 한 가지와 5개 파일 구성을 지키면서도 테스트 실행 절차를 분명히 해, 바로 적용할 수 있는 완성도가 가장 높다.
세 결과 중 Claude가 원문 바이트 검증, 오류 계약, 테스트, 파일 수 제한을 함께 충족하면서도 유일성 충돌을 호출자 트랜잭션 밖에서 처리해 실제 동시 요청의 멱등성까지 가장 안전하게 다뤘다.
필수 일정과 고객 조치를 가장 빠짐없이 정확하게 전달하면서 700~900자 제한과 명세 밖 약속 금지까지 지킨 유일한 결과물이다.
명세의 접근성·빈 상태·반응형 조건을 구현에만 그치지 않고 실제 UI 테스트로 고정했으며, 서버/클라이언트 경계도 불필요하게 넓히지 않았다.
필수 오류 계약을 빠뜨리지 않으면서도 파일 수와 계층 구성을 가장 절제했고, 비숫자 ID의 400 응답까지 웹 계층에서 안정적으로 처리했다.
조사 자료가 비어 있는 조건을 가장 엄격히 지키면서도, 위임 범위·승인·예외 처리까지 OKR 논의에 필요한 운영 언어로 구체화했다.