Methodology

평가 방법

samebrief는 점수만 보여 주지 않습니다. 같은 조건에서 나온 원문 결과물, 실행 정보, 평가 근거를 함께 공개합니다.

점수와 수정 부담

다섯 항목은 각각 10점 만점이며, 총점은 50점 만점의 단순 합계입니다. 수정 부담은 총점에 넣지 않고 낮음, 보통, 높음과 구체적인 수정 내용으로 별도 표시합니다.

정확성10점
요구사항, 사실, 기술적 조건을 충족하는지 확인합니다.
완성도10점
빠진 부분 없이 바로 검토할 수 있는 결과물인지 봅니다.
실무성10점
현업에서 추가 작업을 거쳐 사용할 수 있는 수준인지 판단합니다.
가독성10점
결과물의 구조가 명료하고 읽거나 유지하기 쉬운지 살핍니다.
효율성10점
보존된 재시도·후속 지시·사람 개입과 산출물의 변경 범위·복잡도·검증 가능성이 과업에 비해 합리적인지 봅니다. 시간·토큰·비용은 실제 기록이 있을 때만 보조 근거로 사용합니다.

효율성은 결과가 짧거나 테스트 수가 적다는 이유만으로 높게 평가하지 않습니다. 요구사항을 충족하는 데 필요한 구현·검증 범위와 실행 과정의 불필요한 반복을 함께 보고, 서로 다른 실행 표면에서 보존하지 않은 시간·토큰·비용은 추정해 비교하지 않습니다.

자동화 중심의 평가

새 비교의 기본 점수와 추천은 사전에 정의한 체크리스트와 실행·검증 기록을 근거로 만듭니다. 선택적 편집자 검토는 보조 근거로만 표시합니다. 자동 산출 기록이 남아 있지 않은 초기 글은 ‘초기 편집 평가’로 분리해 공개합니다.

각 글은 정적 검토, 로컬 테스트, E2E 검증 중 실제로 수행한 검증 수준을 표시합니다. 체크리스트 기반 평가는 정적 검토에서 정확성·실무성 각 8점, 로컬 테스트에서 각 9점까지만 줄 수 있으며, E2E 검증을 거친 경우에만 10점이 가능합니다. 원문만 보존된 비교는 원문·메타데이터 정적 검토로 표시하며, 별도 실행하지 않은 테스트를 통과로 기록하지 않습니다. 수동 확인 항목은 실제로 수행했을 때만 표시합니다.

공통 조건 공개

각 비교 글에는 공통 프롬프트, 해당 과업에서 실제 실행한 모델과 버전, 요금제, 실행일, 환경을 기록합니다. 새 비교에서는 실행 표면, 추론 설정, 도구, 재시도, 후속 지시, 사람 개입도 함께 남깁니다. 세부 실행 기록이 보존되지 않은 초기 글은 그 사실을 명시합니다.

원문을 읽는 방법

상세 페이지에서는 짧은 요약과 점수를 먼저 확인할 수 있고, 모델별 원문 페이지에서 전체 결과를 검토할 수 있습니다. 큰 코드 작업은 테스트와 변경 요약을 우선 제공한 뒤 전체 파일로 연결합니다.