자유게시판

11개 프런티어 모델 버그 찾기 벤치마크 결과

ㅎㄹㅎ· 2026.08.04 04:52· 조회 211
출처 : (1) X에서 Paweł Huryn 님 : ""A new bar for coding." I ran Qwen3.8-Max through my bug bench: two real repos, 105 hidden bugs, 15 runs across 11 frontier models, all judged blind. Final score: 19/105. GPT-5.6 Sol leads at 42. Kimi K3 and Opus 5* 21 at the same effort level. Qwen did fix one bug none https://t.co/Mx4F7ZAKAz" / X 파벨 후린이라는 AI 뉴스레터 사장이 본인이 만든 버그 벤치마크를 통해 11개 프런티어 모델을 동일 조건하에서, 105개 숨어 있는 버그를 찾는 명령을 내렸고 결과는 이미지와 같이 나왔습니다. GPT 5.6 Sol(max) 70달러, 163분, 42개 수정. GPT 5.6 루나(max) 1.8달러, 85분, 33개 수정. Fable 5(max) 105달러, 57분, 29개 수정. Opus 5(max) 51달러, 60분, 27개 수정. Kimi K3(high) 25달러, 108분, 21개 수정. Qwen3.8-Max(high) 31달러, 148분, 19개 수정 Grok 4.5 8달러, 25분, 19개 Qwen은 다른 열 개 모델에서 찾지 못한 버그를 수정했으나, 실행만 하는데 5번 시도를 했고 한 코딩 에이전트가 30분만에 5시간 쿼터를 사용해버렸다고 합니다. 수작업으로 표를 해석하고 글을 쓰다가 AI 한테 저 이미지를 돌려보면 바로 분석 결과를 알려줄텐데 참... 바보 같습니다. AI 이미지 분석 결과는 아래와 같아요. 🏆 시간/비용 종합 효율 TOP 5 모델 1위: GPT-5.6 Luna (effort MAX) — 압도적인 종합 1위 해결한 버그: 64개 (3위) 비용/시간: $1.80 / 85분 44초 평가: 버그를 64개나 찾아내는 최상위권 성능을 보여주면서도, 비용은 단 $1.80밖에 들지 않았습니다. 버그 1개를 찾는 데 약 $0.028, 약 1.34분이 소요되어 성능과 비용의 밸런스가 가장 완벽한 모델입니다. 2위: GPT-5.6 Luna (high) — 극강의 저비용 모델 해결한 버그: 35개 비용/시간: $0.57 / 64분 5초 평가: 전체 15개 테스트 중 비용이 가장 저렴($0.57)합니다. 버그 1개를 찾는 데 약 $0.016밖에 들지 않아, 가벼운 작업에서 비용을 아끼고 싶을 때 최고의 선택입니다. 3위: Grok 4.5 (high) — 최고의 속도(시성비) 모델 해결한 버그: 23개 비용/시간: $8.40 / 24분 52초 평가: 테스트된 모델 중 가장 빠른 시간(약 24분) 안에 벤치마크를 끝냈습니다. 버그 1개당 소요 시간이 약 1분 8초 수준으로 가장 짧으며 비용도 합리적이라 빠른 결과가 필요할 때 탁월합니다. 4위: GPT-5.6 Sol (high - re-run) — 고성능 모델 중 최고의 효율 해결한 버그: 62개 (2위) 비용/시간: $33.92 / 66분 40초 평가: 최고 성능 모델인 Sol (MAX) 버전이 비용 $69.61에 163분이 걸린 반면, 이 옵션은 버그 해결 수는 62개로 비슷하게 유지하면서 시간과 비용을 절반 수준으로 획기적으로 줄였습니다. 5위: DeepSeek V4-Flash — 준수한 초저가 모델 해결한 버그: 14개 비용/시간: $1.52 / 48분 28초 평가: 찾아낸 버그의 절대적인 개수는 적지만, 비용이 $1.52로 두 번째로 저렴합니다. ⚠️ 추천하지 않는 비효율적인 모델 (워스트 2) 가장 비싼 모델 (비용 비효율 1위): Fable 5 (effort MAX) 버그를 34개 찾았으나, 비용이 $104.49로 전체 모델 중 압도적으로 가장 비쌉니다. (비슷한 성능인 GPT-5.6 Luna(high)의 비용이 $0.57인 것과 대조적입니다.) 가장 느린 모델 (시간 비효율 1위): Qwen3.8-Max 버그 25개를 찾는 데 무려 148분 7초가 걸렸습니다. 비용($31.10) 대비 너무 많은 시간이 소모됩니다. 📊 전체 모델 1버그당 효율 순위표 (기준: 1버그당 소요된 비용이 저렴한 순서) 순위 모델명 (옵션) 1버그당 비용 1버그당 시간 총 해결 / 총 비용 / 총 시간 1 GPT-5.6 Luna (high) $0.016 1.83분 35개 / $0.57 / 64m 5s 2 GPT-5.6 Luna (effort MAX) $0.028 1.34분 64개 / $1.80 / 85m 44s 3 DeepSeek V4-Flash $0.108 3.46분 14개 / $1.52 / 48m 28s 4 Grok 4.5 (high) $0.365 1.08분 (최단) 23개 / $8.40 / 24m 52s 5 DeepSeek V4-Pro $0.503 2.51분 11개 / $5.54 / 27m 37s 6 GPT-5.6 Sol (high - re-run) $0.547 1.08분 62개 / $33.92 / 66m 40s 7 GPT-5.6 Sol (effort MAX) $0.848 2.00분 82개 (최다) / $69.61 / 163m 48s 8 Kimi K3 (high) $0.935 3.99분 27개 / $25.27 / 107m 48s 9 Sonnet 5 (high) $1.163 2.53분 13개 / $15.12 / 32m 53s 10 Qwen3.8-Max $1.244 5.92분 (최장) 25개 / $31.10 / 148m 7s 11 Opus 5 (high) $1.435 1.38분 27개 / $38.77 / 37m 20s 12 Opus 5 (effort MAX) $1.770 2.07분 29개 / $51.33 / 59m 58s 13 Opus 4.8 (high) $1.935 3.49분 10개 / $19.35 / 34m 52s 14 Fable 5 (high) $2.521 1.16분 27개 / $68.08 / 31m 20s 15 Fable 5 (effort MAX) $3.073 1.68분 34개 / $104.49 (최고가) / 57m 15s
댓글 0
첫 댓글을 남겨보세요.
뻐끔에 광고를 원하시나요?
전자담배·베이프 타깃 커뮤니티. 배너·제휴 문의를 받습니다.
광고 문의brand.partners.kr@gmail.com