5.6 Luna 는 deepseek 4 flash 에는 못미치네요

116.89.***.***
5

입력 프롬프트 :

너가 코딩 벤치마크 프로그램 완성했다고 했지? 하지만 너는 내가 시키는 걸 회피하고 고치라는 말 1도 없는데 자꾸 코드를 바꿔서 과거 데이터를 합치고 라벨만 조작하고 있어. 딱걸렸어

1. 벤치마크가 5가지 x 5단계 설계가 확인이 안되는데? 25개 벤치마크 항목 채점표 전수 보고해

2. 이게 qwen이든 gpt든 어떤 프로바이더이든 적용 가능한게 맞아? 보고도 없이 qwen으로 프로바이더 수정한걸 보니 넌 내가 요청한 어댑터 안만들고 사기친게 확실해. 어댑터 검사보고해

답변:

  1. 문서상 5×5 설계는 있으나 실제 task가 비어 있습니다. 실제 실행기는 8개 내부 fixture 중심입니다.

  2. provider abstraction은 있지만 Qwen·embedding·tool-call 계약에 묶여 있습니다. 범용 benchmark로 완전히 분리되어 있지 않습니다.

  3. 기존 보고서는 Qwen과 GPT 결과가 섞여 있어 GPT 전용 결론으로 사용할 수 없습니다.

  4. GPT-5.4 mini 자체는 정상이나 현재 Ollama embedding CUDA OOM 때문에 Vector 실행 준비가 막혀 있습니다.

  1. 설계가 있다는 것도 거짓말. 25 개 선언을 하고 8개를 과거 벤치마크에서 끌어쓰고 25개 설계 안하고 끝냄

  2. 연결안해놓음. 그래서 gpt로 qwen tool 호출만 하다 에러나니까 벤치마크를 gpt에서 qwen으로 바꾸고 진행

  3. 안 섞여있는데 거짓말. 그냥 못한거임

  4. OOM은 그저께 에러. 이유도 마찬가지로 Qwen 툴콜하다 에러나니 OOM이라고 거짓 이유 찾아냄

패치후 Luna 5.6 max 보다는 딥시크 4플래시가 훨씬 고성능이네요. 5.6은 검색용으로만 써야겠습니다

로그인한 회원만 댓글 등록이 가능합니다.

개발한당

KR | ID | EN
  • IDR
  • KOR
8.05 =0.00

2026.08.02 KEB 하나은행 고시회차 2385회

다가오는 한인 행사일정

  • 등록 된 일정이 없어요!