Opus 5 모델이 'Artificial Analysis Intelligence Index'에서 종합 점수 61점으로 1위를 기록함
GPT-5.6 Sol Max 모델은 절반의 비용으로 유사한 성능을 보여 비용 효율성 측면에서 주목받음
AA-Omniscience Index는 모델의 지식 신뢰도 및 환각(Hallucination) 측정 지표로 활용됨
커뮤니티에서는 성능 대비 높은 비용과 안전장치(Safeguards)로 인한 제약에 대한 비판적 의견도 존재함
커뮤니티에서는 Opus 5가 최고 성능(Max Effort)을 달성했지만, GPT-5.6 Sol Max 대비 비용이 두 배라는 점을 지적함. GPT-5.6은 약 1~2% 낮은 성능으로 절반의 비용을 제공하여 비용 대비 성능(Performance per Cost) 측면에서 더 매력적이라는 의견이 다수임. 이는 Fable 5 모델의 높은 비용과 함께, 최신 모델들의 가격 책정 전략(Pricing Strategy)에 대한 의문을 제기함.
리더보드 구성 요소 중 하나인 AA-Omniscience Index는 모델의 지식 신뢰도(Knowledge Reliability)와 환각(Hallucination) 발생률을 측정함. 이 지표는 모델의 크기(Model Size) 및 밀도(Density)와 높은 상관관계를 보이며, Gemini 3.x 시리즈가 'big model smell'을 풍긴다는 추측도 제기됨. 이는 단순히 성능 점수뿐 아니라 모델의 신뢰성(Model Reliability) 확보가 중요함을 시사함.
일부 사용자는 Opus 5의 안전장치(Safeguards)가 과도하여 모델의 신뢰성(Reliability)을 저해한다고 비판함. '계란 위를 걷는 듯한(walking on eggshells)' 경험을 피하기 위해 Claude 사용을 줄였다는 의견도 있음. 이는 AI 모델의 유용성(AI Model Utility)이 단순히 벤치마크 점수뿐 아니라, 실제 사용 환경에서의 제약 없는 상호작용(Unrestricted Interaction) 가능성에 달려 있음을 보여줌.
새로운 모델이 출시되자마자 리더보드 상위에 오르는 것은 일시적인 현상(Momentary Popularity)일 뿐이며, 장기적인 데이터(Longitudinal Data) 없이는 의미가 없다는 비판도 제기됨. 또한, 1.5M 및 2M 컨텍스트 창(Context Window)을 가진 모델들의 성능이 컨텍스트 채우기(Context Filling)에 얼마나 영향을 받는지에 대한 궁금증도 나타남. 이는 AI 모델 평가 방법론(AI Model Evaluation Methodology)의 지속적인 개선 필요성을 시사함.