4가지 비전 모델을 대상으로 색연필 도구를 이용한 드로잉

7장의 그림을 그리는 데 160달러를 소모하며 GPT-5.6 Sol($7.74)보다 20배 높은 비용을 기록한 Claude Fable 5를 포함해, 모델들이 자가 수정(`view_canvas`)을 반복할수록 초기 피크 성능에서 하락하는 결과가 나타났다. 단순한 리뷰 횟수 증가가 최종 품질 향상으로 이어지지 않는다는 사실은 모델의 반복 수정 프로세스가 효율적으로 작동하지 않음을 입증한다.

실험은 GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash 등 4가지 비전 모델을 대상으로 색연필 도구를 이용한 드로잉 능력을 테스트하는 'drawing arena' 방식으로 진행되었다. 모델들은 색상, 팁 너비, 압력을 설정해 선을 긋거나 문지르고 지우는 도구를 사용했다. `view_canvas`를 통해 자신의 작업물을 확인하며 수정 지점을 결정했으며, 2개의 타겟 이미지와 5개의 텍스트 프롬프트를 조합해 총 28개의 그림을 생성했다.

모든 타겟 실행에서 최종 그림의 점수는 실행 중 도달한 최고점보다 낮게 측정되었다. Gemini 3.6 Flash는 모나리자 작업에서 0.449의 최고 SSIM(Structural Similarity Index Measure, 구조적 유사도 지수) 점수를 기록한 뒤 최종적으로 0.337까지 하락했다. GPT-5.6 Sol 역시 모나리자 작업에서 0.352의 피크 점수를 기록했으나 최종 결과물은 0.325에 그치며 조기에 정체기에 도달했다.

드로잉 비용이 다른 모델들에 비해 압도적으로 높게 나타났다

7장의 그림을 생성하는 데 소요된 비용이 모델별로 최대 20배까지 벌어졌다. Claude Fable 5는 약 160달러의 추정 비용을 기록하며 가장 높은 지출을 보였다. 이는 GPT-5.6 Sol의 7.74달러, Grok 4.5의 9.21달러, Gemini 3.6 Flash의 12.87달러와 비교해 약 20배 비싼 수준이다. 작업 결과물의 양은 동일하지만, 모델에 따라 운영 비용의 격차가 극심하게 발생한다.

수치적 유사도 점수가 실제 사람이 느끼는 시각적 품질과 일치하지 않는 결과가 나왔다. Gemini 3.6 Flash가 두 타겟의 최종 점수와 피크 점수 모두에서 가장 높은 raw SSIM(Structural Similarity Index Measure, 두 이미지의 구조적 유사도를 측정하는 지표) 점수를 기록했다. 정량적 지표만으로 판단하면 Gemini 3.6 Flash가 타겟 이미지와 가장 유사한 결과물을 생성했다.

하지만 실제 시각적 품질과 디테일 면에서는 GPT-5.6 Sol이 압도적인 우위를 점했다. 특히 별이 빛나는 밤과 장미 그림에서 GPT-5.6 Sol은 전체 배치 중 가장 선호되는 결과물을 만들었으며, 거의 모든 그림의 디테일에서 다른 두 모델을 앞섰다. 수치상의 유사도가 반드시 사용자가 체감하는 시각적 완성도로 이어지지는 않는다.

모델마다 도구 사용 방식이 상이하며, 특히 GPT-5.6

1,349회의 도구 호출 중 65%를 set_color, set_brush, set_pressure 같은 설정 도구에 할당한 Grok 4.5는 GPT-5.6 Sol과 정반대의 제어 방식을 취한다. GPT-5.6 Sol은 설정 도구를 단 한 번도 별도로 호출하지 않고 draw 명령 시 인라인으로 설정을 처리해 호출 횟수를 최소화한다. Gemini 3.6 Flash는 전체 호출의 약 3분의 1을 view_canvas에 사용하며 결과물을 가장 집요하게 검토한다. 모델의 아키텍처에 따라 도구 호출의 밀도와 검토 전략이 완전히 갈린다.

시각적 출력물을 이해하고 판단하는 능력이 부족한 Grok 4.5는 이번 테스트에서 사용 가능한 결과물을 거의 생성하지 못하며 가장 낮은 성능을 기록한다. Claude Fable 5는 품질 면에서 2위를 차지했으나 GPT-5.6 Sol보다 속도가 현저히 느리고 비용이 약 20배 더 많이 발생한다. 이는 품질의 소폭 상승이 비용과 시간의 급격한 증가를 정당화하지 못하는 비효율적인 트레이드오프를 형성하며 실무 도입의 매력을 떨어뜨린다.

LLM 기반 에이전트를 설계할 때 무한 루프 리뷰에 빠지지 않도록 성능 피크를 감지해 프로세스를 종료하는 조기 종료(Early Stopping) 기준을 수립해야 한다.