gpt-image 출력 토큰과 비용 최적화: 이미지 생성 비용을 세트당 0.05달러로 줄인 방법
gpt-image 비용은 출력 토큰 × 호출 횟수로 정해진다. 모델·품질별 출력 토큰 비교, 견적이 실제 청구의 3배였던 이유, usage CSV 실측으로 세트당 $0.05까지 줄인 과정.
목차
Figma 플러그인으로 게임 썸네일 세트(가로 썸네일 · 세로 포틀릿 · 큰 로고 3장)를 AI로 만든다. 결과 품질은 만족스러웠는데 비용·시간이 부담돼서 제작 등급을 4단계로 나눴다.
| 등급 | 메인 장면 | 큰 로고 배경 | 추가 구도 | 유료 AI 검사 |
|---|---|---|---|---|
| High · 현재 품질 | gpt-image-2 · high | gpt-image-2 · high (1024²) | 1회 | 출력마다 |
| M · 균형 | gpt-image-2 · high | gpt-image-2 · medium | 1회 | 같은 결과면 재사용 |
| Low · 절약 | gpt-image-2.5-flare · high | 인물 없는 장면 재사용 / flare high | 0회 | 재사용 |
| Nano · 초절약 | gpt-image-2.5-flare · low | 재사용 / flare low | 0회 | 안 함 |
규칙: 어떤 등급도 단계별로 High보다 비싸지면 안 된다. 실패해도 더 비싼 모델로 몰래 바꾸지 않는다.
1. "모델 이름·품질 이름"으로 비용을 짐작하면 틀린다
비용의 대부분은 이미지 출력 토큰이다. 같은 high라도 모델마다 토큰 예산이 다르다. OpenAI 공식 계산식 기준 출력 토큰(1536×1024):
| 모델 · 품질 | 출력 토큰 | 출력 비용($30/1M) |
|---|---|---|
| gpt-image-2 · high | 5,488 | 약 $0.165 |
| gpt-image-2.5-flare · high | 1,372 | 약 $0.041 |
| gpt-image-2.5-flare · low | 예산 16 기준(실측 요청당 약 200) | 약 $0.006 |
gpt-image-2 high의 1024² 배경은 7,024토큰이라 장면보다 비싸다. 그래서 M은 메인 장면은 그대로 두고 배경만 medium(1,756토큰)으로 내렸다.
2. 플러그인 견적이 실제 청구의 약 3배였다
견적이 요청마다 최대치로 계산하고 있었다.
- 입력 이미지: 장당 8,000토큰
- 프롬프트: 1,000토큰
- 분석 호출: 상한 금액
실제 사용량을 대시보드에서 내보내 보니(Usage → Export CSV), flare 요청 하나의 실제 토큰은 이 정도였다.
- 입력 이미지: 약 380토큰
- 텍스트: 약 270토큰
- 출력: 약 200토큰
3. 검사기 오판이 돈을 태운다
큰 로고 템플릿은 사진을 투명도 30%로 어둡게 깐다. 검사기는 그 어두운 부분을 "빈 영역"으로 보고 실패 처리했다. 그러면 "실패한 것만 다시"가 계속 재시도를 부른다. 결과물이 아니라 판정이 틀린 경우였다.
Nano에서 토큰·호출을 줄인 방법
한 번에 하나씩만 바꾼다.
- 같은 flare에서 품질만 high → low로 내렸다. 원본 선택·프롬프트·해상도는 그대로 둬서, 결과가 나빠지면 원인을 알 수 있게 했다.
- 추가 구도 생성 0회. 장면이 출력에 안 맞으면 다시 생성하지 않는다. 장면 안에서 가장 큰 창으로 꽉 채워 배치하고 검토 표시만 남긴다.
- 배경 재사용. 인물 없는 게임은 메인 장면에 얼굴·몸·글자가 없을 때 그 장면을 큰 로고 배경으로 쓴다.
- 유료 AI 시각 검사(gpt-4o) 생략. 구조·필수 요소·픽셀 검사는 로컬에서 그대로 한다.
- 미적 의심만으로 자동 재생성하지 않는다. 결함(글자 남음, 인물 사라짐)이 있을 때만 1회 재시도한다.
실측 결과
2026-10-09, 4게임 Nano 실행 2회 + 재시도 몇 번, OpenAI 사용량 CSV 기준.
- gpt-image-2.5-flare: 26요청, 입력 16,930(이미지 9,948), 출력 5,337 → 약 $0.28
- gpt-4o(원본·로고 분석): 32요청 → 약 $0.12
- 합계 약 $0.39 → 실행 1회 약 $0.2 → 1세트 약 $0.05
- 같은 방식으로 계산하면 High 위주로 돌린 날은 하루 약 $8였다. Nano는 High의 1/10 이하다.
견적 고친 방법
- 예약(한도 확인용): 지금처럼 최대치로 둔다. 안전장치라서다.
- "예상": 플러그인이 기록한 실제 usage의 최근 50요청 평균으로 계산한다. 기록이 없으면 위 실측값을 기본값으로 쓴다.
| 등급 (1세트, 기록 없음) | 예상 | 최대 예약 |
|---|---|---|
| Nano | $0.034 | $0.224 |
| Low | $0.128 | $0.504 |
| M | $0.258 | $1.101 |
| High | $0.416 | $1.259 |
오판 고친 방법
- 템플릿이 의도적으로 어둡게 한 영역(투명도 낮춘 사진, 그라데이션, 흐림 띠)은 빈 영역 계산에서 뺐다.
- 어두운 영역은 "실패"가 아니라 기록만 남긴다.
- 빈 영역은 10%를 넘을 때만 실패로 본다.
단가(공식 가격표): 이미지 입력 $8/1M, 이미지 출력 $30/1M, 텍스트 입력 $5/1M. flare와 gpt-image-2가 같다.
남길 것
이미지 생성 비용은 출력 토큰 × 호출 횟수로 정해진다.
- 모델·품질 이름만 보지 말고 공식 토큰 계산식을 본다.
- 실제 청구는 usage CSV로 확인한다.
- 견적의 "예상"은 실측 평균으로, "예약"만 최대치로 잡는다.
참고 링크
- OpenAI Image generation 가이드 — 품질·크기별 출력 토큰 계산식
- OpenAI Pricing — 이미지 입력/출력·텍스트 토큰 단가
- OpenAI Usage 대시보드 — Export로 모델·날짜별 토큰 CSV를 받을 수 있다
더 봐야 할 것
- Nano와 Low를 같은 원본으로 비교하기 (얼굴·재질·글자 품질, 다시 만들지 않고 쓴 비율 → "쓸 수 있는 결과 한 장당 비용")
- 분석 호출(gpt-4o)은 아직 usage를 돌려주지 않아 사후 추정이 예약 최대치로 잡힌다 — 회수하기
- Nano 다음 단계: 생성 해상도 낮추기 (최종 프레임은 작으니 차이가 안 보이는 지점 찾기)
- 단계별 시간(이미지 생성 111초 · 분석·검사 148초 · 배치 33초 / 4게임) — 분석이 생성보다 오래 걸리는 이유