모델 허브
생성 스튜디오에서 바로 쓸 수 있는 133개 모델
카드를 누르면 모델 소개를 볼 수 있습니다 — 바로 만들려면 ⚡ 바로 생성을 누르세요
1초 미만 초저가 생성·편집 — 대량 실험의 기본값
1~2초 초고속 생성 — 빠른 아이디어 스케치의 기본값
검증된 클래식 SDXL — img2img·거대한 생태계

NEW
초저가·초고속 증류 모델 — 대량 생성에 최적
얼굴 사진 한 장으로 일관된 인물 생성 (subject_reference)
해상도를 직접 지정하는 Pruna 가속 빌드 — 최대 2048²

✦ 추천NEW
8스텝이면 끝나는 초고속 생성 — MP당 단가 최저
구글 Imagen 4의 스피드 버전 — 자연스러운 사실감

NEW

NEW
정밀 구성에 강한 최신 Grok — 인포그래픽·광고·게임 에셋·UI 목업

NEW
Grok Imagine 계열 최고 화질 — 디테일·마감이 중요한 렌더
12B 파라미터 — 고품질 실험용, 한 번에 최대 4장
텍스트 렌더링 강자 Ideogram의 고속 버전

NEW
Ideogram V4 최속·최저가 — 시안 반복 작업용

NEW
일러스트·애니 강점 — Krea 2 가성비 버전
FLUX.2 개발 버전 — 레퍼런스 편집·반복 디자인 워크플로

✦ 추천NEW
Nano Banana 2 경량판 — 대화형 편집·캐릭터 일관성 유지

✦ 추천
추론 내장 이미지 생성 — 예시 기반 편집·도메인 지식
공간 이해·세계 지식 강화 — 멀티 레퍼런스 편집 지원
Gemini 2.5 Flash 기반 — 생성과 대화형 편집을 한 번에
구글 Imagen 4 플래그십 — 정교한 실사·조명 표현
긴 텍스트 렌더링 + 스타일 지정 — 디자인·포스터 특화

NEW
Recraft 차세대 — 타이포그래피·브랜드 자산 강화

NEW
Krea 플래그십 — 실사 충실도·스타일 레퍼런스 지원
최대 4MP 초고해상도 — raw 모드로 극사실 표현

NEW
속도·품질 균형 잡힌 Ideogram V4 — 타이포·실사 강점

✦ 추천
FLUX 2 프로 — 최대 8장 레퍼런스, 품질·속도·제어의 균형
BFL 최고 충실도 — 색·조명·얼굴·텍스트를 편집 간 보존

✦ 추천
Gemini 3.1 Flash Image — Pro급 품질을 Flash 속도로, 최대 4K
최대 3장 레퍼런스 + @태그로 캐릭터·장소·사물 일관성

NEW
SVG 벡터 직접 생성 — 로고·아이콘·확대해도 깨지지 않는 일러스트

✦ 추천NEW
ByteDance 플래그십 — 정밀 지시 이행·최대 10장 레퍼런스

NEW
Ideogram 최고 충실도 — 최종 프로덕션 자산용
최대 10장 레퍼런스 + 고급 타이포 — 가장 복합적인 작업용

✦ 추천
OpenAI 최신 — 지시 이행·텍스트 렌더링·정밀 편집 최상급
선명한 텍스트 렌더링과 디테일 편집 — GPT Image 1.5
Gemini 3 Pro 기반 SOTA — 다국어 텍스트·최대 14장 레퍼런스·4K

NEW
마이크로소프트 최고 충실도 — 히어로 이미지·상업 디자인
레퍼런스 필수 — 올린 인물·장소를 유지한 채 새 장면으로 (2.5배 빠른 터보)
말로 사진을 고치는 SOTA 편집 — 스타일 변환·배경 교체·글자 수정

NEW
레퍼런스 최대 10장을 @Image1로 지목해 합성 — 다중 참조 편집

NEW
저비용 반복 편집 — 바꿀 부분만 지시하면 나머지는 원본 유지

NEW
텍스트·레이아웃·브랜드 요소처럼 지시를 정확히 따라야 하는 편집
Kontext 최상급 — 타이포그래피 편집까지 최대 성능
속도·비용보다 편집 품질이 중요할 때 — Grok 편집 최고 티어
얼굴 사진 한 장으로 어떤 장면·스타일의 인물 생성 — 초저가
사진 1~4장으로 스타일 인물 사진 — 프롬프트에 img 키워드 필수
강한 스타일 변환 특화 — 회화·만화·3D 아트로
얼굴 사진을 3D·이모지·게임·클레이 등 6가지 스타일로
얼굴 사진을 다이컷 스티커로 — 프로필·굿즈용
FLUX 기반 고충실 인물 커스터마이즈 — SDXL 대비 품질 우위
아무 사진이나 링크드인용 프로필 사진으로 — 원클릭
레퍼런스 한 장으로 일관된 캐릭터를 어떤 스타일로든
클래식 업스케일러 — 최대 10배 확대 + 얼굴 보정 옵션
얼굴 복원 최다 사용 모델 — 옛날 사진·흐릿한 얼굴 복원
최대 128MP 고급 업스케일 — 디테일·실사 보강 패스 옵션
설정 없이 또렷하게 — UI 자산·일러스트·제품컷 기본 업스케일
생성 AI로 자연스러운 디테일을 유지하며 2·4배 확대
확대하며 디테일을 재상상하는 크리에이티브 업스케일러
사진 보정 업계 표준 Topaz — 최대 6배·얼굴 보정
머리카락·털까지 깔끔한 SOTA 배경 제거 — 투명 PNG
라이선스 데이터로만 학습한 상업 안전 배경 제거 — 256단계 투명도
사실적인 물리 시뮬레이션 + 오디오 — OpenAI Sora
Seedance 2.0 경량판 — 네이티브 오디오, 최대 720p
시네마틱 비주얼 + 네이티브 오디오 — Kling 상위 모델
Seedance 2.0의 빠른 버전 — 멀티모달 레퍼런스 + 네이티브 오디오
ByteDance 차세대 멀티모달 — 립싱크·캐릭터 일관성·네이티브 오디오
ByteDance 플래그십 — 한 번에 최대 30초, 레퍼런스 30장·네이티브 오디오·립싱크·1080p
이미지에서 2K 비디오 — 첫·끝 키프레임 제어
매우 빠르고 저렴한 텍스트→비디오 — 30FPS 보간 기본
이미지 한 장을 매우 빠르고 저렴하게 애니메이션으로
최대 20초 — 드래프트 모드로 시안을 빠르게, 오디오 조건 생성까지
시네마틱 품질 + 빠른 속도 — 비디오 입문 기본값
가볍게 4~12초 — 480p/720p/1080p 선택
인물 모션 강자 Hailuo의 고속 버전 — 이미지에서 시작
텍스트·이미지에서 동기화 오디오 포함 비디오 — 만능
부드러운 고품질 I2V — 시작·끝 프레임 전환 지원
사실적인 인물 모션·캐릭터 일관성 — MiniMax 대표 모델
프로 품질 1080p — 카메라 지시어([dolly in] 등) 지원
루마 고속 720p — 시작·끝 키프레임, 매끄러운 루프
정지 이미지를 빠르게 자연스러운 모션 비디오로
동기화 오디오 + 멀티샷 시퀀스 — 최대 1080p 시네마틱
동기화 오디오 + 네이티브 1080p — 텍스트·이미지 모두 지원
립싱크 지원 이미지→비디오 — 자연스러운 최고급 모션
모션 품질·프롬프트 반영 SOTA — Runway 플래그십
최대 15초 + 음성·음악 동기화 — 다국어 프롬프트 지원
첫 프레임(+끝 프레임)을 최대 15초로 — 오디오 동기화
BFL 첫 프론티어 비디오 — 이미지 한 장에 자연스러운 모션과 동기화 오디오
텍스트·단일 이미지·멀티 레퍼런스에서 비디오 생성
프롬프트 하나로 페이싱·대사·배경음악까지 — 구글 옴니 비디오
오디오 동기화 텍스트→비디오 — Wan 최고 품질
최대 15초 시네마틱 — 멀티샷·네이티브 오디오·4K 모드
텍스트·이미지·레퍼런스·기존 영상을 한 모델로 — 통합 멀티모달
Sora 프리미엄 — 최대 1024p, 레퍼런스 프레임 지원
오디오 생성 포함 Veo 고속판 — 품질 유지하며 속도 최적화
2K 텍스트→비디오 SOTA — 네이티브 오디오·21:9까지
구글 SOTA — 동기화 사운드와 함께 시네마틱 품질
기존 영상을 프롬프트로 편집 — 원본 길이·비율 유지 (720p 상한)
기존 영상의 입 모양을 새 오디오에 맞춰 재싱크 — 더빙·현지화
사진 한 장이 대사를 말하는 토킹 아바타 — 프리셋 보이스 선택
어떤 영상이든 새 오디오에 입 모양을 맞춰주는 립싱크
무음 영상에 AI 사운드(환경음·효과음·폴리) 입히기
영상을 FHD·2K·4K로 프레임 단위 업스케일
설명 한 줄로 완성곡 2개 — 커스텀 모드에서 가사·스타일 직접 지정
가사로 만드는 최대 5분 풀렝스 — 14가지 구조 태그
최대 6분 풀렝스 — BPM·키 정밀 제어, [Verse]/[Chorus] 구조 태그 가사
설명만으로 최대 10분 음악 트랙 — BGM·분위기 음악에
기존 곡의 멜로디는 그대로, 장르·보컬·편곡을 바꾼 커버 버전
UI 사운드·게임 오디오·폴리 효과음 2종 생성
영상을 분석해 어울리는 환경음·효과음을 자동 생성
프리셋·클로닝·목소리 디자인 3가지 모드를 하나로
감정 과장 컨트롤이 독특한 프로덕션급 오픈소스 TTS (영어)
[sigh]·[chuckle] 태그 지원 초고속 TTS — 20가지 목소리 (영어)
[speak quickly] 같은 자연어 지시로 조절하는 표현력 TTS
일레븐랩스 프리미엄 보이스를 절반 가격으로 — 32개 언어
250ms 미만 저지연 — (laughs)·<#0.5#> 쉼 표기 지원
실시간 응답용 빠른 다국어 TTS — 감정 컨트롤
네이버 클로바 — 한국어 최적화 108가지 목소리·감정 제어
[laughs]·[sighs] 같은 비언어 표현까지 — 생성형 음성
TTS 아레나 1위 — 방송 품질·32개 언어·감정 제어
스튜디오 품질 다국어 TTS — 섬세한 프로소디
일레븐랩스 최고 표현력 — [laughs]·[whispers] 인라인 태그
스타일 지시를 별도로 주는 구글 네이티브 오디오 TTS
짧은 음성 샘플 하나로 목소리를 복제해 16개 언어로