콘텐츠로 이동

로컬 모델 가속

Backend.AI GO는 하드웨어, 모델 형식, 작업 특성에 따라 서로 다른 추론 엔진을 사용합니다. 앱은 설치된 엔진 집합, 호스트 capability, 선택한 모델 형식을 함께 보고 적절한 엔진을 선택합니다.

로컬 추론 스택

모델을 로드하면 Backend.AI GO는 해당 세션 전용의 로컬 또는 컨테이너 기반 서빙 프로세스를 시작합니다.

  • llama.cpp, mlxcel-server, stable-diffusion.cpp 같은 바이너리 엔진은 호스트에서 직접 실행됩니다
  • vLLM, SGLang 같은 컨테이너 엔진은 앱이 관리하는 컨테이너 안에서 실행됩니다
  • 앱은 엔진 헬스 체크를 통과한 뒤 Chat, Sessions, Management API가 쓰도록 세션을 등록합니다

현재 엔진 계열

llama.cpp

GGUF 모델을 위한 크로스 플랫폼 기본 엔진입니다.

  • 형식: gguf
  • 적합한 환경: Windows, Linux, Intel Mac, 또는 GGUF를 선호하는 Apple Silicon 사용자
  • 가속기: 패키지에 따라 CPU, Metal, CUDA, ROCm, SYCL, Vulkan

mlxcel 기반 MLX

MLX 저장소를 위한 우선 경로입니다.

  • 형식: mlx (로컬 MLX 경로에서는 safetensors 별칭이 여기에 매핑됩니다)
  • 적합한 환경: Apple Silicon Mac과 지원되는 Linux CUDA13 mlxcel 패키지
  • 우선 엔진: mlxcel-server
  • 레거시 폴백: 설치된 경우의 mlx-lm

vLLM

대형 NVIDIA 시스템을 위한 베타 컨테이너 엔진입니다.

  • 형식: safetensors-repo
  • 적합한 환경: VRAM이 큰 NVIDIA GPU, 다중 사용자 또는 에이전트 중심 워크로드
  • 강점: PagedAttention, 연속 배칭, 높은 처리량

SGLang

NVIDIA GPU에서 safetensors 저장소를 서빙하는 베타 컨테이너 엔진입니다.

  • 형식: safetensors-repo
  • 적합한 환경: 구조화된 출력이나 prefix cache 활용이 중요한 워크로드
  • 강점: RadixAttention prefix cache, 제약 디코딩

stable-diffusion.cpp

로컬 이미지 생성 엔진입니다.

  • 형식: .safetensors, .ckpt, 지원되는 .gguf 등 diffusion 모델 파일
  • 적합한 환경: 온디바이스 이미지 생성

앱에서 보이는 형식 이름

Backend.AI GO는 현재 로컬 모델 형식을 다음처럼 정규화합니다.

  • gguf
  • mlx
  • safetensors-repo

중요한 호환성 규칙은 예전의 safetensors 로컬 모델 표시는 Apple Silicon MLX 경로에서 mlx로 처리된다는 점입니다. 컨테이너 엔진은 전체 Hugging Face 저장소를 safetensors-repo로 취급합니다.

엔진과 기본값을 관리하는 위치

  • Engines: 엔진 패키지 설치, 업데이트, 정보 확인
  • 설정 > 모델: 형식별 기본 엔진과 앱 수준 모델 기본값 설정
  • Models > Local: 다운로드된 모델 로드와 모델별 설정 열기
  • Models > Browse: Hugging Face에서 새 모델 다운로드

어떤 엔진을 골라야 하나요?

가장 넓은 크로스 플랫폼 지원이나 GGUF 양자화가 필요하면 llama.cpp를 고르세요.

모델이 MLX 저장소 형식으로 제공되고 Apple Silicon Metal 또는 지원되는 Linux CUDA13 패키지를 사용한다면 mlxcel을 고르세요.

처리량과 동시성이 가장 중요하면 vLLM을 고려하세요.

구조화된 출력이나 prefix cache 재사용이 중요하면 SGLang이 좋습니다.

로컬 이미지 생성은 stable-diffusion.cpp를 사용하세요.

관련 페이지