İçeriğe geç

Kendi OpenAI uyumlu LLM API’niz

Açık modelleri uygulamalarınıza kodunuzun zaten konuştuğu bir API üzerinden sunun. vLLM GPU’larda yüksek verim sağlar, llama.cpp nicemlenmiş GGUF modellerini CPU ve GPU’larda verimli çalıştırır, LocalAI ise birçok model türünü tek bir uç noktanın arkasına koyar. Onları HyperDC sunucularda çalıştırın; uygulama seçeneği olarak hazır kurulu ya da rehberimizle.

  • Sohbet, tamamlama ve gömmeler için OpenAI uyumlu uç noktalar
  • GPU verimi için vLLM, nicemlenmiş GGUF için llama.cpp
  • Metin, görsel, ses ve gömmeler için LocalAI
  • Anahtarlar, vekil sunucu ve özel ağ güvenli şekilde
Yazılım yığını
Python (vLLM), C/C++ (llama.cpp), Go (LocalAI)
Varsayılan portlarllama-server varsayılan olarak 127.0.0.1’e bağlanır; her model API’sini gizli ya da kimlik doğrulamalı bir vekil sunucunun arkasında tutun.
vLLM 8000; llama-server ve LocalAI 8080
AsgarivLLM’in x86 ve Arm için CPU derlemeleri de vardır; llama.cpp ve LocalAI önce CPU’da çalışır, GPU varsa onu kullanır.
vLLM: hesaplama yeteneği 7.5+ GPU
Verileriniz
Yerel NVMe’de model dosyaları
Resmi belgeler
docs.vllm.ai · localai.io

Motorlar ve biçimler

  • vLLM
  • llama.cpp
  • LocalAI
  • GGUF
  • Safetensors
  • OpenAI API
  • Anthropic Messages API
  • Prometheus

Bilgiler projenin resmi web sitesi, belgeleri ve kod deposundan alınmış, Ekim 2026’da kontrol edilmiştir.

Paketler hazırlanıyor

LLM APIs için kullanıma hazır paketler hazırlıyoruz. Nasıl kullanacağınızı ve kaç kullanıcı beklediğinizi yazın; size uygun bir sunucuyla dönelim. Dilerseniz bugün bir Linux VPS ile başlayıp kurulumu rehberimizle yapabilirsiniz.

Hangi sunucu boyutu uygun?

vCPU, bellek ve disk için başlangıç noktaları. Verileriniz ve kullanıcılarınız arttıkça sunucuyu büyütün.

Hangi sunucu boyutu uygun?
Özellik
CPU’da llama.cpp Nicemlenmiş modeller, hafif trafik
LocalAI Tek API arkasında birkaç model türü
Önerilen GPU’da vLLM Üretim trafiği, çok sayıda istek
vCPUSunucunun sanal işlemci çekirdekleri. 4–8 8 Modellerinize göre
BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır. 16 GB 16–32 GB Modellerinize göre
DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama. 50 GB 100 GB 200 GB+
Hızlandırıcı İşlemci CPU veya GPU GPU
Sunucu türü VPS veya VDS VDS veya dedicated GPU sunucu (bize sorun)
  • CPU’da llama.cpp

    Nicemlenmiş modeller, hafif trafik

    vCPUSunucunun sanal işlemci çekirdekleri.
    4–8
    BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır.
    16 GB
    DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama.
    50 GB
    Hızlandırıcı
    İşlemci
    Sunucu türü
    VPS veya VDS
  • LocalAI

    Tek API arkasında birkaç model türü

    vCPUSunucunun sanal işlemci çekirdekleri.
    8
    BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır.
    16–32 GB
    DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama.
    100 GB
    Hızlandırıcı
    CPU veya GPU
    Sunucu türü
    VDS veya dedicated
  • Önerilen

    GPU’da vLLM

    Üretim trafiği, çok sayıda istek

    vCPUSunucunun sanal işlemci çekirdekleri.
    Modellerinize göre
    BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır.
    Modellerinize göre
    DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama.
    200 GB+
    Hızlandırıcı
    GPU
    Sunucu türü
    GPU sunucu (bize sorun)

vLLM, GPU ile sunum için hesaplama yeteneği 7.5 veya üzeri bir GPU ister; llama.cpp ve LocalAI minimum yayınlamaz ve önce CPU’da çalışır. Bellek modelinizin boyutunu ve nicemlemesini izler; tipik değerler için Ollama sayfasına bakın.

İşe uygun motoru seçin

Geliştirilmeye devam eden üç açık kaynak sunucu, tek tanıdık API.

Verim için vLLM

PagedAttention ve sürekli toplu işleme aynı anda çok sayıda isteği sunar; FP8, INT4, GPTQ, AWQ ve GGUF modelleri desteklenir.

Verimlilik için llama.cpp

1,5 ile 8 bit arası nicemlemeli sade C/C++; llama-server birkaç kullanıcı için paralel çözümleme ve bir web arayüzü ekler.

Her şey için LocalAI

Birçok arka uçtan metin, gömmeler, görseller ve ses; kullanıcı ve API anahtarı sistemiyle tek bir OpenAI uyumlu uç noktanın arkasında.

Doğru şekilde güvenlik

vLLM’in kendi belgeleri yalnızca --api-key’e güvenilmemesi konusunda uyarır; motorları gizli tutar ve kimlik doğrulamalı bir vekil sunucu üzerinden açarız.

Verileriniz sizde kalır

İstemler, dosyalar ve veritabanları paylaşımlı bir SaaS hesabı yerine kontrol ettiğiniz, seçtiğiniz lokasyondaki bir sunucuda kalır.

Tam root erişimi

Uygulamanın ihtiyaç duyduğu her şeyi kurun, her ayarı değiştirin ve yanında başka hizmetler çalıştırın. Hiçbir şey bir panelin arkasına kilitlenmez.

Uygulama seçeneği veya adım adım rehber

Sunucuyu uygulama seçeneğiyle kurulu olarak sipariş edin ya da rehberimizle temiz bir Linux sunucuya kendiniz kurun.

Baştan başlamadan büyüyün

Bir VPS ile başlayın; iş yükü büyüdüğünde daha büyük bir pakete, NVMe depolamalı bir VDS’e veya dedicated sunucuya geçin.

Siparişten ilk girişe

Uygulamayı sunucunuza kurulu olarak sipariş edin ya da rehberimizle kendiniz kurun.

  1. Sunucuyu seçin

    Yukarıdaki tablodan bir boyut ve uygulamayı kullanacak kişilere en yakın veri merkezini seçin.

  2. vLLM, llama.cpp or LocalAI kurulumu

    Sipariş sırasında vLLM, llama.cpp or LocalAI uygulama seçeneğini işaretleyin ya da rehberimizle temiz bir Ubuntu veya Debian sunucuya kurun.

  3. Bir model yükleyin

    vllm serve’ü bir Hugging Face modeliyle, llama-server’ı bir GGUF dosyasıyla başlatın ya da LocalAI galerisinden bir model kurun.

  4. Koruyun ve bağlayın

    Bir API anahtarı ayarlayın, portu gizli tutun, HTTPS’li bir ters vekil sunucu üzerinden yayınlayın ve OpenAI istemcinizi ona yönlendirin.

Adım adım kurulum rehberleri

Uygulamayı güncel Ubuntu ve Debian sürümleri için yazılmış rehberlerimizle kurun, güvenceye alın ve güncelleyin.

Diğer rehberler
  • Eğitimler llama.cpp sunucusunu OpenAI uyumlu bir API olarak çalıştırma

    llama.cpp'yi derleyin, llama-server'ı Hugging Face'ten bir GGUF modeliyle test edin, 127.0.0.1 üzerinde API anahtarıyla korunan bir systemd servisi olarak çalıştırın ve OpenAI uyumlu API'yi HTTPS ile yayınlayın.

    40 dk Orta
  • Eğitimler NVIDIA GPU sunucusuna Docker ile vLLM kurulumu

    Bir NVIDIA GPU sunucusunu hazırlayın, vllm/vllm-openai imajını Docker Compose ile 127.0.0.1 üzerinde çalıştırın, API anahtarı ve yalnızca /v1 yolunu açan bir Caddy proxy'siyle koruyun, bellek ve çoklu GPU ayarlarını yapın ya da uv ve systemd ile kurun.

    45 dk İleri
  • Eğitimler LocalAI'ı Docker Compose ile OpenAI uyumlu bir API olarak kurma

    LocalAI'ı resmi konteyner imajlarından kurun, her istek için API anahtarı zorunlu kılın, galeriden bir model yükleyin, OpenAI uyumlu API'yi test edin ve Caddy arkasında HTTPS üzerinden yayınlayın.

    35 dk Orta

İlgili çözümler

Ollama Sunucu

Özel, OpenAI uyumlu API’li açık LLM’ler

Ayrıntılar

GPU Sunucular

Yapay zekâ çıkarımı ve eğitimi için GPU sunucular

Ayrıntılar

Open WebUI Sunucu

Ekibiniz için ChatGPT benzeri özel sohbet

Ayrıntılar

Yapay Zekâ Ajanı Sunucu

OpenClaw, Hermes Agent ve kendi ajanlarınız, hep açık

Ayrıntılar

Dify Sunucu

Tek stüdyoda yapay zekâ uygulamaları, ajanlar, RAG ve akışlar

Ayrıntılar

Yapay Zekâ ve LLM Sunucuları

Sunucularınızda modeller, sohbet, ajanlar ve yapay zekâ uygulamaları

Ayrıntılar

Sıkça sorulan sorular

Başka sorunuz mu var? Bize mesaj gönderin, ekibimiz e-posta ile yanıt versin.
vLLM, llama.cpp mi LocalAI mi: hangisini kullanmalıyım?

Çok sayıda isteğin hızla yanıtlanması gerekiyorsa GPU sunucuda vLLM’i seçin. CPU’larda veya orta düzey GPU’larda nicemlenmiş GGUF modelleri için llama.cpp’yi seçin. Tek bir uç noktanın farklı arka uçlardan metin, gömme, görsel ve ses sunması gerekiyorsa LocalAI’ı seçin.

Bu API’ler OpenAI istemcileriyle uyumlu mu?

Evet. Üçü de sohbet tamamlama, tamamlama, gömmeler ve modeller için OpenAI uyumlu uç noktalar sunar; vLLM ve llama.cpp ayrıca Anthropic Messages API’sini destekler. İstemcinin temel adresini ve anahtarını değiştirin, mevcut kod çalışmaya devam eder.

Sunucuyu korumak için bir API anahtarı yeterli mi?

Tek başına değil. vLLM’in --api-key seçeneği yalnızca /v1 türü yolları korur ve belgeleri yalnızca ona güvenilmemesini söyler; llama-server siz ayarlamadıkça anahtar kullanmaz, LocalAI ise kimlik doğrulama yapılandırılana kadar açıktır. Motoru özel bir adreste tutun ve kimlik doğrulamalı, HTTPS’li bir ters vekil sunucu üzerinden yayınlayın.

vLLM hangi GPU’ları destekler?

Hesaplama yeteneği 7.5 veya üzeri NVIDIA GPU’lar, ROCm üzerinden desteklenen AMD Instinct ve Radeon GPU’lar ve Intel veri merkezi ile Arc GPU’lar. GPU sunucular ürün yelpazemize adım adım ekleniyor; siparişten önce modelinizle uyumluluğu kontrol ederiz.

GPU olmadan LLM API’si çalıştırabilir miyim?

Evet; llama.cpp veya LocalAI ve sunucunun belleğine göre boyutlandırılmış nicemlenmiş bir modelle. vLLM’in de x86 ve Arm için CPU derlemeleri vardır. GPU’dan daha düşük verim bekleyin.

GGUF nedir?

GGUF, değer başına 1,5 ile 8 bit arası nicemlenmiş ağırlıklarla llama.cpp’nin model dosyası biçimidir. Birçok model Hugging Face’te GGUF olarak yayınlanır ve llama-server bunları -hf seçeneğiyle doğrudan indirebilir.

LocalAI hâlâ hepsi bir arada imajlar sunuyor mu?

Hayır. LocalAI, 4.0 sürümünde CPU, NVIDIA CUDA, AMD, Intel ve Vulkan için ana imajlarına odaklanmak amacıyla hepsi bir arada imajlarını bıraktı. Bunun yerine ihtiyaç duyduğunuz modelleri galeriden kurun.

API’yi izleyebilir miyim?

Evet. vLLM Prometheus ölçümleri sunar; llama-server bunu --metrics seçeneğiyle yapar. Bunları Prometheus ile toplayın ve gecikmeyi, saniye başına token’ı ve kuyruk uzunluğunu izleyin.

Modelleri uygulamalarınıza sunun

Uygulamayı, kaç kişinin kullanacağını ve nerede olduklarını yazın; size uygun bir sunucu önerelim.

Şifre Oluştur

Lütfen onaylayın