Kendi OpenAI uyumlu LLM API’niz
Açık modelleri uygulamalarınıza kodunuzun zaten konuştuğu bir API üzerinden sunun. vLLM GPU’larda yüksek verim sağlar, llama.cpp nicemlenmiş GGUF modellerini CPU ve GPU’larda verimli çalıştırır, LocalAI ise birçok model türünü tek bir uç noktanın arkasına koyar. Onları HyperDC sunucularda çalıştırın; uygulama seçeneği olarak hazır kurulu ya da rehberimizle.
- Sohbet, tamamlama ve gömmeler için OpenAI uyumlu uç noktalar
- GPU verimi için vLLM, nicemlenmiş GGUF için llama.cpp
- Metin, görsel, ses ve gömmeler için LocalAI
- Anahtarlar, vekil sunucu ve özel ağ güvenli şekilde
- Yazılım yığını
- Python (vLLM), C/C++ (llama.cpp), Go (LocalAI)
- Varsayılan portlarllama-server varsayılan olarak 127.0.0.1’e bağlanır; her model API’sini gizli ya da kimlik doğrulamalı bir vekil sunucunun arkasında tutun.
- vLLM 8000; llama-server ve LocalAI 8080
- AsgarivLLM’in x86 ve Arm için CPU derlemeleri de vardır; llama.cpp ve LocalAI önce CPU’da çalışır, GPU varsa onu kullanır.
- vLLM: hesaplama yeteneği 7.5+ GPU
- Verileriniz
- Yerel NVMe’de model dosyaları
- Resmi belgeler
- docs.vllm.ai · localai.io
Motorlar ve biçimler
- vLLM
- llama.cpp
- LocalAI
- GGUF
- Safetensors
- OpenAI API
- Anthropic Messages API
- Prometheus
Bilgiler projenin resmi web sitesi, belgeleri ve kod deposundan alınmış, Ekim 2026’da kontrol edilmiştir.
Paketler hazırlanıyor
LLM APIs için kullanıma hazır paketler hazırlıyoruz. Nasıl kullanacağınızı ve kaç kullanıcı beklediğinizi yazın; size uygun bir sunucuyla dönelim. Dilerseniz bugün bir Linux VPS ile başlayıp kurulumu rehberimizle yapabilirsiniz.
Hangi sunucu boyutu uygun?
vCPU, bellek ve disk için başlangıç noktaları. Verileriniz ve kullanıcılarınız arttıkça sunucuyu büyütün.
| Özellik |
CPU’da llama.cpp
Nicemlenmiş modeller, hafif trafik
|
LocalAI
Tek API arkasında birkaç model türü
|
Önerilen GPU’da vLLM
Üretim trafiği, çok sayıda istek
|
|---|---|---|---|
| vCPUSunucunun sanal işlemci çekirdekleri. | 4–8 | 8 | Modellerinize göre |
| BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır. | 16 GB | 16–32 GB | Modellerinize göre |
| DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama. | 50 GB | 100 GB | 200 GB+ |
| Hızlandırıcı | İşlemci | CPU veya GPU | GPU |
| Sunucu türü | VPS veya VDS | VDS veya dedicated | GPU sunucu (bize sorun) |
-
CPU’da llama.cpp
Nicemlenmiş modeller, hafif trafik
- vCPUSunucunun sanal işlemci çekirdekleri.
- 4–8
- BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır.
- 16 GB
- DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama.
- 50 GB
- Hızlandırıcı
- İşlemci
- Sunucu türü
- VPS veya VDS
-
LocalAI
Tek API arkasında birkaç model türü
- vCPUSunucunun sanal işlemci çekirdekleri.
- 8
- BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır.
- 16–32 GB
- DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama.
- 100 GB
- Hızlandırıcı
- CPU veya GPU
- Sunucu türü
- VDS veya dedicated
-
Önerilen
GPU’da vLLM
Üretim trafiği, çok sayıda istek
- vCPUSunucunun sanal işlemci çekirdekleri.
- Modellerinize göre
- BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır.
- Modellerinize göre
- DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama.
- 200 GB+
- Hızlandırıcı
- GPU
- Sunucu türü
- GPU sunucu (bize sorun)
vLLM, GPU ile sunum için hesaplama yeteneği 7.5 veya üzeri bir GPU ister; llama.cpp ve LocalAI minimum yayınlamaz ve önce CPU’da çalışır. Bellek modelinizin boyutunu ve nicemlemesini izler; tipik değerler için Ollama sayfasına bakın.
İşe uygun motoru seçin
Geliştirilmeye devam eden üç açık kaynak sunucu, tek tanıdık API.
Verim için vLLM
PagedAttention ve sürekli toplu işleme aynı anda çok sayıda isteği sunar; FP8, INT4, GPTQ, AWQ ve GGUF modelleri desteklenir.
Verimlilik için llama.cpp
1,5 ile 8 bit arası nicemlemeli sade C/C++; llama-server birkaç kullanıcı için paralel çözümleme ve bir web arayüzü ekler.
Her şey için LocalAI
Birçok arka uçtan metin, gömmeler, görseller ve ses; kullanıcı ve API anahtarı sistemiyle tek bir OpenAI uyumlu uç noktanın arkasında.
Doğru şekilde güvenlik
vLLM’in kendi belgeleri yalnızca --api-key’e güvenilmemesi konusunda uyarır; motorları gizli tutar ve kimlik doğrulamalı bir vekil sunucu üzerinden açarız.
Verileriniz sizde kalır
İstemler, dosyalar ve veritabanları paylaşımlı bir SaaS hesabı yerine kontrol ettiğiniz, seçtiğiniz lokasyondaki bir sunucuda kalır.
Tam root erişimi
Uygulamanın ihtiyaç duyduğu her şeyi kurun, her ayarı değiştirin ve yanında başka hizmetler çalıştırın. Hiçbir şey bir panelin arkasına kilitlenmez.
Uygulama seçeneği veya adım adım rehber
Sunucuyu uygulama seçeneğiyle kurulu olarak sipariş edin ya da rehberimizle temiz bir Linux sunucuya kendiniz kurun.
Baştan başlamadan büyüyün
Bir VPS ile başlayın; iş yükü büyüdüğünde daha büyük bir pakete, NVMe depolamalı bir VDS’e veya dedicated sunucuya geçin.
Siparişten ilk girişe
Uygulamayı sunucunuza kurulu olarak sipariş edin ya da rehberimizle kendiniz kurun.
-
Sunucuyu seçin
Yukarıdaki tablodan bir boyut ve uygulamayı kullanacak kişilere en yakın veri merkezini seçin.
-
vLLM, llama.cpp or LocalAI kurulumu
Sipariş sırasında vLLM, llama.cpp or LocalAI uygulama seçeneğini işaretleyin ya da rehberimizle temiz bir Ubuntu veya Debian sunucuya kurun.
-
Bir model yükleyin
vllm serve’ü bir Hugging Face modeliyle, llama-server’ı bir GGUF dosyasıyla başlatın ya da LocalAI galerisinden bir model kurun.
-
Koruyun ve bağlayın
Bir API anahtarı ayarlayın, portu gizli tutun, HTTPS’li bir ters vekil sunucu üzerinden yayınlayın ve OpenAI istemcinizi ona yönlendirin.
Adım adım kurulum rehberleri
Uygulamayı güncel Ubuntu ve Debian sürümleri için yazılmış rehberlerimizle kurun, güvenceye alın ve güncelleyin.
-
llama.cpp sunucusunu OpenAI uyumlu bir API olarak çalıştırma
llama.cpp'yi derleyin, llama-server'ı Hugging Face'ten bir GGUF modeliyle test edin, 127.0.0.1 üzerinde API anahtarıyla korunan bir systemd servisi olarak çalıştırın ve OpenAI uyumlu API'yi HTTPS ile yayınlayın.
40 dk Orta -
NVIDIA GPU sunucusuna Docker ile vLLM kurulumu
Bir NVIDIA GPU sunucusunu hazırlayın, vllm/vllm-openai imajını Docker Compose ile 127.0.0.1 üzerinde çalıştırın, API anahtarı ve yalnızca /v1 yolunu açan bir Caddy proxy'siyle koruyun, bellek ve çoklu GPU ayarlarını yapın ya da uv ve systemd ile kurun.
45 dk İleri -
LocalAI'ı Docker Compose ile OpenAI uyumlu bir API olarak kurma
LocalAI'ı resmi konteyner imajlarından kurun, her istek için API anahtarı zorunlu kılın, galeriden bir model yükleyin, OpenAI uyumlu API'yi test edin ve Caddy arkasında HTTPS üzerinden yayınlayın.
35 dk Orta
İlgili çözümler
Yapay Zekâ ve LLM Sunucuları
Sunucularınızda modeller, sohbet, ajanlar ve yapay zekâ uygulamaları
AyrıntılarSıkça sorulan sorular
vLLM, llama.cpp mi LocalAI mi: hangisini kullanmalıyım?
Çok sayıda isteğin hızla yanıtlanması gerekiyorsa GPU sunucuda vLLM’i seçin. CPU’larda veya orta düzey GPU’larda nicemlenmiş GGUF modelleri için llama.cpp’yi seçin. Tek bir uç noktanın farklı arka uçlardan metin, gömme, görsel ve ses sunması gerekiyorsa LocalAI’ı seçin.
Bu API’ler OpenAI istemcileriyle uyumlu mu?
Evet. Üçü de sohbet tamamlama, tamamlama, gömmeler ve modeller için OpenAI uyumlu uç noktalar sunar; vLLM ve llama.cpp ayrıca Anthropic Messages API’sini destekler. İstemcinin temel adresini ve anahtarını değiştirin, mevcut kod çalışmaya devam eder.
Sunucuyu korumak için bir API anahtarı yeterli mi?
Tek başına değil. vLLM’in --api-key seçeneği yalnızca /v1 türü yolları korur ve belgeleri yalnızca ona güvenilmemesini söyler; llama-server siz ayarlamadıkça anahtar kullanmaz, LocalAI ise kimlik doğrulama yapılandırılana kadar açıktır. Motoru özel bir adreste tutun ve kimlik doğrulamalı, HTTPS’li bir ters vekil sunucu üzerinden yayınlayın.
vLLM hangi GPU’ları destekler?
Hesaplama yeteneği 7.5 veya üzeri NVIDIA GPU’lar, ROCm üzerinden desteklenen AMD Instinct ve Radeon GPU’lar ve Intel veri merkezi ile Arc GPU’lar. GPU sunucular ürün yelpazemize adım adım ekleniyor; siparişten önce modelinizle uyumluluğu kontrol ederiz.
GPU olmadan LLM API’si çalıştırabilir miyim?
Evet; llama.cpp veya LocalAI ve sunucunun belleğine göre boyutlandırılmış nicemlenmiş bir modelle. vLLM’in de x86 ve Arm için CPU derlemeleri vardır. GPU’dan daha düşük verim bekleyin.
GGUF nedir?
GGUF, değer başına 1,5 ile 8 bit arası nicemlenmiş ağırlıklarla llama.cpp’nin model dosyası biçimidir. Birçok model Hugging Face’te GGUF olarak yayınlanır ve llama-server bunları -hf seçeneğiyle doğrudan indirebilir.
LocalAI hâlâ hepsi bir arada imajlar sunuyor mu?
Hayır. LocalAI, 4.0 sürümünde CPU, NVIDIA CUDA, AMD, Intel ve Vulkan için ana imajlarına odaklanmak amacıyla hepsi bir arada imajlarını bıraktı. Bunun yerine ihtiyaç duyduğunuz modelleri galeriden kurun.
API’yi izleyebilir miyim?
Evet. vLLM Prometheus ölçümleri sunar; llama-server bunu --metrics seçeneğiyle yapar. Bunları Prometheus ile toplayın ve gecikmeyi, saniye başına token’ı ve kuyruk uzunluğunu izleyin.
Modelleri uygulamalarınıza sunun
Uygulamayı, kaç kişinin kullanacağını ve nerede olduklarını yazın; size uygun bir sunucu önerelim.