# Kendi OpenAI uyumlu LLM API’niz

> Açık modelleri vLLM, llama.cpp veya LocalAI ile kendi OpenAI uyumlu API’nizin arkasında sunun: hızlı GPU çıkarımı ya da CPU’da nicemlenmiş modeller.

Açık modelleri uygulamalarınıza kodunuzun zaten konuştuğu bir API üzerinden sunun. vLLM GPU’larda yüksek verim sağlar, llama.cpp nicemlenmiş GGUF modellerini CPU ve GPU’larda verimli çalıştırır, LocalAI ise birçok model türünü tek bir uç noktanın arkasına koyar. Onları HyperDC sunucularda çalıştırın; uygulama seçeneği olarak hazır kurulu ya da rehberimizle.

- Sohbet, tamamlama ve gömmeler için OpenAI uyumlu uç noktalar
- GPU verimi için vLLM, nicemlenmiş GGUF için llama.cpp
- Metin, görsel, ses ve gömmeler için LocalAI
- Anahtarlar, vekil sunucu ve özel ağ güvenli şekilde

Paketleri görün Sunucu boyutlarını karşılaştırın

Yazılım yığını Python (vLLM), C/C++ (llama.cpp), Go (LocalAI)\
Varsayılan portlar llama-server varsayılan olarak 127.0.0.1’e bağlanır; her model API’sini gizli ya da kimlik doğrulamalı bir vekil sunucunun arkasında tutun. vLLM 8000; llama-server ve LocalAI 8080\
Asgari vLLM’in x86 ve Arm için CPU derlemeleri de vardır; llama.cpp ve LocalAI önce CPU’da çalışır, GPU varsa onu kullanır. vLLM: hesaplama yeteneği 7.5+ GPU\
Verileriniz Yerel NVMe’de model dosyaları\
Resmi belgeler docs.vllm.ai · localai.io

Motorlar ve biçimler

- vLLM
- llama.cpp
- LocalAI
- GGUF
- Safetensors
- OpenAI API
- Anthropic Messages API
- Prometheus

Bilgiler projenin resmi web sitesi, belgeleri ve kod deposundan alınmış, Ekim 2026’da kontrol edilmiştir.

## Paketler hazırlanıyor

LLM APIs için kullanıma hazır paketler hazırlıyoruz. Nasıl kullanacağınızı ve kaç kullanıcı beklediğinizi yazın; size uygun bir sunucuyla dönelim. Dilerseniz bugün bir Linux VPS ile başlayıp kurulumu rehberimizle yapabilirsiniz.

[Satış ekibine yazın](https://hyperdc.com/tr/contact-us) [Talep açın](https://hyperdc.com/support/new-ticket)

## Hangi sunucu boyutu uygun?

vCPU, bellek ve disk için başlangıç noktaları. Verileriniz ve kullanıcılarınız arttıkça sunucuyu büyütün.

| Özellik | **CPU’da llama.cpp** Nicemlenmiş modeller, hafif trafik | **LocalAI** Tek API arkasında birkaç model türü | Önerilen **GPU’da vLLM** Üretim trafiği, çok sayıda istek |
| --- | --- | --- | --- |
| vCPUSunucunun sanal işlemci çekirdekleri. | 4–8 | 8 | Modellerinize göre |
| BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır. | 16 GB | 16–32 GB | Modellerinize göre |
| DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama. | 50 GB | 100 GB | 200 GB+ |
| Hızlandırıcı | İşlemci | CPU veya GPU | GPU |
| Sunucu türü | VPS veya VDS | VDS veya dedicated | GPU sunucu (bize sorun) |

- ### CPU’da llama.cpp
  Nicemlenmiş modeller, hafif trafik
  vCPUSunucunun sanal işlemci çekirdekleri. 4–8\
  BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır. 16 GB\
  DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama. 50 GB\
  Hızlandırıcı İşlemci\
  Sunucu türü VPS veya VDS
- ### LocalAI
  Tek API arkasında birkaç model türü
  vCPUSunucunun sanal işlemci çekirdekleri. 8\
  BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır. 16–32 GB\
  DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama. 100 GB\
  Hızlandırıcı CPU veya GPU\
  Sunucu türü VDS veya dedicated
- Önerilen
  ### GPU’da vLLM
  Üretim trafiği, çok sayıda istek
  vCPUSunucunun sanal işlemci çekirdekleri. Modellerinize göre\
  BellekNicemlenmiş model CPU’da RAM’e, GPU’da GPU belleğine sığmalıdır. Modellerinize göre\
  DiskUygulama, verileri ve yerel yedekler için NVMe veya SSD depolama. 200 GB+\
  Hızlandırıcı GPU\
  Sunucu türü GPU sunucu (bize sorun)

vLLM, GPU ile sunum için hesaplama yeteneği 7.5 veya üzeri bir GPU ister; llama.cpp ve LocalAI minimum yayınlamaz ve önce CPU’da çalışır. Bellek modelinizin boyutunu ve nicemlemesini izler; tipik değerler için Ollama sayfasına bakın.

Paketleri görün

## İşe uygun motoru seçin

Geliştirilmeye devam eden üç açık kaynak sunucu, tek tanıdık API.

### Verim için vLLM

PagedAttention ve sürekli toplu işleme aynı anda çok sayıda isteği sunar; FP8, INT4, GPTQ, AWQ ve GGUF modelleri desteklenir.

### Verimlilik için llama.cpp

1,5 ile 8 bit arası nicemlemeli sade C/C++; llama-server birkaç kullanıcı için paralel çözümleme ve bir web arayüzü ekler.

### Her şey için LocalAI

Birçok arka uçtan metin, gömmeler, görseller ve ses; kullanıcı ve API anahtarı sistemiyle tek bir OpenAI uyumlu uç noktanın arkasında.

### Doğru şekilde güvenlik

vLLM’in kendi belgeleri yalnızca --api-key’e güvenilmemesi konusunda uyarır; motorları gizli tutar ve kimlik doğrulamalı bir vekil sunucu üzerinden açarız.

### Verileriniz sizde kalır

İstemler, dosyalar ve veritabanları paylaşımlı bir SaaS hesabı yerine kontrol ettiğiniz, seçtiğiniz lokasyondaki bir sunucuda kalır.

### Tam root erişimi

Uygulamanın ihtiyaç duyduğu her şeyi kurun, her ayarı değiştirin ve yanında başka hizmetler çalıştırın. Hiçbir şey bir panelin arkasına kilitlenmez.

### Uygulama seçeneği veya adım adım rehber

Sunucuyu uygulama seçeneğiyle kurulu olarak sipariş edin ya da rehberimizle temiz bir Linux sunucuya kendiniz kurun.

### Baştan başlamadan büyüyün

Bir VPS ile başlayın; iş yükü büyüdüğünde daha büyük bir pakete, NVMe depolamalı bir VDS’e veya dedicated sunucuya geçin.

## Siparişten ilk girişe

Uygulamayı sunucunuza kurulu olarak sipariş edin ya da rehberimizle kendiniz kurun.

[Rehberlerimize göz atın](https://hyperdc.com/tr/guides)

1. ### Sunucuyu seçin
   Yukarıdaki tablodan bir boyut ve uygulamayı kullanacak kişilere en yakın veri merkezini seçin.
2. ### vLLM, llama.cpp or LocalAI kurulumu
   Sipariş sırasında vLLM, llama.cpp or LocalAI uygulama seçeneğini işaretleyin ya da rehberimizle temiz bir Ubuntu veya Debian sunucuya kurun.
3. ### Bir model yükleyin
   vllm serve’ü bir Hugging Face modeliyle, llama-server’ı bir GGUF dosyasıyla başlatın ya da LocalAI galerisinden bir model kurun.
4. ### Koruyun ve bağlayın
   Bir API anahtarı ayarlayın, portu gizli tutun, HTTPS’li bir ters vekil sunucu üzerinden yayınlayın ve OpenAI istemcinizi ona yönlendirin.

## Adım adım kurulum rehberleri

Uygulamayı güncel Ubuntu ve Debian sürümleri için yazılmış rehberlerimizle kurun, güvenceye alın ve güncelleyin.

[Diğer rehberler](https://hyperdc.com/tr/guides/search?q=llm%20api)

- Eğitimler [llama.cpp sunucusunu OpenAI uyumlu bir API olarak çalıştırma](https://hyperdc.com/tr/guides/tutorials/llama-cpp-server)
  llama.cpp'yi derleyin, llama-server'ı Hugging Face'ten bir GGUF modeliyle test edin, 127.0.0.1 üzerinde API anahtarıyla korunan bir systemd servisi olarak çalıştırın ve OpenAI uyumlu API'yi HTTPS ile yayınlayın.
  40 dk Orta
- Eğitimler [NVIDIA GPU sunucusuna Docker ile vLLM kurulumu](https://hyperdc.com/tr/guides/tutorials/install-vllm)
  Bir NVIDIA GPU sunucusunu hazırlayın, vllm/vllm-openai imajını Docker Compose ile 127.0.0.1 üzerinde çalıştırın, API anahtarı ve yalnızca /v1 yolunu açan bir Caddy proxy'siyle koruyun, bellek ve çoklu GPU ayarlarını yapın ya da uv ve systemd ile kurun.
  45 dk İleri
- Eğitimler [LocalAI'ı Docker Compose ile OpenAI uyumlu bir API olarak kurma](https://hyperdc.com/tr/guides/tutorials/install-localai)
  LocalAI'ı resmi konteyner imajlarından kurun, her istek için API anahtarı zorunlu kılın, galeriden bir model yükleyin, OpenAI uyumlu API'yi test edin ve Caddy arkasında HTTPS üzerinden yayınlayın.
  35 dk Orta

## İlgili çözümler

[Tüm çözümler](https://hyperdc.com/tr/solutions)

### Ollama Sunucu

Özel, OpenAI uyumlu API’li açık LLM’ler

[Ayrıntılar](https://hyperdc.com/tr/ollama-hosting)

### GPU Sunucular

Yapay zekâ çıkarımı ve eğitimi için GPU sunucular

[Ayrıntılar](https://hyperdc.com/tr/gpu-servers)

### Open WebUI Sunucu

Ekibiniz için ChatGPT benzeri özel sohbet

[Ayrıntılar](https://hyperdc.com/tr/open-webui-hosting)

### Yapay Zekâ Ajanı Sunucu

OpenClaw, Hermes Agent ve kendi ajanlarınız, hep açık

[Ayrıntılar](https://hyperdc.com/tr/ai-agents-hosting)

### Dify Sunucu

Tek stüdyoda yapay zekâ uygulamaları, ajanlar, RAG ve akışlar

[Ayrıntılar](https://hyperdc.com/tr/dify-hosting)

### Yapay Zekâ ve LLM Sunucuları

Sunucularınızda modeller, sohbet, ajanlar ve yapay zekâ uygulamaları

[Ayrıntılar](https://hyperdc.com/tr/ai-hosting)

## Sıkça sorulan sorular

Başka sorunuz mu var? Bize mesaj gönderin, ekibimiz e-posta ile yanıt versin.

[Bize ulaşın](https://hyperdc.com/tr/contact-us) [Talep açın](https://hyperdc.com/support/new-ticket)

### vLLM, llama.cpp mi LocalAI mi: hangisini kullanmalıyım?

Çok sayıda isteğin hızla yanıtlanması gerekiyorsa GPU sunucuda vLLM’i seçin. CPU’larda veya orta düzey GPU’larda nicemlenmiş GGUF modelleri için llama.cpp’yi seçin. Tek bir uç noktanın farklı arka uçlardan metin, gömme, görsel ve ses sunması gerekiyorsa LocalAI’ı seçin.

### Bu API’ler OpenAI istemcileriyle uyumlu mu?

Evet. Üçü de sohbet tamamlama, tamamlama, gömmeler ve modeller için OpenAI uyumlu uç noktalar sunar; vLLM ve llama.cpp ayrıca Anthropic Messages API’sini destekler. İstemcinin temel adresini ve anahtarını değiştirin, mevcut kod çalışmaya devam eder.

### Sunucuyu korumak için bir API anahtarı yeterli mi?

Tek başına değil. vLLM’in --api-key seçeneği yalnızca /v1 türü yolları korur ve belgeleri yalnızca ona güvenilmemesini söyler; llama-server siz ayarlamadıkça anahtar kullanmaz, LocalAI ise kimlik doğrulama yapılandırılana kadar açıktır. Motoru özel bir adreste tutun ve kimlik doğrulamalı, HTTPS’li bir ters vekil sunucu üzerinden yayınlayın.

### vLLM hangi GPU’ları destekler?

Hesaplama yeteneği 7.5 veya üzeri NVIDIA GPU’lar, ROCm üzerinden desteklenen AMD Instinct ve Radeon GPU’lar ve Intel veri merkezi ile Arc GPU’lar. GPU sunucular ürün yelpazemize adım adım ekleniyor; siparişten önce modelinizle uyumluluğu kontrol ederiz.

### GPU olmadan LLM API’si çalıştırabilir miyim?

Evet; llama.cpp veya LocalAI ve sunucunun belleğine göre boyutlandırılmış nicemlenmiş bir modelle. vLLM’in de x86 ve Arm için CPU derlemeleri vardır. GPU’dan daha düşük verim bekleyin.

### GGUF nedir?

GGUF, değer başına 1,5 ile 8 bit arası nicemlenmiş ağırlıklarla llama.cpp’nin model dosyası biçimidir. Birçok model Hugging Face’te GGUF olarak yayınlanır ve llama-server bunları -hf seçeneğiyle doğrudan indirebilir.

### LocalAI hâlâ hepsi bir arada imajlar sunuyor mu?

Hayır. LocalAI, 4.0 sürümünde CPU, NVIDIA CUDA, AMD, Intel ve Vulkan için ana imajlarına odaklanmak amacıyla hepsi bir arada imajlarını bıraktı. Bunun yerine ihtiyaç duyduğunuz modelleri galeriden kurun.

### API’yi izleyebilir miyim?

Evet. vLLM Prometheus ölçümleri sunar; llama-server bunu --metrics seçeneğiyle yapar. Bunları Prometheus ile toplayın ve gecikmeyi, saniye başına token’ı ve kuyruk uzunluğunu izleyin.

## Modelleri uygulamalarınıza sunun

Uygulamayı, kaç kişinin kullanacağını ve nerede olduklarını yazın; size uygun bir sunucu önerelim.

Paketleri görün [Satış ekibine yazın](https://hyperdc.com/tr/contact-us)

---

Kaynak: <https://hyperdc.com/tr/llm-api-hosting>\
Son güncelleme: 2026-10-09
