İçeriğe geç

Kendi sunucunuzda Ollama: açık modeller, özel API

Açık bir modeli tek komutla indirin ve OpenAI uyumlu bir API üzerinden uygulamalarınıza, ekibinize ve Open WebUI, n8n veya Dify gibi araçlara sunun. Ollama küçük modeller için CPU sunucularda, hız için GPU sunucularda çalışır; uygulama seçeneği olarak hazır kurulu ya da rehberimizle.

  • Llama, Qwen, Gemma, DeepSeek, Mistral, gpt-oss ve Phi
  • OpenAI ve Anthropic uyumlu API
  • Küçük modeller için CPU, hız için GPU sunucular
  • İstemleriniz sunucunuzdan hiç çıkmaz
Yazılım yığını
Go, Ollama 0.40
Varsayılan portOllama varsayılan olarak 127.0.0.1’i dinler ve yerel API’si kimlik doğrulama istemez; gizli tutun, başka sunucuların erişmesi gerekiyorsa önüne kimlik doğrulamalı bir vekil sunucu koyun.
11434 (localhost)
AsgariOllama model sayfalarından: 13B modeller için en az 16 GB, 70B modeller için 64 GB.
7B modeller: en az 8 GB RAM
VerilerinizKonumu OLLAMA_MODELS ile değiştirin, örneğin daha büyük bir diske.
Modeller /usr/share/ollama/.ollama altında
Resmi belgeler
docs.ollama.com

Model aileleri

  • Llama
  • Qwen
  • Gemma
  • DeepSeek
  • Mistral
  • gpt-oss
  • Phi
  • nomic-embed-text

Bilgiler projenin resmi web sitesi, belgeleri ve kod deposundan alınmış, Ekim 2026’da kontrol edilmiştir.

Paketler hazırlanıyor

Ollama için kullanıma hazır paketler hazırlıyoruz. Nasıl kullanacağınızı ve kaç kullanıcı beklediğinizi yazın; size uygun bir sunucuyla dönelim. Dilerseniz bugün bir Linux VPS ile başlayıp kurulumu rehberimizle yapabilirsiniz.

Hangi sunucu boyutu uygun?

vCPU, bellek ve disk için başlangıç noktaları. Verileriniz ve kullanıcılarınız arttıkça sunucuyu büyütün.

Hangi sunucu boyutu uygun?
Özellik
Küçük modeller CPU’da 7B–8B modeller
Önerilen Orta boy modeller 13B–14B modeller, daha çok kullanıcı
Büyük modeller 70B’ye kadar modeller; hız için GPU
BellekCPU çıkarımı için RAM; GPU’da model GPU belleğine sığmalıdır. 8–16 GB 16–32 GB 64 GB+
vCPUSunucunun sanal işlemci çekirdekleri. 4 8 16+
DiskHer model dosyası birkaç GB yer kaplar; denediğiniz modeller için pay bırakın. 50 GB 100 GB 200 GB+
Sığan modeller 7B–8B, nicemlenmiş 13B–14B, nicemlenmiş 70B’ye kadar
Sunucu türü VPS veya VDS VDS veya dedicated Dedicated veya GPU sunucu
  • Küçük modeller

    CPU’da 7B–8B modeller

    BellekCPU çıkarımı için RAM; GPU’da model GPU belleğine sığmalıdır.
    8–16 GB
    vCPUSunucunun sanal işlemci çekirdekleri.
    4
    DiskHer model dosyası birkaç GB yer kaplar; denediğiniz modeller için pay bırakın.
    50 GB
    Sığan modeller
    7B–8B, nicemlenmiş
    Sunucu türü
    VPS veya VDS
  • Önerilen

    Orta boy modeller

    13B–14B modeller, daha çok kullanıcı

    BellekCPU çıkarımı için RAM; GPU’da model GPU belleğine sığmalıdır.
    16–32 GB
    vCPUSunucunun sanal işlemci çekirdekleri.
    8
    DiskHer model dosyası birkaç GB yer kaplar; denediğiniz modeller için pay bırakın.
    100 GB
    Sığan modeller
    13B–14B, nicemlenmiş
    Sunucu türü
    VDS veya dedicated
  • Büyük modeller

    70B’ye kadar modeller; hız için GPU

    BellekCPU çıkarımı için RAM; GPU’da model GPU belleğine sığmalıdır.
    64 GB+
    vCPUSunucunun sanal işlemci çekirdekleri.
    16+
    DiskHer model dosyası birkaç GB yer kaplar; denediğiniz modeller için pay bırakın.
    200 GB+
    Sığan modeller
    70B’ye kadar
    Sunucu türü
    Dedicated veya GPU sunucu

Ollama model sayfalarından: 7B modeller genellikle en az 8 GB, 13B modeller 16 GB ve 70B modeller 64 GB RAM ister. CPU çıkarımı çalışır ama daha yavaştır; GPU sunucu hızlı yanıtlar verir. GPU sunucular ürün yelpazemize adım adım ekleniyor; uygunluğu bize sorun.

Kendi Ollama’nızla neler yapabilirsiniz

Dil modeline ihtiyaç duyan her uygulama ve kişi için tek bir model sunucusu.

Doğrudan uyumlu API

OpenAI veya Anthropic istemci kütüphanelerini Ollama’nın uyumlu uç noktalarına yönlendirin ya da resmi Python ve JavaScript kütüphanelerini kullanın.

Open WebUI ile sohbet

Hesaplar, geçmiş ve belge aramasıyla ChatGPT benzeri bir arayüz için Open WebUI ekleyin.

RAG için gömmeler

Dify, AnythingLLM veya kendi kodunuzda anlamsal arama için nomic-embed-text veya bge-m3 gibi gömme modelleri sunun.

CPU veya GPU

Ollama CPU’da, CUDA ile NVIDIA GPU’larda ve ROCm ile AMD GPU’larda çalışır; GPU varsa onu otomatik kullanır.

Verileriniz sizde kalır

İstemler, dosyalar ve veritabanları paylaşımlı bir SaaS hesabı yerine kontrol ettiğiniz, seçtiğiniz lokasyondaki bir sunucuda kalır.

Tam root erişimi

Uygulamanın ihtiyaç duyduğu her şeyi kurun, her ayarı değiştirin ve yanında başka hizmetler çalıştırın. Hiçbir şey bir panelin arkasına kilitlenmez.

Uygulama seçeneği veya adım adım rehber

Sunucuyu uygulama seçeneğiyle kurulu olarak sipariş edin ya da rehberimizle temiz bir Linux sunucuya kendiniz kurun.

Baştan başlamadan büyüyün

Bir VPS ile başlayın; iş yükü büyüdüğünde daha büyük bir pakete, NVMe depolamalı bir VDS’e veya dedicated sunucuya geçin.

Siparişten ilk girişe

Uygulamayı sunucunuza kurulu olarak sipariş edin ya da rehberimizle kendiniz kurun.

  1. Sunucuyu seçin

    Yukarıdaki tablodan bir boyut ve uygulamayı kullanacak kişilere en yakın veri merkezini seçin.

  2. Ollama kurulumu

    Sipariş sırasında Ollama uygulama seçeneğini işaretleyin ya da rehberimizle temiz bir Ubuntu veya Debian sunucuya kurun.

  3. İlk modelinizi indirin

    Kütüphaneden bir modelle ollama pull çalıştırın, ardından ollama run veya /v1/chat/completions isteğiyle deneyin.

  4. Uygulamalarınızı bağlayın

    Aynı sunucuya Open WebUI, n8n veya Dify ekleyin ya da Ollama’ya diğer sunuculardan kimlik doğrulamalı bir vekil sunucu üzerinden erişin.

Adım adım kurulum rehberleri

Uygulamayı güncel Ubuntu ve Debian sürümleri için yazılmış rehberlerimizle kurun, güvenceye alın ve güncelleyin.

Diğer rehberler

İlgili çözümler

Open WebUI Sunucu

Ekibiniz için ChatGPT benzeri özel sohbet

Ayrıntılar

GPU Sunucular

Yapay zekâ çıkarımı ve eğitimi için GPU sunucular

Ayrıntılar

LLM API Sunucu

OpenAI API’si arkasında vLLM, llama.cpp ve LocalAI

Ayrıntılar

AnythingLLM Sunucu

Ajanlar ve MCP ile belgelerinizle sohbet

Ayrıntılar

n8n (self-hosted)

İş akışı otomasyonu ve yapay zekâ ajanları, kendi sunucunuzda

Ayrıntılar

Yapay Zekâ ve LLM Sunucuları

Sunucularınızda modeller, sohbet, ajanlar ve yapay zekâ uygulamaları

Ayrıntılar

Sıkça sorulan sorular

Başka sorunuz mu var? Bize mesaj gönderin, ekibimiz e-posta ile yanıt versin.
Ollama GPU olmadan çalışabilir mi?

Evet. GPU yoksa Ollama modelleri CPU’da çalıştırır. Küçük nicemlenmiş modeller tek kullanıcı veya arka plan işleri için kullanılabilir bir hızda yanıt verir; daha büyük modeller veya aynı anda birkaç kullanıcı için GPU sunucu seçin.

Ne kadar RAM gerekir?

Ollama model sayfalarına göre 7B modeller genellikle en az 8 GB, 13B modeller 16 GB ve 70B modeller 64 GB RAM ister. İşletim sistemi, Ollama’nın yanındaki uygulamalar ve daha uzun bağlam pencereleri için pay bırakın.

Ollama API’si korunuyor mu?

Hayır. 11434 portundaki yerel API kimlik doğrulama istemez; Ollama bu nedenle varsayılan olarak 127.0.0.1’e bağlanır. Böyle bırakın, aynı sunucudaki uygulamalardan kullanın ya da ona SSH, bir VPN veya anahtar ya da giriş isteyen bir ters vekil sunucu üzerinden erişin.

Ollama OpenAI istemci kütüphaneleriyle çalışır mı?

Evet. Ollama, /v1/chat/completions, /v1/embeddings ve /v1/models gibi OpenAI uyumlu uç noktalar ile Anthropic uyumlu bir API sunar. İstemcinin temel adresini sunucunuza yönlendirin; API anahtarı değeri istemci için zorunludur ama Ollama onu yok sayar.

Hangi modelleri kullanabilirim?

Ollama kütüphanesindeki her şey; Llama, Qwen, Gemma, DeepSeek, Mistral, gpt-oss ve Phi ile gömme modelleri dahil. GGUF ve Safetensors modellerini de içe aktarabilirsiniz.

Modeller nerede saklanır?

Linux’ta Ollama hizmet olarak çalıştığında /usr/share/ollama/.ollama/models altında ya da Docker’da bağladığınız birimde. Daha büyük bir diskte tutmak için OLLAMA_MODELS ayarlayın.

Uzun belgelerde yanıtlar neden kısa kesiliyor?

Ollama varsayılan olarak 4.096 token’lık bir bağlam penceresi kullanır. Uzun belgeler için model ayarlarında veya istekte bağlam uzunluğunu artırın; daha uzun bağlam daha fazla bellek ister.

Ollama’yı nasıl güncellerim?

Resmi kurulum betiğini yeniden çalıştırın ya da yeni Docker imajını çekin; indirdiğiniz modeller yerinde kalır. Daha yeni bir sürüm yayınlandığında modelleri ollama pull ile güncelleyin.

Kendi modellerinizi çalıştırın

Uygulamayı, kaç kişinin kullanacağını ve nerede olduklarını yazın; size uygun bir sunucu önerelim.

Şifre Oluştur

Lütfen onaylayın