Kendi sunucunuzda Ollama: açık modeller, özel API
Açık bir modeli tek komutla indirin ve OpenAI uyumlu bir API üzerinden uygulamalarınıza, ekibinize ve Open WebUI, n8n veya Dify gibi araçlara sunun. Ollama küçük modeller için CPU sunucularda, hız için GPU sunucularda çalışır; uygulama seçeneği olarak hazır kurulu ya da rehberimizle.
- Llama, Qwen, Gemma, DeepSeek, Mistral, gpt-oss ve Phi
- OpenAI ve Anthropic uyumlu API
- Küçük modeller için CPU, hız için GPU sunucular
- İstemleriniz sunucunuzdan hiç çıkmaz
- Yazılım yığını
- Go, Ollama 0.40
- Varsayılan portOllama varsayılan olarak 127.0.0.1’i dinler ve yerel API’si kimlik doğrulama istemez; gizli tutun, başka sunucuların erişmesi gerekiyorsa önüne kimlik doğrulamalı bir vekil sunucu koyun.
- 11434 (localhost)
- AsgariOllama model sayfalarından: 13B modeller için en az 16 GB, 70B modeller için 64 GB.
- 7B modeller: en az 8 GB RAM
- VerilerinizKonumu OLLAMA_MODELS ile değiştirin, örneğin daha büyük bir diske.
- Modeller /usr/share/ollama/.ollama altında
- Resmi belgeler
- docs.ollama.com
Model aileleri
- Llama
- Qwen
- Gemma
- DeepSeek
- Mistral
- gpt-oss
- Phi
- nomic-embed-text
Bilgiler projenin resmi web sitesi, belgeleri ve kod deposundan alınmış, Ekim 2026’da kontrol edilmiştir.
Paketler hazırlanıyor
Ollama için kullanıma hazır paketler hazırlıyoruz. Nasıl kullanacağınızı ve kaç kullanıcı beklediğinizi yazın; size uygun bir sunucuyla dönelim. Dilerseniz bugün bir Linux VPS ile başlayıp kurulumu rehberimizle yapabilirsiniz.
Hangi sunucu boyutu uygun?
vCPU, bellek ve disk için başlangıç noktaları. Verileriniz ve kullanıcılarınız arttıkça sunucuyu büyütün.
| Özellik |
Küçük modeller
CPU’da 7B–8B modeller
|
Önerilen Orta boy modeller
13B–14B modeller, daha çok kullanıcı
|
Büyük modeller
70B’ye kadar modeller; hız için GPU
|
|---|---|---|---|
| BellekCPU çıkarımı için RAM; GPU’da model GPU belleğine sığmalıdır. | 8–16 GB | 16–32 GB | 64 GB+ |
| vCPUSunucunun sanal işlemci çekirdekleri. | 4 | 8 | 16+ |
| DiskHer model dosyası birkaç GB yer kaplar; denediğiniz modeller için pay bırakın. | 50 GB | 100 GB | 200 GB+ |
| Sığan modeller | 7B–8B, nicemlenmiş | 13B–14B, nicemlenmiş | 70B’ye kadar |
| Sunucu türü | VPS veya VDS | VDS veya dedicated | Dedicated veya GPU sunucu |
-
Küçük modeller
CPU’da 7B–8B modeller
- BellekCPU çıkarımı için RAM; GPU’da model GPU belleğine sığmalıdır.
- 8–16 GB
- vCPUSunucunun sanal işlemci çekirdekleri.
- 4
- DiskHer model dosyası birkaç GB yer kaplar; denediğiniz modeller için pay bırakın.
- 50 GB
- Sığan modeller
- 7B–8B, nicemlenmiş
- Sunucu türü
- VPS veya VDS
-
Önerilen
Orta boy modeller
13B–14B modeller, daha çok kullanıcı
- BellekCPU çıkarımı için RAM; GPU’da model GPU belleğine sığmalıdır.
- 16–32 GB
- vCPUSunucunun sanal işlemci çekirdekleri.
- 8
- DiskHer model dosyası birkaç GB yer kaplar; denediğiniz modeller için pay bırakın.
- 100 GB
- Sığan modeller
- 13B–14B, nicemlenmiş
- Sunucu türü
- VDS veya dedicated
-
Büyük modeller
70B’ye kadar modeller; hız için GPU
- BellekCPU çıkarımı için RAM; GPU’da model GPU belleğine sığmalıdır.
- 64 GB+
- vCPUSunucunun sanal işlemci çekirdekleri.
- 16+
- DiskHer model dosyası birkaç GB yer kaplar; denediğiniz modeller için pay bırakın.
- 200 GB+
- Sığan modeller
- 70B’ye kadar
- Sunucu türü
- Dedicated veya GPU sunucu
Ollama model sayfalarından: 7B modeller genellikle en az 8 GB, 13B modeller 16 GB ve 70B modeller 64 GB RAM ister. CPU çıkarımı çalışır ama daha yavaştır; GPU sunucu hızlı yanıtlar verir. GPU sunucular ürün yelpazemize adım adım ekleniyor; uygunluğu bize sorun.
Kendi Ollama’nızla neler yapabilirsiniz
Dil modeline ihtiyaç duyan her uygulama ve kişi için tek bir model sunucusu.
Doğrudan uyumlu API
OpenAI veya Anthropic istemci kütüphanelerini Ollama’nın uyumlu uç noktalarına yönlendirin ya da resmi Python ve JavaScript kütüphanelerini kullanın.
Open WebUI ile sohbet
Hesaplar, geçmiş ve belge aramasıyla ChatGPT benzeri bir arayüz için Open WebUI ekleyin.
RAG için gömmeler
Dify, AnythingLLM veya kendi kodunuzda anlamsal arama için nomic-embed-text veya bge-m3 gibi gömme modelleri sunun.
CPU veya GPU
Ollama CPU’da, CUDA ile NVIDIA GPU’larda ve ROCm ile AMD GPU’larda çalışır; GPU varsa onu otomatik kullanır.
Verileriniz sizde kalır
İstemler, dosyalar ve veritabanları paylaşımlı bir SaaS hesabı yerine kontrol ettiğiniz, seçtiğiniz lokasyondaki bir sunucuda kalır.
Tam root erişimi
Uygulamanın ihtiyaç duyduğu her şeyi kurun, her ayarı değiştirin ve yanında başka hizmetler çalıştırın. Hiçbir şey bir panelin arkasına kilitlenmez.
Uygulama seçeneği veya adım adım rehber
Sunucuyu uygulama seçeneğiyle kurulu olarak sipariş edin ya da rehberimizle temiz bir Linux sunucuya kendiniz kurun.
Baştan başlamadan büyüyün
Bir VPS ile başlayın; iş yükü büyüdüğünde daha büyük bir pakete, NVMe depolamalı bir VDS’e veya dedicated sunucuya geçin.
Siparişten ilk girişe
Uygulamayı sunucunuza kurulu olarak sipariş edin ya da rehberimizle kendiniz kurun.
-
Sunucuyu seçin
Yukarıdaki tablodan bir boyut ve uygulamayı kullanacak kişilere en yakın veri merkezini seçin.
-
Ollama kurulumu
Sipariş sırasında Ollama uygulama seçeneğini işaretleyin ya da rehberimizle temiz bir Ubuntu veya Debian sunucuya kurun.
-
İlk modelinizi indirin
Kütüphaneden bir modelle ollama pull çalıştırın, ardından ollama run veya /v1/chat/completions isteğiyle deneyin.
-
Uygulamalarınızı bağlayın
Aynı sunucuya Open WebUI, n8n veya Dify ekleyin ya da Ollama’ya diğer sunuculardan kimlik doğrulamalı bir vekil sunucu üzerinden erişin.
Adım adım kurulum rehberleri
Uygulamayı güncel Ubuntu ve Debian sürümleri için yazılmış rehberlerimizle kurun, güvenceye alın ve güncelleyin.
-
Ubuntu veya Debian'a Ollama kurulumu ve yerel LLM çalıştırma
Ollama'yı systemd servisi olarak kurun, açık modelleri CPU veya GPU üzerinde indirip çalıştırın, REST API'yi test edin, model depolamasını taşıyın ve 11434 portunu açmadan API'ye güvenle erişin.
30 dk Başlangıç -
Open WebUI'ı Ollama ile Docker Compose ve HTTPS kullanarak çalıştırma
Open WebUI'ı Ollama'nın yanında Docker Compose ile kurun, 11434 portunu açmadan bağlayın, yönetici hesabını gizlice oluşturun, Caddy ile HTTPS üzerinden yayınlayın ve yedekli, güncel tutun.
35 dk Orta
İlgili çözümler
Yapay Zekâ ve LLM Sunucuları
Sunucularınızda modeller, sohbet, ajanlar ve yapay zekâ uygulamaları
AyrıntılarSıkça sorulan sorular
Ollama GPU olmadan çalışabilir mi?
Evet. GPU yoksa Ollama modelleri CPU’da çalıştırır. Küçük nicemlenmiş modeller tek kullanıcı veya arka plan işleri için kullanılabilir bir hızda yanıt verir; daha büyük modeller veya aynı anda birkaç kullanıcı için GPU sunucu seçin.
Ne kadar RAM gerekir?
Ollama model sayfalarına göre 7B modeller genellikle en az 8 GB, 13B modeller 16 GB ve 70B modeller 64 GB RAM ister. İşletim sistemi, Ollama’nın yanındaki uygulamalar ve daha uzun bağlam pencereleri için pay bırakın.
Ollama API’si korunuyor mu?
Hayır. 11434 portundaki yerel API kimlik doğrulama istemez; Ollama bu nedenle varsayılan olarak 127.0.0.1’e bağlanır. Böyle bırakın, aynı sunucudaki uygulamalardan kullanın ya da ona SSH, bir VPN veya anahtar ya da giriş isteyen bir ters vekil sunucu üzerinden erişin.
Ollama OpenAI istemci kütüphaneleriyle çalışır mı?
Evet. Ollama, /v1/chat/completions, /v1/embeddings ve /v1/models gibi OpenAI uyumlu uç noktalar ile Anthropic uyumlu bir API sunar. İstemcinin temel adresini sunucunuza yönlendirin; API anahtarı değeri istemci için zorunludur ama Ollama onu yok sayar.
Hangi modelleri kullanabilirim?
Ollama kütüphanesindeki her şey; Llama, Qwen, Gemma, DeepSeek, Mistral, gpt-oss ve Phi ile gömme modelleri dahil. GGUF ve Safetensors modellerini de içe aktarabilirsiniz.
Modeller nerede saklanır?
Linux’ta Ollama hizmet olarak çalıştığında /usr/share/ollama/.ollama/models altında ya da Docker’da bağladığınız birimde. Daha büyük bir diskte tutmak için OLLAMA_MODELS ayarlayın.
Uzun belgelerde yanıtlar neden kısa kesiliyor?
Ollama varsayılan olarak 4.096 token’lık bir bağlam penceresi kullanır. Uzun belgeler için model ayarlarında veya istekte bağlam uzunluğunu artırın; daha uzun bağlam daha fazla bellek ister.
Ollama’yı nasıl güncellerim?
Resmi kurulum betiğini yeniden çalıştırın ya da yeni Docker imajını çekin; indirdiğiniz modeller yerinde kalır. Daha yeni bir sürüm yayınlandığında modelleri ollama pull ile güncelleyin.
Kendi modellerinizi çalıştırın
Uygulamayı, kaç kişinin kullanacağını ve nerede olduklarını yazın; size uygun bir sunucu önerelim.