Ollama Nedir, Nasıl Kurulur? Kendi Sunucunuzda LLM

Ollama Nedir, Nasıl Kurulur? Kendi Sunucunuzda LLM

Kisaca

Ollama, buyuk dil modellerini kendi sunucunuzda yerel calistiran acik kaynakli bir aractir; veri disari cikmaz, token ucreti yoktur. Kurulum tek komutla yapilir (curl -fsSL https://ollama.com/install.sh | sh), model ollama run ile indirilip calistirilir. GPU sart degildir; 7B/8B modeller CPU’da da calisir, ama LLM’ler bellege ac oldugundan paylasimli degil ayrilmis kaynakli bir VPS/sunucu gerekir.

  • Bellek kabaca: 7B/8B icin en az 8 GB, 13B/14B icin 16 GB, 70B icin 64 GB+ (4-bit Q4)
  • Model secimi: genel is icin Llama 3.2/Mistral, Turkce icin Qwen3/Gemma 3, akil yurutme icin Phi-4/DeepSeek R1
  • En cok atlanan adim: Ollama API’sinde kimlik dogrulama YOK; 0.0.0.0 ile internete cikplak acmayin, firewall + SSH tuneli veya kimlik dogrulamali ters proxy kullanin
  • 11434 portunda REST API ve OpenAI uyumlu uc nokta sunar; Open WebUI ile ChatGPT benzeri arayuz kurulabilir

Ollama, büyük dil modellerini (LLM) kendi sunucunuzda yerel olarak indirip çalıştırmanızı sağlayan açık kaynaklı bir araçtır. ChatGPT benzeri bir yapay zekayı, verilerinizi hiçbir bulut servisine göndermeden, tamamen kendi donanımınızda çalıştırmanın bugün için en pratik yoludur. Arka planda yüksek verimli llama.cpp motorunu kullanır; modelleri tek komutla indirir, hem komut satırından hem de yerel bir REST API (http://localhost:11434) üzerinden erişim sunar. Bu rehberde Ollama’nın kurulumunu, doğru model seçimini, donanım gereksinimlerini ve çoğu yazının atladığı konuyu (sunucuyu ağa güvenli açma) baştan sona anlatıyorum.

LLM’ler belleğe ve işlem gücüne aç olduğundan, Ollama’yı paylaşımlı bir ortamda değil, ayrılmış kaynaklı bir VPS ya da sunucuda çalıştırmak doğru yaklaşımdır. Modelin tamamı RAM’e (GPU varsa VRAM’e) yüklendiği için, kaynağı komşularınızla paylaştığınız bir ortamda performans tahmin edilemez hale gelir.

Neden Kendi Sunucunuzda LLM Çalıştırmalısınız?

Bulut tabanlı yapay zeka API’leri pratiktir, ancak her sorgu için token başına ücret alır ve gönderdiğiniz tüm veriler üçüncü taraf sunuculardan geçer. Ollama ile bu denklemi tersine çevirirsiniz: model bir kez indirilir, sonrasında sınırsız ve ücretsiz sorgu yaparsınız; üstelik promptlarınız ve verileriniz sunucunuzdan asla çıkmaz.

Bu fark özellikle müşteri verisi işleyen ekipler için belirleyicidir. Bir hukuk bürosunun sözleşmelerini, bir kliniğin hasta notlarını veya bir e-ticaret firmasının müşteri yazışmalarını dış bir API’ye yollamak çoğu zaman KVKK ve GDPR açısından sorun yaratır. Ollama’yı Türkiye’deki bir sunucuda çalıştırdığınızda veri yurt dışına çıkmaz, sorumluluk zinciri sizde kalır ve uyum süreci ölçülebilir biçimde basitleşir. Buna bir de aylık fatura sürprizinin olmaması ve internet kesintisinden etkilenmeyen offline çalışma eklenince, yerel LLM birçok kurum için mantıklı bir tercih haline gelir.

Mail hosting 1 ay ücretsiz

Ollama Kurulumu (Tek Komut)

Linux sunucuya kurulum, resmi script ile tek satırdır:

curl -fsSL https://ollama.com/install.sh | sh

Kurulum bittiğinde Ollama bir systemd servisi olarak otomatik çalışır ve sunucu yeniden başladığında kendiliğinden ayağa kalkar. Servisin durumunu kontrol etmek için:

systemctl status ollama

Kurulum sırasında script, NVIDIA veya AMD ekran kartınızı otomatik algılar ve uygun sürücü/çalıştırma katmanını yapılandırır. GPU yoksa sorun değil; Ollama CPU üzerinde de sorunsuz çalışır. AlmaLinux, Ubuntu, Debian gibi yaygın dağıtımların tamamında aynı script geçerlidir.

Model İndirme ve Çalıştırma

Bir modeli çalıştırmak için ollama run komutu kullanılır; model yerelde yoksa otomatik olarak indirilir. Sık kullanılan, gerçek model adlarından bazıları:

ollama run llama3.2        # Meta Llama 3.2 (hafif 1B/3B varyantlar)
ollama run mistral         # Mistral 7B
ollama run gemma3          # Google Gemma 3
ollama run qwen3           # Alibaba Qwen3 (çok dilli, güçlü)
ollama run phi4            # Microsoft Phi-4 (akıl yürütme odaklı)
ollama run deepseek-r1     # DeepSeek R1 (adım adım düşünme)

# belirli boyut seçmek için :etiket kullanılır
ollama run llama3.2:3b
ollama run gemma3:27b

Komut çalıştığında interaktif bir sohbet başlar; çıkmak için /bye yazın. Bir prompt’u doğrudan tek seferde sormak isterseniz tırnak içinde geçirebilirsiniz: ollama run llama3.2 "Bu metni özetle: ...". Günlük yönetim için işinize yarayacak komutlar:

Komut İşlevi
ollama pull <model> Modeli çalıştırmadan sadece indirir
ollama list İndirilmiş modelleri ve disk boyutlarını listeler
ollama ps O an bellekte yüklü çalışan modelleri gösterir
ollama rm <model> Bir modeli diskten siler, yer açar
ollama show <model> Modelin parametre, bağlam penceresi ve şablon bilgisini verir

Hangi Modeli Seçmeli?

Model seçiminde tek bir doğru cevap yok; donanımınız ve işin türü belirleyici. Aşağıdaki tablo, hangi senaryoda nereden başlamanızın mantıklı olduğunu özetliyor:

İhtiyaç Önerilen başlangıç Neden
Genel sohbet, özetleme, günlük görevler Llama 3.2 (3B), Mistral 7B Hızlı, az kaynak ister, dengeli
Türkçe ve çok dilli metin Qwen3, Gemma 3 Çok dilli verilerle güçlü eğitilmiş
Kodlama ve teknik üretim Qwen3, Phi-4 Kod ve mantık görevlerinde iyi
Matematik / adım adım akıl yürütme DeepSeek R1, Phi-4 Zincirleme düşünme (chain-of-thought)
En yüksek kalite (bütçe ve donanım uygunsa) 27B-70B varyantlar Daha doğru, ama ciddi RAM/VRAM ister

Pratik tavsiye: küçük başlayın. 7B-14B aralığındaki bir model çoğu iş için şaşırtıcı derecede yeterlidir ve donanımınızı zorlamadan hızlı yanıt verir. İhtiyacı gördükten sonra büyük modele geçmek, baştan 70B’ye yatırım yapıp hayal kırıklığına uğramaktan her zaman daha iyidir.

Sistem Gereksinimleri (RAM / VRAM)

Aşağıdaki değerler, Ollama’nın varsayılan 4-bit (Q4) kuantizasyonu içindir. Kuantizasyon, modeli daha az bellekle çalışacak şekilde sıkıştırır ve çoğu kullanım için kaliteyi gözle görülür biçimde düşürmez:

Model boyutu Gerekli RAM/VRAM Tipik kullanım
1B – 3B en az 4 GB Hafif görevler, gömülü/edge
7B / 8B en az 8 GB Günlük sohbet ve özetleme
13B / 14B en az 16 GB Daha kaliteli yanıtlar
33B – 34B ~32 GB Ciddi üretim işleri
70B 64 GB+ (pratikte güçlü GPU) En yüksek kalite

Önemli nokta: GPU şart değildir. Ollama CPU üzerinde de çalışır; daha yavaştır ama 7B/8B gibi küçük modeller makul bir hızda yanıt verir. NVIDIA (CUDA) veya AMD (ROCm) GPU varsa Ollama bunu otomatik kullanır ve token üretim hızını kat kat artırır. Mutlak minimum: 8 GB RAM, AVX2 destekli 64-bit CPU ve modeller için 10-20 GB boş disk. Kaba bir kural olarak, 4-bit modeller her milyar parametre için yaklaşık 0,6-0,7 GB bellek tüketir; yani 7B’lik bir model ~5 GB, üstüne bağlam penceresi ve işletim sistemi için bir miktar pay bırakmanız gerekir.

Hız beklentisi konusunda gerçekçi olun. CPU üzerinde 7B bir model genelde saniyede birkaç ila on token üretir (okunabilir ama yavaş hissedilir); aynı modeli uygun bir GPU’ya aldığınızda bu rakam onlarca, hatta yüzlerce token’a çıkabilir. İnteraktif bir uygulama (canlı sohbet botu) planlıyorsanız GPU ya da en azından bol çekirdekli, yüksek saat hızlı bir CPU ciddi fark yaratır.

Ollama’yı Ağa Güvenli Açmak (En Çok Atlanan Adım)

Ollama varsayılan olarak yalnızca 127.0.0.1 (localhost) üzerinde dinler; yani API’ye sadece sunucunun kendisinden erişilir. Başka bir makineden ya da uygulamanızdan bağlanmak için servisin dış arayüzleri de dinlemesi gerekir. Bunu yapmak için bir systemd override ekleyin:

systemctl edit ollama

# Açılan dosyaya ekleyin:
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"

# Ardından:
systemctl daemon-reload
systemctl restart ollama

Burada kritik bir uyarı var ve birçok rehber bunu söylemeden geçer: Ollama’nın API’si hiçbir kimlik doğrulama içermez. Ne API anahtarı, ne parola, ne token. 0.0.0.0 ile dinleyen bir Ollama’yı doğrudan internete açık bırakırsanız, IP’nizi bulan herkes modellerinizi listeleyebilir, sizin donanımınızda sorgu çalıştırabilir ve sunucunuzu kötüye kullanabilir. Bu yüzden API’yi asla çıplak biçimde dünyaya açmayın. Doğru yaklaşımlar:

  • Güvenlik duvarı (firewall): 11434 portunu yalnızca güvendiğiniz IP’lere açın; gerisini kapatın. Sunucu güvenlik duvarınızla bu kuralı bir dakikada tanımlarsınız.
  • SSH tüneli: Portu hiç açmadan, ssh -L 11434:localhost:11434 kullanici@sunucu ile şifreli bir tünel kurun. En basit ve en güvenli yöntem budur.
  • Kimlik doğrulamalı ters proxy: Nginx’i Ollama’nın önüne koyup HTTP Basic Auth ya da bir API anahtarı katmanı ekleyin; isteğe bağlı olarak HTTPS ile şifreleyin.

Özetle: kolaylık için 0.0.0.0 demek caziptir, ama public bir sunucuda bunu firewall ya da tünel olmadan yapmak doğrudan açık kapı bırakmaktır.

REST API ile Uygulamanıza Bağlamak

Ollama’nın asıl gücü, kendi uygulamanıza entegre edilebilmesidir. Servis ayağa kalktığında 11434 portunda bir REST API sunar. Basit bir üretim isteği şöyle görünür:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Türkiye veri merkezlerinin avantajını bir cümleyle açıkla.",
  "stream": false
}'

Ollama ayrıca OpenAI uyumlu bir uç nokta da sunar (/v1/chat/completions). Bu sayede ChatGPT API’sine göre yazılmış mevcut kodunuzu, yalnızca temel URL’i kendi sunucunuza çevirerek Ollama’ya yönlendirebilirsiniz; çoğu durumda başka bir değişiklik gerekmez. Bu, hazır bir uygulamayı bulut yerine kendi altyapınıza taşımanın en hızlı yoludur.

Open WebUI ile ChatGPT Benzeri Arayüz

Komut satırı yerine görsel bir arayüz isterseniz, Open WebUI’yi Docker ile kurabilirsiniz:

docker run -d -p 3000:8080 
 --add-host=host.docker.internal:host-gateway 
 -v open-webui:/app/backend/data 
 --name open-webui --restart always 
 ghcr.io/open-webui/open-webui:main

Ardından http://SUNUCU_IP:3000 adresinden, ChatGPT’ye benzer bir arayüzle kendi modelinizle sohbet edebilir, geçmişi saklayabilir ve birden fazla kullanıcı tanımlayabilirsiniz. Open WebUI, Ollama’ya otomatik bağlanır; dahası belge yükleyip kendi verileriniz üzerinde soru sormanızı sağlayan dahili bir RAG (belge tabanlı arama) özelliği de barındırır. Bu da kurum içi bir bilgi asistanı kurmak için en pratik kombinasyonlardan biridir.

Sık Karşılaşılan Sorunlar

Model çok yavaş çalışıyor: Büyük ihtimalle model belleğe sığmıyor ve diske taşıyor (swap). ollama ps ile modelin tamamen GPU/RAM’de mi yoksa kısmen CPU’da mı olduğunu görün; sığmıyorsa bir alt boyuta ya da daha düşük kuantizasyona geçin. GPU kullanılmıyor: Sürücülerin ve CUDA/ROCm katmanının kurulu olduğundan emin olun; ollama ps çıktısı modelin GPU’da olup olmadığını gösterir. Disk doluyor: Modeller gigabaytlar tutar; kullanmadıklarınızı ollama rm ile temizleyin. Başka makineden bağlanamıyorum: Yukarıdaki OLLAMA_HOST ayarını ve firewall kuralını kontrol edin.

Avantajlar ve Dezavantajlar

Kendi sunucunuzda LLM’in başlıca avantajları gizlilik (veri dışarı çıkmaz), maliyet (token ücreti yok, sabit sunucu gideri) ve kontroldür (model sürümünü sabitlersiniz, sağlayıcının modeli değiştirmesinden ya da internet kesintisinden etkilenmezsiniz). Dezavantaj tarafında, iyi performans için güçlü ve kimi zaman pahalı donanım gerekebilir; ayrıca en üst düzey kapalı modellere kıyasla açık modeller bazı zorlu görevlerde geride kalabilir. Yine de çoğu pratik senaryoda 7B-14B aralığındaki modeller fazlasıyla iş görür ve doğru sunucuda kurulduğunda yerel LLM, hem bütçe hem uyum açısından sağlam bir tercih olur.

Sıkça Sorulan Sorular

Ollama ücretsiz mi?

Evet, Ollama açık kaynaklı ve ücretsizdir. Tek maliyet üzerinde çalıştığı sunucudur; bir kez kurduktan sonra sorgu başına ücret ödemezsiniz.

GPU olmadan çalışır mı?

Evet. Küçük modeller (7B/8B) CPU üzerinde çalışır, sadece daha yavaştır. GPU eklemek token üretim hızını kat kat artırır ama zorunlu değildir.

Hangi model benim için uygun?

8-16 GB RAM’li bir sunucuda 7B/8B veya 13B modeller idealdir. Türkçe ve çok dilli işler için Qwen3 ya da Gemma 3, akıl yürütme için Phi-4 veya DeepSeek R1 iyi başlangıçlardır. Yüksek kalite için daha büyük model ve GPU gerekir.

Verilerim dışarı gönderiliyor mu?

Hayır. Ollama tamamen yerel çalışır; promptlarınız ve verileriniz sunucunuzdan çıkmaz. KVKK ve GDPR yükümlülüğü olan projeler için en büyük avantajı budur.

API ile kendi uygulamama bağlayabilir miyim?

Evet. Ollama 11434 portunda REST API sunar ve OpenAI uyumlu bir uç noktası da vardır; mevcut kodunuzun temel URL’ini değiştirerek bağlanabilirsiniz.

Ollama’yı internete açmak güvenli mi?

Doğrudan açmak güvenli değildir; Ollama API’sinde varsayılan kimlik doğrulama yoktur. Mutlaka güvenlik duvarıyla IP kısıtlayın, SSH tüneli kullanın ya da kimlik doğrulamalı bir ters proxy arkasına alın.

Modeli nasıl güncellerim?

ollama pull <model> komutu ilgili modelin en güncel sürümünü indirir. Ollama yazılımının kendisini de aynı kurulum scriptiyle güncelleyebilirsiniz.

Paylaşımlı hosting üzerinde Ollama çalıştırabilir miyim?

Hayır. Ollama modeli tamamen belleğe yükler ve sistem düzeyinde kurulum gerektirir; bu nedenle root erişimi olan, ayrılmış kaynaklı bir VPS ya da fiziksel sunucu gerekir.

Yapay Zeka İçin Yüksek Bellekli Sunucu

Ollama ve yerel LLM’ler için ayrılmış RAM/CPU sunan, İzmir’deki kendi veri merkezimizde barındırılan güçlü VPS ve bulut sunucu çözümleri. Verileriniz Türkiye’de, kontrol sizde.

Sunucu Çözümleri →

Türkiye'nin En Çok Tavsiye Edilen Domain, Hosting ve Bulut Servis Sağlayıcısı
İnternet sitesi Alastyr İnternet Sitesi
Yazı oluşturuldu 511

Benzer yazılar

Aramak istediğinizi üstte yazmaya başlayın ve aramak için enter tuşuna basın. İptal için ESC tuşuna basın.

Üste dön