Bu blog için alışılmadık bir şekilde, burada size satacak neredeyse hiçbir şeyimiz yok. Biz Geonode olarak proxy satıyoruz ve kendi makinenizde bir dil modelini çalıştırmak için bunların hiçbirine kesinlikle gerek yoktur. Proxy yok, bant genişliği yok, hesap yok. Bu bağlantı bir adım ötededir: yerel modeller genellikle kendi verilerinizden veri alımıyla birlikte kullanılır ve bu veriler halka açık web'den geliyorsa, birinin bunları toplaması gerekir. Bu, bizim işimizin son aşamasıdır ve modelden tamamen ayrıdır. Dolayısıyla bunu, hangi modeli seçeceğiniz konusunda hiçbir çıkarı olmayan kişiler tarafından yazılmış bir kılavuz olarak okuyun; bu, bu kategoride olması gerekenden daha nadir görülen bir durumdur.
“Yerel” Size Neler Kazandırır ve Maliyeti Nedir?
Bu konunun her iki yönü de sıklıkla abartıldığı için somut bir şekilde ele almakta fayda var.
Ne kazanırsınız? Veriler hiçbir zaman makinenizden dışarı çıkmaz; bu, düzenlemelere tabi işler için bir tercih değil, bir zorunluluktur. Token başına maliyet yoktur; dolayısıyla donanım maliyeti dışında yoğun veya deneysel kullanım ücretsizdir. Hız sınırlaması yoktur ve başkalarının hizmet sürelerine bağımlılık söz konusu değildir. Tam sürüm kararlılığı — model, kullanımınız sırasında değişmez; bu, komut istemlerini modelin davranışına göre ayarladıysanız son derece önemlidir. Ayrıca, verilerinizi hiçbir yere göndermeden kendi verileriniz üzerinde ince ayar yapma imkânı da vardır.
Ne ödersiniz? Çoğunlukla yetenek. 2026'daki en iyi yerel modeller gerçekten iyidir, ancak zorlu akıl yürütme konusunda hala öncü barındırılan modellerin gerisindedir. Donanım, ki bu gerçek bir sermaye maliyetidir. Hız, tabii ciddi bir donanım satın almadıysanız. Kurulum, niceleme seçimleri ve entegrasyon için harcadığınız zaman. Ve sürekli yük altında çalışan bir makine için azımsanmayacak bir maliyet olan elektrik.
İnsanları yanlış yönlendiren yaklaşım, bunu bir maliyet karşılaştırması olarak ele almaktır. Ayda birkaç yüz bin token barındırılan bir API’ye gönderiyorsanız, yerel modeller size para tasarrufu sağlamaz — donanım maliyeti, bu kullanımın yıllarca sürecek maliyetinden daha fazladır. Yerel modeller, gizlilik, kontrol ve istikrar açısından ya da çok yüksek hacimlerde avantajlıdır. Bunların hiçbiri sizin için geçerli değilse, ekonomik açıdan da avantajlı değildir.
Donanım Sorusu Diğer Her Şeyi Belirler
Herhangi bir modele bakmadan önce, VRAM’ınızı belirleyin. Diğer her şey bundan kaynaklanır.
| Kullanılabilir bellek | Rahatça çalışanlar | Gerçekçi beklenti |
|---|---|---|
| 8 GB | 4B–8B modeller, nicelendirilmiş | Özetleme, bilgi çıkarma ve basit sohbet için uygun |
| 12–16 GB | 12B–14B nicelendirilmiş, küçük aktif kümelere sahip MoE modelleri | Sağlam bir genel asistan, yeterli düzeyde kodlama yardımı |
| 24 GB | 30B sınıfı MoE, 32B yoğun kuantize | Çoğu günlük görevde gerçekten yetkin |
| 48 GB | 70B kuantize | Barındırılan orta seviye kaliteye yakın |
| 80 GB | Yerel kuantizasyonda 120B sınıfı MoE | Tek bir kartın yapabileceği en üst seviye |
İki şey bu hesaplamayı lehinize değiştirir.
Uzman Karışımı (Mixture-of-Experts) mimarileri. Bunlar toplamda çok sayıda parametreye sahiptir ancak her bir token için sadece bir kısmını etkinleştirir. gpt-oss-120b toplam 117 milyar parametreye ve 5,1 milyar aktif parametreye sahiptir; OpenAI'nin model kartında, uzman ağırlıklarının MXFP4 nicelleştirilmesi kullanılarak modelin "tek bir 80 GB GPU'ya (NVIDIA H100 veya AMD MI300X gibi) sığdığı" belirtilmektedir. gpt-oss-20b modelinde toplam 21 milyar parametre bulunmakta, 3,6 milyarı aktif durumdadır ve model "16 GB bellek sınırları içinde" çalışmaktadır. Çok daha küçük bir modelin bellek ve hız maliyetiyle, daha büyük bir modelin kalite avantajlarından yararlanabilirsiniz.
Apple Silicon birleşik bellek. Bir Mac'te sistem belleği, GPU belleğidir. 64 GB birleşik belleğe sahip bir makine, çoğu kişinin sahip olmadığı bir kart gerektirecek modelleri çalıştırabilir. İşlem hacmi, eşdeğer kapasiteli ayrık bir GPU'dan daha düşüktür, ancak fiyat-performans açısından kapasite sınırı çok daha yüksektir.
Ayrıca bağlamı da bütçenize dahil edin. Model ağırlıkları tek başına yeterli değildir — KV önbelleği bağlam uzunluğuyla birlikte büyür ve uzun girdilerde birkaç gigabayt yer kaplayabilir. 4K bağlama sığan bir model, 128K bağlama sığmayabilir.
2026’da Çalıştırmaya Değer Modeller
Qwen3, yerel dağıtım için en kullanışlı model ailesidir; bunun başlıca nedeni, tutarlı bir davranış sergileyerek tüm boyut aralığını kapsamasıdır. Hugging Face koleksiyonu 0,6B, 1,7B, 4B, 8B, 14B, 32B yoğun modellerin yanı sıra 30B-A3B ve 235B-A22B uzman karışımı varyantlarını FP8, GGUF, AWQ, GPTQ ve MLX formatlarında kuantize edilmiş sürümleriyle listelemektedir.
Qwen3-8B model kartı, önemli özellikleri belgelemektedir: Apache 2.0 lisansı, 32.768 tokenlik yerel bağlam (YaRN ölçeklendirmeyle 131.072'ye kadar genişletilebilir) ve "100'den fazla dil ve lehçeyi destekleme". Bu modelin ayırt edici özelliği, tek bir modelde akıl yürütme ağırlıklı işler için düşünme modu ile verimli diyalog için düşünmeme modu arasında geçiş yapabilmesidir.
Bu kartta insanların gözden kaçırdığı pratik bir ayrıntı: örnekleme ayarları önemlidir ve önerilen değerler moda göre farklılık gösterir — düşünme modu için sıcaklık 0,6, top-p 0,95, top-k 20; diğer modlar için sıcaklık 0,7, top-p 0,8, top-k 20. Düşünme modunda açgözlü kod çözme açıkça önerilmez. Bir modelin performansı beklediğinizden daha düşükse, modeli suçlamadan önce örnekleme parametrelerinizi kontrol edin.
Google’ın Gemma 4 sürümü, daha önce Gemma’nın lisans koşullarından dolayı çekinen herkes için dikkate değer bir sürümdür; çünkü artık Apache 2.0 lisansı altındadır. Model kartı beş boyutu listelemektedir — E2B, E4B, 12B, 26B, A4B ve 31B — "128K bağlam penceresi ile, orta boy modeller ise 256K'yı destekler", "140'tan fazla dilde" çok dilli destek ve E2B, E4B ve 12B modellerinde sesli metin ve görüntü girişi destekleniyor. Küçük, açık ağırlıklı bir modelde yerel ses girişi nadir görülen bir özelliktir ve kullanım senaryonuz bu yönde ise bu bilgiyi bilmenizde fayda var.
OpenAI’nin gpt-oss modeli, bu iki uç noktayı da kapsar. 20B, 16 GB'lık bir makineye sığar; 120B ise tek bir 80 GB'lık karta sığar. Her ikisi de Apache 2.0 lisanslıdır ve model kartlarında "İzin Verici Apache 2.0 lisansı: Copyleft kısıtlamaları veya patent riski olmaksızın serbestçe derleyin" şeklinde tanımlanmıştır. 20B, "daha düşük gecikme süresi ve yerel veya özel kullanım senaryoları" için tasarlanmıştır; belirtilen uygulamalar arasında ajansal çalışma, işlev çağrısı ve kod yürütme yer almaktadır.
DeepSeek-R1, açık akıl yürütme modelleri için referans olmaya devam etmektedir ve MIT lisansı altındadır; model kartında bu lisansın “ticari kullanımı desteklediği, her türlü değişikliğe ve türev çalışmalara izin verdiği” belirtilmektedir. Yerel kullanım için, damıtılmış sürümler tam modelden daha önemlidir: Qwen tabanlı damıtılmış sürümler 1,5B, 7B, 14B ve 32B, Llama tabanlı olanlar ise 8B ve 70B boyutlarındadır ve hepsi "DeepSeek-R1 ile derlenen 800 bin örnek" üzerinde ince ayarlanmıştır. 14B ve 32B distill'ler, tüketici donanımı için pratik seçimlerdir.
Llama, büyük bir farkla en çok indirilen aile olmaya devam ediyor — Ollama kütüphanesine göre llama3.1 119,1 milyon, llama3.2 ise 82,1 milyon kez indirilmiş olup, 92,2 milyon indirilen deepseek-r1 ve 40 milyon indirilen gemma3'i geride bırakıyor. Popülerlik, en iyi araçlar, en fazla topluluk tarafından yapılan ince ayarlar ve en fazla sorun giderme materyali anlamına gelir; bu da ham yeteneklerden bağımsız olarak gerçek bir avantajdır.
Ayrıca gömülü modelleri de göz ardı etmeyin. nomic-embed-text, Ollama kütüphanesinde 84,2 milyon erişimle üçüncü sırada yer alıyor; bu da yerel LLM kullanımının aslında sohbetten ziyade özel belgelerden bilgi alımına ne kadar yoğunlaştığını gösteriyor.
Lisanslar, Karşılaştırma Ölçütlerinden Daha Önemlidir
Bu bölüm, insanları pahalı bir hatadan kurtarır; ancak model karşılaştırmalarında genellikle göz ardı edilir.
“Açık ağırlıklar” tek bir kavram değildir. Yukarıdaki modeller üç gruba ayrılır:
Apache 2.0 — Qwen3, Gemma 4, gpt-oss, Qwen tabanlı DeepSeek türevleri. Esnek, ticari olarak kullanılabilir, kullanım alanı kısıtlaması yok, patent hakkı dahil. Bir ürün piyasaya sürüyorsanız, aradığınız lisans budur.
MIT — DeepSeek-R1'in kendisi. Aynı derecede esnek, ticari kullanımı, değiştirmeyi ve türev çalışmalarını açıkça destekler.
Özel topluluk lisansları — Llama ailesi ve miras yoluyla Llama tabanlı DeepSeek türevleri; bunlar sırasıyla Llama 3.1 ve Llama 3.3 lisanslarını taşır. Bunlar pek çok şeye izin verir ancak Apache veya MIT lisansı değildir: kabul edilebilir kullanım politikaları, atıf gereklilikleri ve yüksek kullanıcı sayısında devreye giren koşullar içerir. Genellikle uygundur. Otomatik olarak uygun değildir ve bunlardan birini kullanarak bir ürün geliştirmeden önce okumanızda fayda vardır.
Gemma 4’ün Apache 2.0’a geçişi, Gemma’nın daha önce özel bir lisans kullanmış olması nedeniyle özellikle önemlidir. Eğer bu aileyi daha önce değerlendirip lisans gerekçesiyle elediyseniz, bu neden artık geçerli değildir.
İki pratik nokta. İlk olarak, ürün ailesini değil, kullandığınız belirli modelin lisansını kontrol edin — DeepSeek distiller en net örnektir; burada aynı sürümün farklı distilleri, temel modellerine bağlı olarak farklı lisanslar taşır. İkincisi, ince ayar yapıyorsanız, lisansın türev çalışmalar ve isimlendirme konusunda ne dediğini okuyun; çünkü bazı lisanslar, türev çalışmanın orijinal adı taşımasını gerektirir.
Araçlar: Ollama, llama.cpp, LM Studio, vLLM
| Araç | En uygun olduğu alan | Arayüz | Avantaj-dezavantaj |
|---|---|---|---|
| Ollama | Başlangıç, yerel geliştirme | CLI + HTTP API | Çıkarım ayrıntıları üzerinde daha az kontrol |
| llama.cpp | Maksimum kontrol, sıra dışı donanım | CLI + sunucu | Her şeyi kendiniz yapılandırırsınız |
| LM Studio | Teknik bilgisi olmayan kullanıcılar, deneme amaçlı kullanım | GUI | Otomasyona daha az uygun |
| vLLM | Birden fazla kullanıcıya hizmet verme | HTTP API | Uygun GPU donanımı gerektirir |
Ollama, çoğu kişi için doğru varsayılan seçenektir. Modeli çekmek için tek bir komut, OpenAI uyumlu bir HTTP uç noktası ve mantıklı niceleme varsayılanları sunar. Tek sınırlaması, çıkarım parametrelerini hassas bir şekilde ayarlamak istediğinizde, eninde sonunda bu sınırın ötesine geçmeniz gerekecek olmasıdır.
llama.cpp, Ollama’nın temelini oluşturan bileşendir ve bunu doğrudan kullanmak size kuantizasyon, bağlam işleme, GPU katman yük devretme ve CPU iş parçacığı yönetimi üzerinde tam kontrol sağlar. Ayrıca, eski kartlar, yalnızca CPU kullanan sistemler ve Apple Silicon gibi sıra dışı donanımlar için en iyi desteklenen yoldur.
LM Studio, model keşfi ve bir sohbet arayüzü içeren bir masaüstü uygulamasıdır. Modeli kullanan kişi bir geliştirici değilse, aradığınız çözüm budur.
vLLM, yerel bir araçtan ziyade, sürekli toplu işleme ile verimlilik için tasarlanmış bir hizmet sistemidir. Modeli kendiniz için değil bir ekip adına çalıştırıyorsanız, geçmeniz gereken seviye budur ve bu sistem gerçek bir GPU donanımı gerektirir.
Yararlı bir yaklaşım: Ollama’nın OpenAI uyumlu uç noktası üzerinden geliştirme yapın ve daha sonra düzgün bir şekilde hizmet vermeniz gerekirse, aynı arayüz üzerinden vLLM’ye geçin. Uygulama kodunuz değişmez.
Abartısız Kuantizasyon
Kuantizasyon, ağırlıkların sayısal hassasiyetini azaltır; böylece modelin daha az belleğe ihtiyacı olur. Bu sayede, nominal olarak 60 GB gerektiren bir model, 24 GB’lık bir kartta çalışabilir.
| Format | FP16’ya Göre Boyut | Kalite | Ne Zaman Kullanılır |
|---|---|---|---|
| FP16/BF16 | %100 | Referans | Yeterli belleğiniz varsa |
| Q8 | ~%50 | Neredeyse ayırt edilemez | Yeterli alanınız varsa ve maksimum kalite istiyorsanız |
| Q5_K_M | ~%35 | Çok iyi | Makul bir denge |
| Q4_K_M | ~%28 | İyi, hafif kalite kaybı | Yaygın varsayılan ayar |
| Q3 ve altı | ~%20 | Fark edilebilir kalite kaybı | Yalnızca başka seçenek kalmadığında |
Uygulamada geçerli olan kural: daha ağır nicelemeye sahip daha büyük bir model, genellikle daha hafif nicelemeye sahip daha küçük bir modeli geride bırakır. Q4 seviyesindeki bir 32B model, aynı bellek bütçesinde tipik olarak Q8 seviyesindeki bir 14B modelden daha iyi performans gösterir. Bunun istisnası en uç durumlarda görülür — Q3'ün altında, performans düşüşü o kadar ciddi hale gelir ki durum tersine döner.
Ayrıca, gpt-oss uzman ağırlıkları için kullanılan MXFP4'ün, nicelleştirmenin sonradan uygulanan bir işlem değil, modelin tasarımının bir parçası olduğu bir örnek olduğunu da unutmayın. İşte bu nedenle, bu model kartlarındaki bellek değerleri bu kadar düşüktür.
Bu tablo da dahil olmak üzere hiçbir tabloya güvenmek yerine, kendi iş yükünüz üzerinde test yapın. Kuantizasyon, farklı yetenekleri eşit olmayan bir şekilde olumsuz etkiler ve özetleme için fark edilmeyen bir düzey, kod üretimi için bariz olabilir.
Gerçekçi Beklentiler ve Sınır Değer
Bunları doğru bir şekilde belirlemek, hayal kırıklıklarının çoğunu önler.
Yerel modellerin gerçekten rekabetçi olduğu alanlar: özetleme, veri çıkarma, sınıflandırma, çeviri, basit kod tamamlama, taslak oluşturma, kendi belgeleriniz üzerinde arama destekli soru-cevap. Tüm bunlar için, iyi seçilmiş bir 14B–32B modeli yeterlidir ve öncü bir model ile arasındaki fark o kadar küçüktür ki, fark etmekte zorlanabilirsiniz.
Aradaki farkın hâlâ gerçek olduğu alanlar: uzun, çok adımlı akıl yürütme, karmaşık ajansal işler, gerçek bir anlayış gerektiren büyük kod tabanları, geniş ve güncel dünya bilgisi gerektiren görevler. Aradaki fark önemli ölçüde azalmıştır. Ancak tamamen kapanmamıştır.
Yerel modellerin açık ara üstün olduğu alanlar: verilerin altyapınızdan çıkamayacağı her durum ve token başına fiyatlandırmanın baskın olduğu kadar yüksek hacimli her durum. Bunlar yetenek tartışmaları değildir ve genellikle belirleyici faktörlerdir.
Ayarlaması gereken bir beklenti daha var: hız. Tüketici donanımında 32B'lik bir model, sohbet arayüzü için uygun ancak toplu işler için yavaş sayılabilecek bir hızda token üretir. On bin belge işliyorsanız, bir mimariye karar vermeden önce iş hacmini ölçün.
Ne Zaman Sadece Bir API Kullanmalısınız?
Bu öncülü çürüten bölüm.
İş hacminiz düşük olduğunda. Ayda birkaç yüz bin token, barındırılan bir API’da çok düşük bir maliyet oluşturur ve asla bir GPU satın almayı haklı çıkarmaz. Düşük bir faturadan kaçınmak için donanım satın almak, donanımın başka kullanım alanları olmadığı sürece kötü bir yatırımdır.
En ileri düzeyde yeteneklere ihtiyacınız olduğunda. Görev gerçekten mevcut en güçlü akıl yürütme yeteneğini gerektiriyorsa, yerel modeller henüz bu seviyeye ulaşmamıştır ve aksini varsaymak haftalarca zaman kaybına neden olur.
Donanımınız olmadığında. Elinizde olan tek şey 8 GB'lık bir kart olduğu için 7 milyar boyutlu bir modeli bu kartta çalıştırıp, ardından yerel modellerin iyi olmadığı sonucuna varmak, yaygın ancak önlenebilir bir hayal kırıklığıdır. Çalıştırabileceğiniz model, hakkında okuduğunuz model değildir.
Bakım, karşılayamayacağınız bir maliyet olduğunda. Modeller güncellenir, araçlar değişir, niceleme formatları gelişir. Barındırılan bir API, başkasının operasyonel sorunudur.
Prototip oluştururken. Bir API'ye göre geliştirin, ürünün çalıştığını doğrulayın, ardından yerel ortama geçmenin değip değmeyeceğini değerlendirin. Tersine bir sıra izlemek, fikrin iyi olup olmadığını öğrenmeden önce donanım sorunlarını çözmek anlamına gelir.
Ve hiç belirsizlik barındırmayan durum: Eğer kısıtlamanız verilerin tesisinizden dışarı çıkmaması ise, yukarıdakilerin hiçbiri geçerli değildir. Bu durumda yerel çalışma bir tercih meselesi değildir ve asıl soru, hangi modelin donanımınıza uygun olduğudur.
Sık Sorulan Sorular
2026’da en iyi yerel LLM hangisidir?
Tek bir cevap yok, ancak Qwen3, tutarlı davranış sergilemesi ve Apache 2.0 lisansı ile 0,6 milyar ila 235 milyar arasında değişen ölçekleri kapsadığı için yerel dağıtım için en kullanışlı modeldir. Boyutu VRAM'inize göre seçin: 8–16 GB için 8B, 24 GB için 30B-A3B karışık uzman modeli, 80 GB kartınız varsa gpt-oss-120b.
Yerel bir LLM'yi çalıştırmak için ne kadar VRAM'e ihtiyacım var?
8 GB, kuantize edilmiş 4B–8B modelleri rahatlıkla çalıştırır. 16 GB, 12B–14B modelleri rahatlıkla kapsar; ya da 16 GB içinde çalıştığı belgelenmiş olan gpt-oss-20b modelini çalıştırabilir. 24 GB, 30B sınıfı modellerin önünü açar. Uzman karışımı mimarileri, her bir token başına parametrelerin sadece bir kısmı etkinleştiği için bu durumu sizin lehinize çevirir.
Yerel LLM'ler ChatGPT veya Claude kadar iyi mi?
En zor akıl yürütme görevlerinde hayır. Kendi belgeleriniz üzerinde özetleme, bilgi çıkarma, sınıflandırma, çeviri ve bilgi erişimi için iyi bir 14B–32B yerel model, aradaki farkın nadiren önem arz edeceği kadar yakındır. Aradaki fark daralıyor ancak henüz kapanmamıştır.
Hangi yerel LLM’leri ticari olarak kullanabilirim?
Qwen3, Gemma 4 ve gpt-oss, Apache 2.0 lisanslıdır. DeepSeek-R1 ise MIT lisanslıdır. Hepsi, kullanım alanı kısıtlaması olmaksızın ticari kullanıma izin verir. Llama ailesi, pek çok şeye izin veren ancak okunmaya değer koşullar içeren özel topluluk lisansları kullanır. Aile yerine belirli modeli kontrol edin — DeepSeek’in Qwen tabanlı distill modelleri Apache 2.0 lisansına sahipken, Llama tabanlı distill modelleri Llama lisanslarını taşır.
Bir LLM'yi yerel olarak çalıştırmanın en kolay yolu nedir?
Geliştiriciler için Ollama — modeli çekmek için tek bir komut ve OpenAI uyumlu bir HTTP uç noktası. Grafik arayüz istiyorsanız ve komut satırı kullanmak istemiyorsanız LM Studio. Her ikisi de sizin için kuantizasyon ve donanım algılamasını halleder.
Kuantizasyon kaliteyi düşürür mü?
Biraz, ancak bu durum değişkenlik gösterir. Q8, tam hassasiyetten neredeyse ayırt edilemez. Q4_K_M, çoğu kişinin fark etmediği hafif bir kalite kaybına neden olan yaygın varsayılan ayardır. Q3'ün altında kalite kaybı belirgin hale gelir. Kural olarak, aynı bellek bütçesinde Q4'teki daha büyük bir model, Q8'deki daha küçük bir modelden daha iyi performans gösterir.
Mac'te yerel bir LLM çalıştırabilir miyim?
Evet, ve genellikle benzer fiyatlı bir PC'den daha iyi performans gösterir, çünkü Apple Silicon'un birleşik belleği GPU tarafından kullanılabilir. 64 GB'lık bir Mac, çoğu kişinin sahip olmadığı bir grafik kartı gerektiren modelleri çalıştırabilir. İşlem hacmi, ayrık bir GPU'dan daha düşüktür, ancak pound başına kapasite sınırı çok daha yüksektir.
Yerel LLM’ler için proxy’lere veya özel ağ yapılandırmasına ihtiyacım var mı?
Hayır. Model, makinenizde çalışır ve herhangi bir ağ isteği göndermez. Ağ, yalnızca geri getirmek üzere web verisi topluyorsanız devreye girer; bu ise iş akışının tamamen ayrı bir parçasıdır.
Sonuç
Önce bellek kapasitesine, sonra lisansa, en son da performans testlerine göre seçim yapın. Bu sıralama, çoğu karşılaştırma yazısının izlediği sıralamanın tam tersidir ve işleyen bir sistem elde etmenizi sağlayan sıralamadır.
Hangi modellerin aday olabileceğini VRAM'iniz belirler ve uzman karışımı mimariler bu kısıtlamayı önemli ölçüde hafifletmiştir — tek bir 80 GB'lık kartta 117 milyar parametre ya da 16 GB'lık bir kartta 21 milyar parametre, uzun zaman önce gerçekçi olmayan önerilerdi. Lisans, geliştirdiğiniz ürünü piyasaya sürüp süremeyeceğinizi belirler ve Gemma 4’ün Apache 2.0 lisansına geçişi, izin veren lisans kademesinin artık en güçlü seçeneklerin çoğunu kapsadığı anlamına gelir. Performans testleri en son gelir çünkü belirli bir boyut sınıfı içinde farklar küçüktür ve spesifik iş yükünüz zaten sıralama tablosundaki sonuçlarla uyuşmayacaktır.
Durumun dürüst bir özeti şudur: Gizlilik kısıtlamaları olan işler, yüksek hacimli işler ve modelin sürekli değişmesini istemediğiniz her türlü durum için, yerel çözüm artık bir uzlaşma değil, doğrudan iyi bir seçenektir. En ileri düzeyde ara sıra kullanım için ise hâlâ uygun değildir ve barındırılan bir API makul çözüm olmaya devam eder.
