Tidak seperti biasanya di blog ini, kami hampir tidak memiliki apa pun untuk dijual kepada Anda di sini. Kami adalah Geonode, kami menjual proxy, dan menjalankan model bahasa di perangkat Anda sendiri sama sekali tidak memerlukan hal-hal tersebut. Tanpa proxy, tanpa bandwidth, tanpa akun. Hubungannya hanya satu langkah: model lokal sering kali diterapkan dengan pengambilan data dari data Anda sendiri, dan jika data tersebut berasal dari web publik, seseorang harus mengumpulkannya. Itulah bagian kami dalam proses tersebut dan benar-benar terpisah dari model. Jadi, anggaplah ini sebagai panduan yang ditulis oleh orang-orang yang tidak memiliki kepentingan apa pun terkait model mana yang Anda pilih—posisi yang sebenarnya lebih jarang ditemui dalam kategori ini daripada yang seharusnya.
Apa yang Anda Dapatkan dari "Lokal" dan Berapa Biayanya
Sebaiknya kita membahasnya secara konkret, karena kedua sisi masalah ini sering kali dilebih-lebihkan.
Apa yang Anda peroleh. Data tidak pernah meninggalkan perangkat Anda, yang bagi pekerjaan yang diatur oleh regulasi bukanlah sekadar preferensi, melainkan suatu keharusan. Tidak ada biaya per token, sehingga penggunaan intensif atau eksperimental gratis setelah biaya perangkat keras. Tidak ada batasan kecepatan dan tidak bergantung pada waktu operasional pihak lain. Stabilitas versi yang lengkap — model tidak berubah di bawah pengawasan Anda, yang sangat penting jika Anda telah menyesuaikan prompt dengan perilakunya. Serta kemampuan untuk melakukan penyempurnaan (fine-tuning) pada data Anda sendiri tanpa mengirimkannya ke mana pun.
Apa yang Anda bayar. Kemampuan, sebagian besar. Model lokal terbaik pada tahun 2026 memang sangat baik, namun masih tertinggal dari model-model terdepan yang dihosting dalam hal penalaran yang kompleks. Perangkat keras, yang merupakan biaya modal nyata. Kecepatan, kecuali jika Anda telah membeli perangkat keras yang mumpuni. Waktu Anda sendiri untuk pengaturan, pilihan kuantisasi, dan integrasi. Serta listrik, yang bukan hal sepele untuk mesin yang beroperasi di bawah beban berkelanjutan.
Kerangka pemikiran yang menyesatkan orang adalah menganggap ini sebagai perbandingan biaya. Jika Anda mengirimkan beberapa ratus ribu token per bulan ke API yang dihosting, model lokal tidak akan menghemat uang Anda — biaya perangkat kerasnya lebih mahal daripada biaya penggunaan selama bertahun-tahun. Model lokal unggul dalam hal privasi, kontrol, dan stabilitas, atau pada volume yang sangat tinggi. Jika tidak ada satu pun dari hal tersebut yang berlaku bagi Anda, maka pertimbangan ekonomisnya pun tidak berlaku.
Pertimbangan Perangkat Keras Menentukan Segalanya
Sebelum melihat model apa pun, tentukan dulu kapasitas VRAM Anda. Segala hal lainnya bergantung pada hal itu.
| Memori yang tersedia | Apa yang dapat dijalankan dengan lancar | Harapan yang realistis |
|---|---|---|
| 8 GB | Model 4B–8B, terkuantisasi | Cocok untuk ringkasan, ekstraksi, dan obrolan sederhana |
| 12–16 GB | Model 12B–14B terkuantisasi, model MoE dengan kumpulan aktif kecil | Asisten umum yang andal, bantuan pemrograman yang memadai |
| 24 GB | MoE kelas 30 miliar, kuantisasi padat 32 miliar | Benar-benar mumpuni untuk sebagian besar tugas sehari-hari |
| 48 GB | 70B terkuantisasi | Mendekati kualitas tier menengah yang dihosting |
| 80 GB | MoE kelas 120B dengan kuantisasi asli | Kinerja puncak yang dapat dicapai oleh satu kartu |
Dua hal mengubah perhitungan ini menjadi menguntungkan bagi Anda.
Arsitektur Mixture-of-Experts (MoE). Arsitektur ini memiliki jumlah parameter total yang besar, tetapi hanya mengaktifkan sebagian kecil per token. gpt-oss-120b memiliki total 117 miliar parameter dan 5,1 miliar parameter aktif; Kartu model OpenAI menyatakan bahwa model ini muat "dalam satu GPU 80 GB (seperti NVIDIA H100 atau AMD MI300X)" dengan menggunakan kuantisasi MXFP4 pada bobot para ahli. gpt-oss-20b memiliki total 21 miliar parameter, 3,6 miliar di antaranya aktif, dan berjalan "dalam memori sebesar 16 GB". Anda mendapatkan manfaat kualitas dari model yang lebih besar dengan biaya memori dan kecepatan yang setara dengan model yang jauh lebih kecil.
Memori terpadu Apple Silicon. Pada Mac, memori sistem adalah memori GPU. Sebuah mesin dengan 64 GB memori terpadu dapat menjalankan model yang biasanya memerlukan kartu grafis yang tidak dimiliki kebanyakan orang. Laju pemrosesan (throughput) memang lebih rendah dibandingkan GPU diskrit dengan kapasitas setara, tetapi batas kapasitasnya jauh lebih tinggi dengan biaya yang sama.
Pertimbangkan juga anggaran untuk konteks. Ukuran model bukanlah satu-satunya faktor — cache KV bertambah seiring panjang konteks dan dapat menghabiskan beberapa gigabyte pada input yang panjang. Model yang muat pada konteks 4K mungkin tidak muat pada 128K.
Model-Model yang Layak Digunakan pada Tahun 2026
Qwen3 merupakan keluarga model yang paling berguna untuk penerapan lokal, terutama karena mencakup seluruh rentang ukuran dengan perilaku yang konsisten. Koleksi Hugging Face mencantumkan model-model padat berukuran 0,6B, 1,7B, 4B, 8 miliar, 14 miliar, dan 32 miliar token, ditambah varian campuran ahli (mixture-of-experts) 30 miliar-A3B dan 235 miliar-A22B, dengan versi kuantisasi dalam format FP8, GGUF, AWQ, GPTQ, dan MLX.
Kartu model Qwen3-8B mendokumentasikan fitur-fitur yang penting: lisensi Apache 2.0, 32.768 token konteks asli yang dapat diperluas hingga 131.072 dengan penskalaan YaRN, serta "dukungan terhadap lebih dari 100 bahasa dan dialek". Fitur yang membedakannya adalah kemampuan beralih antara mode berpikir untuk pekerjaan yang membutuhkan penalaran intensif dan mode non-berpikir untuk percakapan yang efisien, dalam satu model.
Satu detail praktis dari kartu tersebut yang sering terlewatkan: pengaturan sampling sangat penting, dan nilai yang direkomendasikan berbeda tergantung mode — temperature 0,6, top-p 0,95, top-k 20 untuk mode berpikir; temperature 0,7, top-p 0,8, top-k 20 untuk mode lainnya. Dekoding serakah secara eksplisit tidak disarankan dalam mode berpikir. Jika kinerja model lebih buruk dari yang Anda harapkan, periksa parameter sampling Anda sebelum menyalahkan model.
Gemma 4 dari Google merupakan rilis yang patut diperhatikan bagi siapa pun yang sebelumnya enggan menggunakan Gemma karena masalah lisensi, karena kini menggunakan lisensi Apache 2.0. Kartu model mencantumkan lima ukuran — E2B, E4B, 12B, 26B, A4B, dan 31B — dengan "jendela konteks 128K, sedangkan model berukuran sedang mendukung 256K", dukungan multibahasa dalam "lebih dari 140 bahasa", serta masukan teks dan gambar dengan dukungan audio pada model E2B, E4B, dan 12B. Masukan audio bawaan pada model open-weight berukuran kecil merupakan hal yang tidak biasa dan patut diketahui jika itu sesuai dengan kebutuhan Anda.
gpt-oss dari OpenAI mencakup kedua ujung spektrum tersebut. Model 20B muat di mesin 16 GB; model 120B muat di satu kartu 80 GB. Keduanya berlisensi Apache 2.0, yang dijelaskan pada kartu model sebagai "Lisensi Apache 2.0 yang permisif: Bangun secara bebas tanpa batasan copyleft atau risiko paten". Model 20B diposisikan untuk "latensi lebih rendah, serta kasus penggunaan lokal atau khusus", dengan pekerjaan agen, pemanggilan fungsi, dan eksekusi kode termasuk di antara aplikasi yang disebutkan.
DeepSeek-R1 tetap menjadi acuan untuk model penalaran terbuka dan berlisensi MIT, yang menurut kartu modelnya “mendukung penggunaan komersial, mengizinkan modifikasi apa pun, dan karya turunan”. Untuk penggunaan lokal, versi distilasi lebih penting daripada model lengkap: Versi distilasi berbasis Qwen tersedia dalam ukuran 1,5B, 7B, 14B, dan 32B, sedangkan versi berbasis Llama tersedia dalam ukuran 8B dan 70B; semuanya telah disesuaikan (fine-tuned) menggunakan "800 ribu sampel yang dikurasi dengan DeepSeek-R1". Distilasi 14 miliar dan 32 miliar adalah pilihan praktis untuk perangkat keras konsumen.
Llama tetap menjadi keluarga model yang paling banyak diunduh dengan selisih yang sangat jauh — perpustakaan Ollama menunjukkan llama3.1 dengan 119,1 juta unduhan dan llama3.2 dengan 82,1 juta unduhan, mengungguli deepseek-r1 dengan 92,2 juta unduhan dan gemma3 dengan 40 juta unduhan. Popularitas berarti ketersediaan alat terbaik, penyesuaian komunitas terbanyak, dan materi pemecahan masalah terlengkap, yang merupakan keunggulan nyata terlepas dari kemampuan mentahnya.
Dan jangan lupakan model tertanam. nomic-embed-text menempati posisi ketiga di perpustakaan Ollama dengan 84,2 juta kali diakses, yang menunjukkan betapa besarnya penggunaan LLM lokal sebenarnya berupa pencarian dokumen pribadi, bukan sekadar obrolan.
Lisensi Lebih Penting daripada Tolok Ukur
Bagian inilah yang menyelamatkan orang dari kesalahan yang mahal, namun sering diabaikan dalam perbandingan model.
"Bobot terbuka" bukanlah hal yang tunggal. Model-model di atas terbagi menjadi tiga kelompok:
Apache 2.0 — Qwen3, Gemma 4, gpt-oss, serta distilasi DeepSeek berbasis Qwen. Lisensi ini bersifat permisif, dapat digunakan secara komersial, tanpa batasan bidang penggunaan, dan mencakup pemberian hak paten. Jika Anda akan meluncurkan produk, inilah yang Anda butuhkan.
MIT — DeepSeek-R1 itu sendiri. Sama-sama permisif, secara eksplisit mendukung penggunaan komersial, modifikasi, dan karya turunan.
Lisensi komunitas khusus — keluarga Llama, dan secara turun-temurun distilasi DeepSeek berbasis Llama, yang masing-masing menggunakan lisensi Llama 3.1 dan Llama 3.3. Lisensi-lisensi ini mengizinkan banyak hal tetapi bukan Apache atau MIT: mereka memiliki kebijakan penggunaan yang dapat diterima, persyaratan atribusi, dan ketentuan yang berlaku saat jumlah pengguna mencapai batas tertentu. Biasanya tidak masalah. Namun, tidak otomatis aman, dan sebaiknya dibaca sebelum Anda mengembangkan produk berdasarkan lisensi tersebut.
Peralihan Gemma 4 ke lisensi Apache 2.0 sangat signifikan karena Gemma sebelumnya menggunakan lisensi khusus. Jika Anda pernah mengevaluasi keluarga model ini sebelumnya dan menolaknya karena alasan lisensi, alasan tersebut kini tidak berlaku lagi.
Dua poin praktis. Pertama, periksa lisensi model spesifik yang Anda unduh, bukan keluarga modelnya — distilasi DeepSeek adalah contoh paling jelas, di mana distilasi yang berbeda dari rilis yang sama memiliki lisensi berbeda tergantung pada model dasarnya. Kedua, jika Anda melakukan penyempurnaan (fine-tuning), bacalah ketentuan lisensi mengenai karya turunan dan penamaan, karena beberapa lisensi mewajibkan karya turunan tersebut menggunakan nama asli.
Alat-alat: Ollama, llama.cpp, LM Studio, vLLM
| Alat | Cocok untuk | Antarmuka | Kelebihan dan Kekurangan |
|---|---|---|---|
| Ollama | Memulai, pengembangan lokal | CLI + API HTTP | Kontrol yang lebih terbatas atas detail inferensi |
| llama.cpp | Kontrol maksimal, perangkat keras khusus | CLI + server | Anda harus mengonfigurasi semuanya sendiri |
| LM Studio | Pengguna non-teknis, eksperimen | GUI | Kurang cocok untuk otomatisasi |
| vLLM | Melayani banyak pengguna | API HTTP | Membutuhkan perangkat keras GPU yang memadai |
Ollama adalah pilihan default yang tepat bagi kebanyakan orang. Satu perintah untuk mengunduh model, titik akhir HTTP yang kompatibel dengan OpenAI, serta pengaturan default kuantisasi yang masuk akal. Batasannya adalah ketika Anda ingin menyesuaikan parameter inferensi secara presisi, pada akhirnya Anda akan melampaui batas tersebut.
llama.cpp adalah dasar pengembangan Ollama, dan menggunakannya secara langsung memberi Anda kendali penuh atas kuantisasi, penanganan konteks, pemindahan beban lapisan ke GPU, dan pemrosesan multithreading CPU. Ini juga merupakan jalur yang paling didukung untuk perangkat keras yang tidak umum — kartu grafis lama, sistem berbasis CPU saja, dan Apple Silicon.
LM Studio adalah aplikasi desktop dengan fitur pencarian model dan antarmuka obrolan. Jika pengguna model bukanlah seorang pengembang, inilah solusinya.
vLLM adalah sistem penyajian, bukan alat lokal, yang dirancang untuk throughput dengan pemrosesan batch berkelanjutan. Jika Anda menjalankan model untuk tim, bukan untuk diri sendiri, inilah tingkatan yang harus Anda pilih, dan sistem ini mengharuskan penggunaan perangkat keras GPU yang sesungguhnya.
Pola yang berguna: kembangkan menggunakan titik akhir Ollama yang kompatibel dengan OpenAI, dan jika nanti Anda perlu menyajikan model dengan benar, pindahlah ke vLLM melalui antarmuka yang sama. Kode aplikasi Anda tidak perlu diubah.
Kuantisasi Tanpa Asumsi Sembarangan
Kuantisasi mengurangi presisi numerik bobot sehingga model membutuhkan lebih sedikit memori. Inilah cara model yang secara nominal membutuhkan 60 GB dapat berjalan pada kartu memori 24 GB.
| Format | Ukuran vs FP16 | Kualitas | Digunakan saat |
|---|---|---|---|
| FP16/BF16 | 100% | Referensi | Anda memiliki memori yang cukup |
| Q8 | ~50% | Hampir tidak dapat dibedakan | Anda memiliki ruang dan menginginkan kualitas maksimal |
| Q5_K_M | ~35% | Sangat baik | Keseimbangan yang masuk akal |
| Q4_K_M | ~28% | Baik, penurunan kualitas ringan | Pengaturan default umum |
| Q3 dan di bawahnya | ~20% | Penurunan kualitas yang terlihat | Hanya jika tidak ada pilihan lain |
Aturan yang berlaku dalam praktik: model yang lebih besar dengan kuantisasi yang lebih berat biasanya mengungguli model yang lebih kecil dengan kuantisasi yang lebih ringan. Model 32B pada Q4 biasanya akan mengungguli model 14B pada Q8 dengan anggaran memori yang sama. Pengecualian terjadi pada ujung ekstrem — di bawah Q3, degradasi menjadi cukup parah sehingga hubungan tersebut terbalik.
Perhatikan juga bahwa MXFP4, yang digunakan untuk bobot ahli gpt-oss, merupakan kasus di mana kuantisasi merupakan bagian dari desain model, bukan sesuatu yang diterapkan setelahnya. Itulah sebabnya angka memori pada kartu model tersebut bisa serendah itu.
Lakukan pengujian pada beban kerja Anda sendiri daripada hanya mengandalkan tabel, termasuk tabel ini. Kuantisasi menurunkan kemampuan yang berbeda secara tidak merata, dan tingkat kuantisasi yang tidak terlihat pada ringkasan mungkin menjadi jelas pada pembuatan kode.
Harapan yang Realistis versus Batas Kemampuan
Menetapkan harapan ini dengan tepat dapat menghindari sebagian besar kekecewaan.
Di mana model lokal benar-benar kompetitif: ringkasan, ekstraksi, klasifikasi, terjemahan, pelengkapan kode sederhana, penyusunan draf, serta sistem tanya-jawab yang diperkuat dengan pencarian (retrieval-augmented question answering) atas dokumen Anda sendiri. Untuk semua hal ini, model 14B–32B yang dipilih dengan tepat sudah cukup, dan perbedaannya dengan model terdepan yang dihosting cukup kecil sehingga Anda mungkin sulit untuk menyadarinya.
Di mana kesenjangan masih nyata: penalaran multi-langkah yang panjang, pekerjaan agen yang kompleks, basis kode besar yang membutuhkan pemahaman mendalam, serta tugas-tugas yang membutuhkan pengetahuan dunia yang luas dan terkini. Kesenjangan tersebut telah menyempit secara signifikan. Namun, belum sepenuhnya tertutup.
Di mana model lokal menang mutlak: segala hal di mana data tidak boleh meninggalkan infrastruktur Anda, dan segala hal dengan volume yang cukup tinggi sehingga penetapan harga per token menjadi faktor dominan. Ini bukan argumen tentang kemampuan, namun seringkali menjadi faktor penentu.
Satu ekspektasi lagi yang perlu disesuaikan: kecepatan. Pada perangkat keras konsumen, model 32B menghasilkan token dengan kecepatan yang memadai untuk antarmuka obrolan, namun lambat untuk pemrosesan batch apa pun. Jika Anda memproses sepuluh ribu dokumen, ukur throughput sebelum memutuskan arsitektur yang akan digunakan.
Kapan Anda Sebaiknya Hanya Menggunakan API
Bagian yang membantah premis tersebut.
Ketika volume penggunaan Anda rendah. Beberapa ratus ribu token per bulan hanya membutuhkan biaya sangat kecil di API yang dihosting dan tidak akan pernah membenarkan pembelian GPU. Membeli perangkat keras hanya untuk menghindari tagihan kecil bukanlah keputusan yang bijak, kecuali perangkat keras tersebut memiliki kegunaan lain.
Saat Anda membutuhkan kemampuan terdepan. Jika tugas tersebut benar-benar membutuhkan kemampuan penalaran terkuat yang tersedia, model lokal belum mampu mencapainya dan berpura-pura sebaliknya hanya akan membuang-buang waktu berminggu-minggu.
Saat Anda tidak memiliki perangkat keras. Menjalankan model 7 miliar parameter pada kartu 8 GB hanya karena itulah yang Anda miliki, lalu menyimpulkan bahwa model lokal tidak bagus, adalah kekecewaan yang umum dan dapat dihindari. Model yang dapat Anda jalankan bukanlah model yang Anda baca di artikel.
Ketika pemeliharaan merupakan biaya yang tidak dapat Anda tanggung. Model diperbarui, alat pengembangan berubah, format kuantisasi berkembang. API yang dihosting adalah masalah operasional pihak lain.
Ketika Anda sedang membuat prototipe. Bangun berdasarkan API, pastikan produk berfungsi, lalu evaluasi apakah beralih ke model lokal sepadan. Urutan terbalik berarti menyelesaikan masalah perangkat keras sebelum Anda tahu apakah ide tersebut layak.
Dan kasus yang tidak ambigu: jika batasan Anda adalah data tidak boleh meninggalkan lokasi Anda, tidak ada satu pun dari hal di atas yang berlaku. Penggunaan lokal bukanlah preferensi dalam situasi tersebut, dan pertanyaannya hanyalah model mana yang sesuai dengan perangkat keras Anda.
Pertanyaan Populer Lainnya
Apa LLM lokal terbaik pada tahun 2026?
Tidak ada jawaban tunggal, tetapi Qwen3 merupakan keluarga model yang paling berguna untuk penerapan lokal karena mencakup skala dari 0,6 miliar hingga 235 miliar dengan perilaku yang konsisten dan lisensi Apache 2.0. Sesuaikan ukurannya dengan VRAM Anda: 8 miliar untuk 8–16 GB, model campuran ahli 30 miliar–A3B untuk 24 GB, dan gpt-oss-120b jika Anda memiliki kartu 80 GB.
Berapa banyak VRAM yang saya butuhkan untuk menjalankan LLM lokal?
8 GB dapat menjalankan model kuantisasi 4 miliar–8 miliar dengan baik. 16 GB cukup untuk menangani model 12 miliar–14 miliar dengan nyaman, atau gpt-oss-20b yang tercatat dapat berjalan dalam batas 16 GB. 24 GB memungkinkan penggunaan model kelas 30B. Arsitektur campuran ahli (Mixture-of-Experts) menguntungkan Anda karena hanya sebagian kecil parameter yang diaktifkan per token.
Apakah LLM lokal sebagus ChatGPT atau Claude?
Tidak pada tugas penalaran yang paling sulit. Untuk ringkasan, ekstraksi, klasifikasi, terjemahan, dan pencarian pada dokumen Anda sendiri, model lokal yang baik dengan ukuran 14B–32B sudah cukup mendekati sehingga perbedaannya jarang menjadi masalah. Kesenjangan tersebut semakin menyempit, tetapi belum tertutup sepenuhnya.
LLM lokal mana yang dapat saya gunakan secara komersial?
Qwen3, Gemma 4, dan gpt-oss berlisensi Apache 2.0. DeepSeek-R1 berlisensi MIT. Semuanya mengizinkan penggunaan komersial tanpa batasan bidang penggunaan. Keluarga Llama menggunakan lisensi komunitas khusus yang mengizinkan banyak hal, tetapi memiliki ketentuan yang perlu dibaca. Periksa model spesifiknya, bukan sekadar keluarganya — distilasi berbasis Qwen dari DeepSeek menggunakan lisensi Apache 2.0, sedangkan distilasi berbasis Llama menggunakan lisensi Llama.
Apa cara termudah untuk menjalankan LLM secara lokal?
Ollama untuk pengembang — satu perintah untuk mengunduh model, dan titik akhir HTTP yang kompatibel dengan OpenAI. LM Studio jika Anda menginginkan antarmuka grafis dan tidak ingin menggunakan baris perintah. Keduanya menangani kuantisasi dan deteksi perangkat keras untuk Anda.
Apakah kuantisasi mengurangi kualitas?
Sedikit, dan tidak merata. Q8 hampir tidak dapat dibedakan dari presisi penuh. Q4_K_M adalah pengaturan default umum dengan penurunan kualitas ringan yang tidak disadari kebanyakan orang. Di bawah Q3, perbedaannya menjadi jelas. Sebagai aturan umum, model yang lebih besar pada Q4 lebih unggul daripada model yang lebih kecil pada Q8 dengan anggaran memori yang sama.
Bisakah saya menjalankan LLM lokal di Mac?
Ya, dan seringkali kinerjanya lebih baik daripada di PC dengan harga yang sebanding, karena memori terpadu Apple Silicon tersedia untuk GPU. Mac dengan memori 64 GB dapat menjalankan model yang biasanya memerlukan kartu grafis yang kebanyakan orang tidak miliki. Laju pemrosesan (throughput) memang lebih rendah daripada GPU diskrit, tetapi batas kapasitasnya jauh lebih tinggi per pound.
Apakah saya memerlukan proxy atau konfigurasi jaringan khusus untuk LLM lokal?
Tidak. Model tersebut berjalan di mesin Anda dan tidak melakukan permintaan jaringan apa pun. Jaringan hanya berperan jika Anda mengumpulkan data web untuk diambil kembali, yang merupakan bagian terpisah sepenuhnya dari alur kerja.
Kesimpulan
Pertimbangkan dulu performa, baru lisensi, lalu benchmark. Urutan ini berlawanan dengan cara kebanyakan perbandingan ditulis, namun justru inilah yang menghasilkan sistem yang berfungsi dengan baik.
VRAM Anda menentukan model mana saja yang layak dipertimbangkan, dan arsitektur campuran ahli telah membuat batasan tersebut jauh lebih longgar — 117 miliar parameter pada satu kartu 80 GB, atau 21 miliar dalam 16 GB, dulunya bukanlah hal yang realistis. Lisensi menentukan apakah Anda dapat mendistribusikan apa yang Anda bangun, dan peralihan Gemma 4 ke Apache 2.0 berarti tingkatan lisensi yang permisif kini mencakup sebagian besar opsi yang kuat. Uji kinerja berada di urutan terakhir karena dalam kelas ukuran tertentu perbedaannya kecil, dan beban kerja spesifik Anda kemungkinan besar akan berbeda dengan hasil papan peringkat.
Ringkasan jujur mengenai kondisi saat ini: untuk pekerjaan yang dibatasi oleh privasi, untuk volume tinggi, dan untuk apa pun di mana Anda membutuhkan model yang tidak berubah-ubah, penggunaan lokal kini menjadi pilihan yang jelas-jelas baik, bukan sekadar kompromi. Untuk penggunaan sesekali pada kemampuan terdepan, hal ini masih belum berlaku, dan API yang dihosting tetap menjadi jawaban yang masuk akal.
