LLM lokal akhirnya mengalahkan cloud AI dalam hal coding, otomatisasi, dan brainstorming — inilah yang saya gunakan

Sebagai penggemar NLP, saya sering kali menjadi orang pertama yang mencoba model lokal baru saat model tersebut dirilis, asalkan model tersebut bukan kelas perusahaan dan dirancang untuk cluster H100. Laju rilis telah meningkat hingga ke titik di mana sangat mudah untuk mengabaikan model yang mumpuni, atau lebih buruk lagi, mendelegasikan tugas yang salah kepada orang yang salah. Tidak semua orang mempunyai waktu untuk membaca dokumentasi atau menjalankan tolok ukur kinerja mereka sendiri untuk mengetahui apa yang mereka lewatkan, dan perbedaan antara model yang dibuat untuk suatu tugas versus model yang hanya menoleransi tugas tersebut cukup besar untuk menjadi masalah. Setelah beberapa bulan bereksperimen (dan memecahkan banyak hal), saya telah memilih beberapa yang secara konsisten mengungguli yang lain dalam hal coding, brainstorming, dan bekerja dengan Home Assistant. Mereka telah mengurangi ketergantungan saya pada langganan cloud, dan karena mereka berjalan di perangkat keras saya, mereka sepenuhnya bersifat pribadi dan aman. Inilah yang saya gunakan. Qwen3-Coder secara konsisten menduduki puncak tolok ukur saya Saya tidak dapat menemukan model lokal yang lebih baik untuk pengembangan Python Jika Anda telah menghabiskan banyak waktu bereksperimen dengan model pengkodean lokal selama beberapa bulan terakhir, Qwen3-Coder tidak akan terlalu mengejutkan. Ini dengan cepat membuktikan dirinya sebagai dapat diandalkan, dan setelah menggunakannya untuk membangun beberapa utilitas Python dari awal, saya jadi mengerti alasannya. Ini adalah model pertama yang saya gunakan setiap kali saya memulai proyek baru, dan yang lebih penting, ini telah menjadi salah satu dari sedikit model lokal yang cenderung menghasilkan draf pertama yang bersih tanpa harus menghabiskan dua puluh menit berikutnya untuk melakukan debug atau pembersihan. Salah satu daya tariknya terletak pada seberapa mudah didekatinya rangkaian model tersebut, bergantung pada kebutuhan saya dan, tentu saja, perangkat keras saya. Melalui Ollama (atau LM Studio), Qwen3-Coder tersedia sebagai model Mixture-of-Experts 30B yang cocok untuk buffer VRAM besar, sedangkan versi 480B yang sangat besar tersedia untuk penerapan di perusahaan. Model konsumen adalah model yang akan dipedulikan sebagian besar orang, dan secara mengejutkan model ini juga bermanfaat bagi berbagai macam perangkat keras. Meskipun memiliki total 30 miliar parameter, ia hanya mengaktifkan 3,3 miliar untuk setiap token yang dihasilkan, sehingga memungkinkannya menghasilkan logika pengkodean yang canggih namun tetap tajam di RTX 4070 Ti Super saya. Alibaba juga telah melatihnya secara ekstensif menggunakan pembelajaran penguatan pada permintaan penarikan GitHub, dan hal ini jelas terlihat sedang digunakan. Jika Anda lebih condong ke arah pengembangan front-end dan antarmuka React atau JavaScript sekali pakai, saya juga merekomendasikan untuk tetap menggunakan Qwen 3.5 yang lebih baru di sampingnya. Keduanya saling melengkapi dengan sangat baik ketika digunakan bersama. Terkait Saya akhirnya menemukan LLM lokal sumber terbuka yang benar-benar bersaing dengan cloud AI Sumber terbuka sedang mengejar Gemma 4 adalah satu-satunya mitra curah pendapat yang saya andalkan. Ini seperti ChatGPT pribadi dan lokal Kebanyakan orang mengandalkan LLM untuk memahami data dan mengungkapkan tren yang jika tidak akan memerlukan waktu terlalu lama untuk diurai atau sulit ditangani secara manual. Ketergantungan ini terus meningkat sejak tahun 2023, namun masalahnya adalah, tidak semua pengguna memercayai penyedia cloud dengan data ini, terutama jika data tersebut berisi informasi yang dapat diidentifikasi yang akan menimbulkan masalah bagi mereka jika disusupi. Pikirkan laporan bank, laporan kesehatan, laporan arus kas untuk usaha kecil, atau dokumen hukum. Meskipun ada penyedia cloud yang memberikan anonimitas dan mematuhi peraturan perlindungan data, mereka tidak kebal terhadap pelanggaran data. Oleh karena itu, salah satu cara paling mudah untuk melindungi data Anda adalah dengan memastikan data tersebut tidak pernah meninggalkan mesin Anda. Untuk tujuan ini, saya menggunakan Gemma 4. Kemampuan penalarannya untuk sebagian besar tugas sehari-hari tidak jauh dari ChatGPT 4.0, dan saya yakin mengetahui bahwa saya dapat menyerahkan dokumen sensitif seperti laporan bank, tangkapan layar pengeluaran bulanan, faktur PDF, dan bahkan catatan tulisan tangan tanpa bertanya-tanya di mana mereka akan berakhir. Dukungan multimodal asli yang disertakan dengan model terbuka Google menjadikan keluarga Gemma menonjol. Daripada mengekstrak data apa pun menggunakan lapisan OCR sebelum mengajukan pertanyaan, saya cukup menyeret dokumen apa pun yang saya miliki dan mulai menanyakannya. Saya telah menggunakannya untuk meringkas laporan, catatan, dan langganan berulang yang muncul di laporan bulanan saya tanpa file apa pun mencapai server cloud seseorang. Jendela konteks 256K pada Gemma 4 26B (A4B) berarti bahwa hampir seluruh koleksi dapat tetap berada dalam memori kerja untuk kontinuitas. Terkait Saya menjalankan Gemma 4 dan Qwen 3.5 untuk tugas lokal yang sama, dan satu tugas melaju jauh ke depan Mengadu keduanya untuk menemukan yang terbaik untuk alur kerja saya Qwen3 4B Instruct sangat cocok untuk sebagian besar otomatisasi rumah pintar Model paling ringan yang melakukan pekerjaan paling konsisten Ketika menyangkut integrasi Home Assistant, ada model Qwen yang dibuat untuk tujuan tersebut. Qwen3 4B Instruct adalah model ringan yang mendukung pemanggilan alat asli, yang merupakan persyaratan yang tidak dapat dinegosiasikan dan mengesampingkan sebagian besar model tujuan umum. Tanpanya, LLM dapat “mendiskusikan” rumah pintar Anda, namun tidak dapat melakukan apa pun yang memerlukan tindakan. Dengan VRAM sekitar 3GB pada kuantisasi Q4, ini juga menyisakan banyak ruang untuk perangkat keras sederhana, dan latensi membuat respons terasa seketika untuk berbagai macam perintah. Alasan untuk menggunakan model 4B yang lebih ringkas dibandingkan model 30B yang lebih besar adalah kenyataan bahwa Asisten Rumah lebih menghargai kecepatan, keandalan, dan respons yang dapat diprediksi daripada penalaran mendalam atau kemampuan berpikir. Oleh karena itu, Qwen3 4B Instruct juga menghindari perilaku mode “berpikir” yang dapat mengganggu interaksi dengan menceritakan alasannya sebelum bertindak. Ia menerima instruksi dan menyelesaikan pekerjaannya, dan 90% dari waktunya, itulah yang Anda butuhkan. Ini saat terbaik untuk menjalankan AI lokal Ekosistem AI lokal masih terasa tidak terorganisir bagi pemula, bahkan dengan alat seperti Ollama dan LM Studio yang membuat penerapannya jauh lebih mudah dibandingkan sebelumnya. Hambatan untuk masuk dalam hal perangkat lunak dan keahlian tidak pernah serendah ini. Itu juga berarti ada kemungkinan Anda belum menemukan model yang paling sesuai dengan alur kerja atau kasus penggunaan Anda. Ketika model terbuka terus menjadi lebih baik, semakin besar kemungkinan untuk menemukan model yang dapat menggantikan, atau setidaknya, melengkapi langganan cloud AI Anda.
Diterbitkan : 2026-06-28 14:30:00
sumber : www.xda-developers.com



