डेढ़ साल पहले मैंने एक दोस्त से कहा था कि ओपन वेट्स पर गंभीर काम करना शौक है, कोई योजना नहीं। मैं गलत था, और मैं उस संख्या को बता सकता हूँ जिसने मेरा मन बदला: 87।
यही वह जगह है जहाँ DeepSeek V4 Pro आज BenchLM के कम्पोज़िट लीडरबोर्ड पर बैठता है। एक ऐसा मॉडल जिसे आप पूरी तरह डाउनलोड कर सकते हैं, वेट्स सहित, जो क्लोज़्ड फ्रंटियर के ठीक नीचे बैठता है न कि मीलों पीछे। तो मैं वह बेशर्म काम करना चाहता हूँ और 2026 के मध्य में सर्वश्रेष्ठ ओपन सोर्स LLM विकल्पों की वास्तव में तुलना करना चाहता हूँ, इस आधार पर कि प्रत्येक किस चीज़ में वाकई अच्छा है। न कि इस आधार पर कि किसका लॉन्च वीक सबसे ज़ोरदार था।
ओपन-वेट लीडरबोर्ड, सीधे शब्दों में
BenchLM के कम्पोज़िट स्कोर पर ओपन पैक अभी यहाँ खड़ा है। सूची से पहले एक चेतावनी: ये स्कोर जून 2026 तक BenchLM द्वारा बताए गए आँकड़े हैं — इन्हें दिशा-संकेत मानें, अंतिम सत्य नहीं।
- DeepSeek V4 Pro (Max) — लगभग 87। शीर्ष ओपन मॉडल।
- GLM-5.1 — लगभग 83।
- Kimi K2.6 — लगभग 81।
- GLM-5 (Reasoning) — लगभग 79।
- Qwen3.5 397B (Reasoning) — लगभग 77।
यह अंतर देखें। पहले और पाँचवें के बीच दस अंक हैं, और उसमें हर मॉडल ऐसा है जिसे आप खुशी से प्रोडक्शन में भेजेंगे। लीडरबोर्ड रैंक दर्जनों टास्क का औसत है। आप प्रोडक्शन में औसत नहीं चलाते। आप अपना वर्कलोड चलाते हैं।
तो उपयोगी सवाल "कौन सा सबसे अच्छा है" नहीं है। यह है "किसमें सबसे अच्छा।" मुझे इसे काम के हिसाब से अलग करने दें।
कोडिंग के लिए सर्वश्रेष्ठ ओपन सोर्स LLM
यह वह श्रेणी है जहाँ ओपन वेट्स बैकअप रहना बंद हो गए।
GLM-5 SWE-bench Verified पर लगभग 77.8% पोस्ट करता है, BenchLM के अनुसार। वह बेंचमार्क मॉडल को असली रिपॉजिटरी में असली GitHub इश्यू ठीक करने देता है, किसी साफ-सुथरे फ़ंक्शन को ऑटोकम्पलीट करने के लिए नहीं। मध्य-से-उच्च 70 का दायरा फ्रंटियर के करीब का इलाका है। DeepSeek V4 Pro उसी टेस्ट में लगभग 80.6% पर उसके साथ है। अगर आप Claude Code या Cursor में रहते हैं और चाहते हैं कि कोई सेल्फ-होस्टेबल चीज़ मल्टी-फ़ाइल रिफैक्टर में टिके, तो दोनों में से कोई भी उचित पहली पसंद है। जब मुझे छोटे फुटप्रिंट चाहिए तो मैं GLM-5 की तरफ झुकता हूँ और जब ज़्यादा गुंजाइश चाहिए तो DeepSeek की।
हालांकि एक ईमानदार सीमा है। SWE-bench Verified केवल यह जाँचता है कि पैच टेस्ट पास करता है या नहीं। यह नहीं बताता कि आपका सीनियर इंजीनियर pull request को अप्रूव करेगा या नहीं। यह जानना कि कब किसी फ़ाइल को न छुएं, कब किसी बदसूरत चीज़ को इसलिए छोड़ दें क्योंकि उसे फिर से लिखना उसे रखने से ज़्यादा जोखिम भरा है — इस तरह का संयम किसी स्कोर में नहीं दिखता। तो 77.8% को रिपोर्ट किए गए आँकड़े के रूप में लें, और फिर भी हर diff ज़रूर पढ़ें।
लॉन्ग कॉन्टेक्स्ट के लिए सर्वश्रेष्ठ ओपन सोर्स LLM
क्या आप पूरा कोडबेस, या एक साल के डिज़ाइन डॉक्स एक बार में फीड करना चाहते हैं? Llama 4 Scout लगभग 1 करोड़ टोकन का कॉन्टेक्स्ट विंडो विज्ञापित करता है, इस Hugging Face लेख के अनुसार। यह विज्ञापित आँकड़ा है, और वेट्स ओपन हैं। डॉक्यूमेंट-हेवी रिट्रीवल या पूरे-रिपो एनालिसिस के लिए, कच्ची विंडो साइज़ पर कोई और ओपन मॉडल करीब नहीं आता।
उत्साहित होने से पहले मैं दो बातें ध्यान में रखूँगा। विशाल विंडो और "इस पूरे पर भरोसेमंद तरीके से तर्क करता है" एक ही दावा नहीं हैं। मैंने जो भी मॉडल टेस्ट किए हैं — ओपन या क्लोज़्ड — उन सभी में दूरी के साथ रिकॉल पतला होता जाता है। और ईमानदारी से, ज़्यादातर समय आपको एक करोड़ टोकन की ज़रूरत नहीं होती। आपको अच्छे रिट्रीवल और एक साफ 200K विंडो की ज़रूरत होती है, जो इस सूची में ज़्यादातर मॉडल देते हैं। लेकिन जब आपको सच में बड़े पैमाने पर जाना हो, तो Scout ओपन का जवाब है।
बहुभाषी उत्पादों के लिए सर्वश्रेष्ठ ओपन सोर्स LLM
यदि आपके उपयोगकर्ता सभी अंग्रेज़ी में नहीं टाइप कर रहे हैं, तो यह आयाम आपके रीज़निंग बेंचमार्क से कुछ पॉइंट ज़्यादा मायने रखता है। Hugging Face की राउंडअप Qwen3 को एक मज़बूत बहुभाषी पिक के रूप में चिह्नित करती है, और अपने परीक्षण में मैंने पाया कि Qwen लाइन गैर-अंग्रेज़ी इनपुट को उसके सामान्य स्कोर से ज़्यादा सुसंगतता के साथ संभालती है। जो मॉडल किसी रीज़निंग eval पर तीन पॉइंट कम है लेकिन वास्तव में आपके ग्राहकों की भाषा बोलता है, वह उस उत्पाद के लिए बेहतर मॉडल है। कोई करीबी मामला नहीं।
Qwen3.5 397B एक सक्षम सामान्य चैट मॉडल भी है, इसलिए आप भाषा कवरेज पाने के लिए गुणवत्ता का त्याग नहीं कर रहे।
वह हिस्सा जो कोई लीडरबोर्ड पर नहीं डालता: लाइसेंस
यहीं ओपन वेट्स चुपचाप आगे निकल जाते हैं, और यहीं मैं बिल्डरों को बारीक प्रिंट न पढ़ते देखता रहता हूँ।
उसी Hugging Face ओवरव्यू के अनुसार, DeepSeek लाइन MIT के तहत शिप होती है और Qwen3 Apache-2.0 के तहत। दोनों आपको वेट्स पर कोई प्रोडक्ट बनाने, उसके लिए चार्ज करने और कभी बिल या टेकडाउन नोटिस न मिलने देते हैं। यह क्लोज़्ड API से बिल्कुल अलग दुनिया है, जहाँ प्राइसिंग, रेट लिमिट्स, और "हम उस मॉडल को 90 दिनों में सनसेट कर रहे हैं" जैसे फैसले आपके लिए किए जाते हैं, एक ऐसे कैलेंडर पर जिसे आप कंट्रोल नहीं करते।
लेकिन हर बार असली लाइसेंस फ़ाइल पढ़ें। वही स्रोत नोट करता है कि Kimi K2.6 एक संशोधित MIT वेरिएंट का उपयोग करता है जिसे आपको व्यावसायिक उपयोग से पहले समीक्षा करनी चाहिए, और Llama 4 कम्युनिटी लाइसेंस के तहत शिप होती है जिसमें उपयोग सीमाएँ, भौगोलिक प्रतिबंध और पुनर्वितरण नियम हैं। "ओपन वेट्स" और "जो चाहो करो" पर्यायवाची नहीं हैं। MIT और Apache मॉडल वे हैं जहाँ वेट्स वास्तव में आपके हैं।
जहाँ क्लोज़्ड मॉडल अभी भी जीतते हैं
वे अभी भी शीर्ष पर जीतते हैं, और मैं यह दिखावा नहीं करूँगा कि नहीं करते। Artificial Analysis और llm-stats दोनों अभी भी दिखाते हैं कि क्लोज़्ड फ्रंटियर सबसे ज़्यादा विश्वसनीयता और निर्देश-पालन में आगे है — वह किस्म जो आप एजेंटिक काम के एक घंटे के बाद महसूस करते हैं न कि चार्ट से पढ़ते हैं।
BenchLM से एक शांत विवरण ध्यान देने योग्य है: क्लोज़्ड फ्लैगशिप को आकस्मिक रूप से जमा किया जाने वाला 1M-टोकन कॉन्टेक्स्ट BenchLM की गिनती के अनुसार यहाँ DeepSeek V4 Pro का है। ओपन साइड केवल कीमत पर प्रतिस्पर्धा नहीं कर रही। यह हेडलाइन स्पेक्स पर भी प्रतिस्पर्धा कर रही है।
वास्तव में चुनाव कैसे करें
वैश्विक नंबर एक का पीछा करना बंद करें। सबसे छोटा, सबसे सस्ता मॉडल चुनें जो आपकी अपनी बार क्लियर करे:
- सेल्फ-होस्टेड कोडिंग एजेंट → GLM-5, DeepSeek V4 Pro हेवी-ड्यूटी विकल्प के रूप में।
- पूरी चीज़-विंडो-में-ठूँसने वाले काम → Llama 4 Scout, रिकॉल के बारे में आँखें खुली रखें।
- गैर-अंग्रेज़ी उत्पाद → Qwen3.5।
- सीधे वेट्स पर बिज़नेस बनाना → MIT या Apache मॉडल, यानी DeepSeek या Qwen, प्रतिबंधात्मक कम्युनिटी लाइसेंस वाली किसी चीज़ पर कभी नहीं।
- जहाँ लागत बाधा नहीं है वहाँ टॉप-एंड विश्वसनीयता → क्लोज़्ड फ्रंटियर।
फिर अपना eval चलाएं। आपके असली बैकलॉग से लिए गए बीस असली टास्क आपको किसी भी लीडरबोर्ड से ज़्यादा बताएंगे। कम्पोज़िट स्कोर आपको एक शॉर्टलिस्ट देता है। आपका काम उसमें से विजेता चुनता है।
फ्रंटियर अभी भी आगे है। 2026 में जो बदला है वह यह है कि यह अब अकेला नहीं है, और जो कंपनी यह रख रहा है उसे लाइसेंस करने में कुछ नहीं लगता।
