Kimi K3 ओपन-सोर्स संस्करण
Moonshot AI का दुनिया का सबसे बड़ा ओपन-सोर्स बड़ा मॉडल: 2.8 ट्रिलियन पैरामीटर, नेटिव मल्टीमोडल और 10 लाख टोकन का सुपर-लंबा संदर्भ, कोडिंग क्षमता में विश्व में शीर्ष
विस्तृत रिपोर्ट
-
16 जुलाई, 2026 को, बीजिंग डार्क साइड ऑफ़ द मून टेक्नोलॉजी कंपनी लिमिटेड ने किमी K3 जारी किया, जो 2.8 ट्रिलियन के कुल पैरामीटर स्केल के साथ एक बड़ा ओपन सोर्स मॉडल है। यह वर्तमान में दुनिया में सबसे बड़े मापदंडों वाला ओपन सोर्स मॉडल है। इसने क्लाउड फैबल 5 और जीपीटी-5.6 सोल को पीछे छोड़ते हुए 1679 अंकों के साथ फ्रंटएंड कोड एरेना फ्रंट-एंड प्रोग्रामिंग सूची में शीर्ष स्थान हासिल किया। K3 को स्व-विकसित KDA हाइब्रिड रैखिक ध्यान तंत्र और ध्यान अवशिष्ट प्रौद्योगिकी के आधार पर बनाया गया है। यह मूल रूप से दृश्य समझ का समर्थन करता है और इसमें 1 मिलियन टोकन संदर्भ विंडो है। इसे लंबी दूरी की प्रोग्रामिंग, ज्ञान कार्य, गहन शोध और मल्टी-मोडल समझ जैसे जटिल कार्य परिदृश्यों के लिए विशेष रूप से अनुकूलित किया गया है। यह धीरज प्रोग्रामिंग और एजेंट कार्यों में अत्याधुनिक प्रदर्शन दिखाता है, लेकिन इसकी समग्र व्यापक बुद्धिमत्ता अभी भी सबसे मजबूत बंद-स्रोत मॉडल से पीछे है।
-
मूनशॉट एआई की स्थापना 2023 में हुई थी और इसका मुख्यालय बीजिंग में है। यह अलीबाबा और हांगकांग इन्वेस्टमेंट मैनेजमेंट कंपनी लिमिटेड (हांगकांग इन्वेस्टमेंट) द्वारा निवेशित एक एआई स्टार्टअप कंपनी है। संस्थापक, यांग ज़ीलिन, पहले सिंघुआ विश्वविद्यालय में क्रॉस-इंफॉर्मेशन संस्थान में सहायक प्रोफेसर थे। टीम के मुख्य सदस्य सिंघुआ और पेकिंग विश्वविद्यालय जैसे शीर्ष विश्वविद्यालयों और Google और मेटा जैसी प्रौद्योगिकी कंपनियों से आते हैं। किमी K3 एक साल से अधिक समय से विकास में है और किमी K2 (जुलाई 2025 में रिलीज़) का आधिकारिक उत्तराधिकारी है। इस बीच, K2.5, K2.6 और K2.7 कोड जैसे पुनरावृत्त संस्करण भी जारी किए गए। K3 की रिलीज़ न केवल पैरामीटर स्केल में गुणात्मक छलांग हासिल करती है - K2 के ट्रिलियन स्तर से 2.8 ट्रिलियन तक छलांग लगाती है - बल्कि अंतर्निहित वास्तुकला में तीन प्रमुख नवाचार भी करती है: KDA हाइब्रिड लीनियर अटेंशन मैकेनिज्म (किमी डेल्टा अटेंशन), अटेंशन रेसिडुअल टेक्नोलॉजी (अटेंशन रेजिडुअल) और मून क्लिप दूसरे क्रम का अनुकूलक। गौरतलब है कि किमी K3 की रिलीज ने भी इंडस्ट्री में तूफान ला दिया था। व्हाइट हाउस ऑफ़िस ऑफ़ साइंस एंड टेक्नोलॉजी पॉलिसी के निदेशक माइकल क्रेट्ज़ियोस ने डार्क साइड ऑफ़ द मून पर सोशल मीडिया पर एंथ्रोपिक के फ़ेबल मॉडल को डिस्टिल करके K3 विकसित करने का आरोप लगाया, और प्रतिबंधों और एक इकाई सूची की धमकी दी। ओपनएआई के रणनीतिक भविष्य के प्रमुख डीन बॉल ने भी सार्वजनिक रूप से इसकी आलोचना की और इसे "मंदी बढ़ाने वाली ताकत" कहा। डार्क साइड ऑफ द मून एंटरप्राइज बिजनेस के प्रमुख हुआंग जेनक्सिन ने स्पष्ट रूप से जवाब दिया कि K3 के प्रदर्शन में उछाल का मूल अंतर्निहित मूल वास्तुशिल्प नवाचार से आता है और यह मौजूदा मॉडल की आसुत प्रति नहीं है। कई आधिकारिक मीडिया और एआई अनुसंधान विद्वानों ने भी सार्वजनिक रूप से कहा कि आरोप में तकनीकी आधार का अभाव है।
-
किमी K3 की मुख्य क्षमताएँ निम्नलिखित दिशाओं पर केंद्रित हैं। पहली प्रोग्रामिंग क्षमता है, जो इसका सबसे आशाजनक क्षेत्र है। फ्रंटएंड कोड एरिना फ्रंट-एंड कोड सूची में, K3 1679 अंकों के साथ पहले स्थान पर है, जो क्लाउड फैबल 5 (1631 अंक) और GPT-5.6 सोल (1618 अंक) को पीछे छोड़ देता है। वास्तविक प्रोग्रामिंग अनुभव को दो परिदृश्यों में विभाजित किया गया है: एक का उपयोग किमी कोड टर्मिनल टूल के माध्यम से किया जाता है, जो / मॉडल कमांड स्विचिंग का समर्थन करता है, और दीर्घकालिक निरंतर प्रोग्रामिंग कार्यों के लिए उपयुक्त है; दूसरे को किमी एपीआई के माध्यम से कॉल किया जाता है, जो ओपनएआई एसडीके के साथ संगत है और कैश हिट के लिए इसकी कीमत $0.3 प्रति मिलियन टोकन, इनपुट मिस के लिए $3 और आउटपुट के लिए $15 है। दूसरी है लंबी दूरी की कार्य प्रसंस्करण क्षमताएं। आधिकारिक तौर पर प्रदर्शित मामलों में लगातार 48 घंटों तक स्वतंत्र रूप से चिप डिजाइन और अनुकूलन को पूरा करना और लगभग दो घंटों में कम्प्यूटेशनल खगोल भौतिकी के क्षेत्र में आई-लव-क्यू सार्वभौमिक संबंध को पुन: प्रस्तुत करना शामिल है। K3 लगातार दीर्घकालिक इंजीनियरिंग कार्यों को पूरा कर सकता है, बड़े कोड बेस को समझ सकता है और संसाधित कर सकता है, और न्यूनतम मानव पर्यवेक्षण के साथ टर्मिनल टूल के उपयोग का समन्वय कर सकता है। तीसरा है मल्टी-मॉडल समझ क्षमताएं। K3 मूल रूप से छवियों और पाठ के मल्टी-मोडल इनपुट का समर्थन करता है। यह एक प्लग-इन विज़ुअल एनकोडर नहीं है, बल्कि एक वास्तविक मूल दृश्य समझ है। इसका मतलब यह है कि यह टेक्स्ट, छवि और वीडियो इनपुट को एक साथ संभाल सकता है। एपीआई का उपयोग करने के चार तरीके हैं। किमी मोबाइल ऐप (आईओएस/एंड्रॉइड/हार्मनीओएस) के माध्यम से सीधे और मुफ्त में चैट करें। किमी वर्क 3.1.0 और उससे ऊपर का डेस्कटॉप संस्करण कार्य दृश्य समर्थन प्रदान करता है। किमी कोड टर्मिनल टूल प्रोग्रामर्स के लिए लक्षित है। किमी एपीआई प्लेटफ़ॉर्म डेवलपर्स और एंटरप्राइज़ उपयोगकर्ताओं के लिए लक्षित है। अधिकारी किमी एंटरप्राइज एंटरप्राइज संस्करण भी प्रदान करता है, जो डेटा गोपनीयता सुरक्षा और सदस्य प्रबंधन कार्य प्रदान करता है। वास्तविक उपयोगकर्ता अनुभव के परिप्रेक्ष्य से, फ्रंट-एंड डेवलपर्स और प्रोग्रामर आम तौर पर उच्च मूल्यांकन देते हैं और मानते हैं कि K3 फ्रंट-एंड कोड जेनरेशन और यूआई बहाली में "डिज़ाइन इरादे को सटीक रूप से समझता है"। हालाँकि, आम उपयोगकर्ताओं की प्रतिक्रिया ध्रुवीकृत है - कुछ लोगों को लगता है कि जटिल लंबे पाठों का विश्लेषण करने में यह वास्तव में बेहतर है, जबकि अन्य शिकायत करते हैं कि "दैनिक बातचीत में कोई बड़ा अंतर नहीं है।"
-
किमी K3 की एपीआई कीमत चीन के प्रमुख मॉडलों के उच्चतम स्तर पर है - आउटपुट 15 अमेरिकी डॉलर प्रति मिलियन टोकन है, जो लगभग आरएमबी 100 है। पिछली पीढ़ी के 2.6 की कीमत 4 डॉलर है, जो लगभग 3 गुना बढ़ गई है। समान घरेलू मॉडल GLM-5.2 का आउटपुट मूल्य US$4.4 है। हालाँकि, अधिकारी द्वारा दिया गया एक महत्वपूर्ण डेटा यह है: प्रोग्रामिंग परिदृश्यों में, कैश हिट दर 90% से अधिक हो सकती है, इसलिए वास्तविक व्यय सूचीबद्ध मूल्य से बहुत कम है। कैश हिट इनपुट लागत केवल $0.3 प्रति मिलियन टोकन है। अधिकारियों के अनुसार, मूनकेक की अलग तर्क वास्तुकला पर निर्भर यह प्रणाली K3 को उच्च-आवृत्ति प्रोग्रामिंग परिदृश्यों में अत्यधिक लागत प्रभावी बनाती है। डार्क साइड ऑफ द मून एंटरप्राइज बिजनेस के प्रमुख हुआंग जेनक्सिन ने स्पष्ट किया कि ओपन सोर्स मॉडल और बड़े चीनी मॉडल को कम कीमत वाला लेबल नहीं दिया जाना चाहिए। "हमने एक SOTA-स्तरीय मॉडल बनाया है जो उचित वाणिज्यिक मूल्य निर्धारण से भी मेल खा सकता है।" कृत्रिम विश्लेषण की गणना से पता चलता है कि किमी K3 की एकल-कार्य लागत लगभग US$0.94 है, जो GPT-5.6 Sol के US$1.04 के करीब है। यह सतह पर जितना दिखता है उससे ज़्यादा सस्ता नहीं है। उपभोक्ता पक्ष पर, किमी के मुफ्त संस्करण में एक निश्चित K3 कोटा शामिल है, और भुगतान की गई सदस्यता को 699 युआन/माह तक कई स्तरों में विभाजित किया गया है। कुछ उपयोगकर्ताओं ने बताया कि उनके कोटा का 20% एक दिन में उपयोग किया गया था, जिसका अर्थ है कि भारी उपयोगकर्ताओं के लिए लागत को नजरअंदाज नहीं किया जा सकता है। डार्क साइड ऑफ़ द मून का कहना है कि यह खुले स्रोत मार्ग पर कायम रहेगा। संशोधित एमआईटी लाइसेंस के तहत 27 जुलाई, 2026 से पहले पूर्ण मॉडल वजन जारी किया गया। निजी परिनियोजन और फ़ाइन-ट्यूनिंग आवश्यकताओं वाले एंटरप्राइज़ ग्राहकों के लिए, ओपन सोर्स एक उच्च-मूल्य वाला विकल्प है।
-
सकारात्मक टिप्पणियाँ मुख्यतः तीन पहलुओं पर केन्द्रित होती हैं। सबसे पहले, प्रोग्रामिंग परिदृश्यों में अनुभव उत्कृष्ट है, फ्रंट-एंड कोड पीढ़ी उच्च गुणवत्ता की है, और डिज़ाइन का इरादा सटीक रूप से समझा जाता है। वर्सेल के संस्थापक गुइलेर्मो राउच ने वास्तविक परीक्षण और सत्यापन भी किया है। दूसरा, लंबे टेक्स्ट और लंबे कार्यों को संसाधित करने की इसकी क्षमता उत्कृष्ट है। उपयोगकर्ताओं ने बताया कि दर्जनों पृष्ठों के दस्तावेज़ों को सारांश में डालते समय, K3 मुख्य जानकारी को सटीक रूप से निकाल सकता है, सक्रिय रूप से घटा सकता है, और "बेहतर निर्णय लेना शुरू कर सकता है।" तीसरा, पेशेवर परिदृश्यों (वित्तीय विश्लेषण, अनुबंध समीक्षा, उद्योग अनुसंधान) में स्वचालन क्षमताएं संतोषजनक हैं। कुछ उपयोगकर्ताओं ने इसका उपयोग अनुबंधों में छिपे स्वचालित नवीनीकरण खंडों को खोजने के लिए किया है। नकारात्मक समीक्षाएँ भी स्पष्ट हैं। सबसे आम शिकायत धीमी प्रतिक्रिया गति है - एक समान कार्य, क्लाउड फैबल 5 में 3.5 मिनट लगे, जबकि K3 में 12 मिनट लगे। एपीआई प्रतिक्रियाशीलता श्रेणी औसत से नीचे है। दूसरे, कीमतें ऊंची हैं। K2.6 से K3 तक, आउटपुट मूल्य लगभग तीन गुना बढ़ गया है। फिर, "अति-तर्क" की समस्या है। कुछ उपयोगकर्ता रिपोर्ट करते हैं कि K3 अस्पष्ट इरादों के साथ अपनी पहल पर कार्यों के दायरे का विस्तार करेगा, जिससे पुन: कार्य लागत में वृद्धि होगी। उपयोगकर्ताओं की प्रतिक्रिया यह भी है कि दैनिक प्रकाश परिदृश्यों में कोई महत्वपूर्ण सुधार महसूस नहीं किया जा सकता है।
-
उद्योग मीडिया ने आम तौर पर इसकी अत्यधिक चर्चा की। इकोनॉमिक डेली ने इसे चीन के बड़े मॉडलों के लिए मूल्य निर्धारण शक्ति की ओर बढ़ने के लिए एक नए नोड के रूप में व्याख्या की। गोल्डमैन सैक्स की शोध रिपोर्ट का मानना है कि चीन के बड़े मॉडल पहले मुख्य रूप से लागत प्रदर्शन के आधार पर वैश्विक बाजार में प्रवेश करते थे, और भविष्य में वे वैश्विक डेवलपर्स के मुख्य वर्कफ़्लो में प्रवेश करने के लिए अत्याधुनिक क्षमताओं पर भरोसा कर सकते हैं। मॉर्गन स्टेनली चिंतित हैं कि किमी K3 की एपीआई कीमत चीन के शीर्ष मॉडलों के बीच उच्च स्तर पर है, और उनका मानना है कि बड़े मॉडलों की बाजार संरचना के लिए उच्च कीमत का सकारात्मक महत्व है। तकनीकी समुदाय विभाजित है. कुछ डेवलपर्स का मानना है कि यह "प्रोग्रामिंग के क्षेत्र में ओपन सोर्स मॉडल के लिए एक महत्वपूर्ण मोड़ है" क्योंकि यह पहली बार है कि एक ओपन सोर्स मॉडल ने फ्रंट-एंड कोड प्रतियोगिता में सभी बंद सोर्स मॉडल को पूरी तरह से पीछे छोड़ दिया है। दूसरों का मानना है कि बेंचमार्क बेंचमार्क से संबंधित है, और वास्तविक उपयोग में "धीमी गति और महंगापन" अपरिहार्य उद्देश्य लागत है। कुछ उद्योग विशेषज्ञों ने यह भी बताया कि K3 का वास्तविक मूल्य न केवल सी-साइड पर अनुभव किया जाता है, बल्कि यह बड़ी संख्या में छोटे और मध्यम आकार के उद्यमों को सशक्त बनाने के लिए आधार मॉडल के रूप में काम करेगा। मॉडल वेट ओपन सोर्स होने के बाद, बड़ी संख्या में घरेलू कंपनियों को बड़े मॉडलों को शुरू से प्रशिक्षित करने की आवश्यकता नहीं है। पूंजी बाजार के संदर्भ में, अमेरिकी एआई शेयरों में K3 की रिलीज के बाद गिरावट की लहर देखी गई, जो निवेशकों की चिंताओं को दर्शाती है कि ओपन-सोर्स अत्याधुनिक मॉडल बंद-स्रोत मूल्य निर्धारण क्षमताओं को प्रभावित कर सकते हैं। एलोन मस्क ने संबंधित टिप्पणियों में "प्रभावशाली" के बारे में दो टिप्पणियाँ छोड़ीं, और K3 को ग्रोक 4.6 के लिए एक प्रमुख लक्ष्य के रूप में सूचीबद्ध किया।
-
आसवन शुल्क मुख्य विवाद था। व्हाइट हाउस ने सीधे तौर पर यह आरोप लगाया है, लेकिन तकनीकी विशेषज्ञ आम तौर पर मानते हैं कि यह आरोप निराधार है। अमेरिकी एआई प्रौद्योगिकी विशेषज्ञ नाथन लैम्बर्ट ने सार्वजनिक रूप से लिखा है कि जो लोग मानते हैं कि चीनी एआई प्रयोगशालाएं केवल बौद्धिक संपदा की चोरी करके उत्कृष्ट मॉडल तैयार कर सकती हैं, "यह जागने का समय है।" ओपनएआई के रणनीतिक भविष्य के प्रमुख डीन बॉल ने भी विवादास्पद पोस्ट में स्वीकार किया कि K3 का प्रदर्शन आसवन द्वारा प्राप्त नहीं किया जा सकता है। तकनीकी जोखिमों के संदर्भ में, मॉडल की धीमी अनुमान गति वर्तमान में सबसे प्रमुख कमी है। ऐसे उत्पादन परिवेशों के लिए जिन्हें तीव्र प्रतिक्रिया समय की आवश्यकता होती है, K3 सर्वोत्तम विकल्प नहीं हो सकता है। इसके अलावा, मॉडल में "अति-तर्क" की प्रवृत्ति होती है और स्पष्ट निर्देशों के बिना सक्रिय रूप से कार्यों के दायरे का विस्तार करने की प्रवृत्ति होती है, जो उन परिदृश्यों में जोखिम पैदा करता है जिनके लिए सख्त सीमा नियंत्रण की आवश्यकता होती है। अनुपालन और डेटा सुरक्षा को लेकर वास्तविक मुद्दे हैं। किमी की होस्टिंग सेवा में डेटा चीन के भीतर संसाधित किया जाता है, जो डेटा निर्यात प्रतिबंधों वाले विदेशी उपयोगकर्ताओं के लिए एक महत्वपूर्ण विचार है। हालाँकि ओपन सोर्स वेट को रिलीज़ के बाद स्थानीय रूप से तैनात किया जा सकता है, 2.8 ट्रिलियन पैरामीटर मॉडल की तैनाती सीमा बहुत अधिक है - आधिकारिक सिफारिश 64 से अधिक त्वरक का एक सुपर नोड कॉन्फ़िगरेशन है, जो मूल रूप से सामान्य उद्यमों और व्यक्तियों के लिए अप्राप्य है। मॉडल भ्रम की समस्या भी पूरी तरह से हल नहीं हुई है। हुआंग जेनक्सिन ने स्वयं स्वीकार किया कि "मतिभ्रम को पूरी तरह से समाप्त नहीं किया जा सकता है।" हालाँकि, K3 ने इसकी घटनाओं को काफी कम कर दिया है और द्वितीयक सत्यापन के लिए एजेंट स्वार्म आर्किटेक्चर में तथ्य-जाँचकर्ता उप-एजेंट की आवश्यकता होती है।
-
जो लोग किमी K3 का उपयोग करने के लिए उपयुक्त हैं वे हैं: फ्रंट-एंड डेवलपर्स और फुल-स्टैक इंजीनियर, विशेष रूप से जटिल यूआई विकास और फ्रंट-एंड इंजीनियरिंग में लगी टीमें; एआई एजेंट इंजीनियर और शोधकर्ता जिन्हें दीर्घकालिक स्वचालित प्रोग्रामिंग की आवश्यकता है; वित्तीय विश्लेषक, उद्योग शोधकर्ता और वैज्ञानिक शोधकर्ता, जो बहुत बड़े दस्तावेज़ों से निपटते हैं और दीर्घकालिक गहन शोध परिदृश्यों का संचालन करते हैं; निजीकृत परिनियोजन आवश्यकताओं वाले एंटरप्राइज़ ग्राहक वेट ओपन सोर्स होने के बाद स्थानीय फ़ाइन-ट्यूनिंग और परिनियोजन कर सकते हैं। जो लोग तत्काल उपयोग के लिए उपयुक्त नहीं हैं वे हैं: सामान्य उपयोगकर्ता जिन्हें केवल दैनिक सरल प्रश्नोत्तर और कॉपी राइटिंग की आवश्यकता होती है (कई किफायती मॉडल पर्याप्त हैं); उत्पादन परिवेश के उपयोगकर्ता जिन्हें अत्यधिक उच्च प्रतिक्रिया गति की आवश्यकता होती है; व्यक्तिगत डेवलपर्स जिनके पास पर्याप्त बजट या GPU संसाधन नहीं हैं, और स्व-तैनाती की सीमा बहुत अधिक है। उपयोग अनुशंसाओं के संदर्भ में, आप एक स्तरित रणनीति अपना सकते हैं: 15% -20% जटिल कार्यों (लंबे-चक्र प्रोग्रामिंग, बहु-चरण एजेंट, लंबे दस्तावेज़ों का गहन विश्लेषण) के लिए K3 का उपयोग करें, और दैनिक उच्च-आवृत्ति सरल कार्यों के लिए K2.7 कोड या डीपसीक V4 प्रो जैसे हल्के मॉडल का उपयोग करें। कैशिंग रणनीतियों के आधार पर एपीआई कॉल को अनुकूलित करने से लागत में भी काफी कमी आ सकती है।
-
किमी K3 एक ऐतिहासिक उत्पाद है। यह लेबल "ओपन सोर्स मॉडल" को पहली बार शीर्ष बंद सोर्स मॉडल के साथ प्रतिस्पर्धा करने की अनुमति देता है। प्रोग्रामिंग और लंबी दूरी के कार्यों में इसकी सफलताएं वास्तविक हैं, और इसने उद्योग और बाजार स्तर पर भी भारी प्रभाव डाला है। लेकिन कुल मिलाकर यह अभी भी एक "वैज्ञानिक खिलाड़ी" है - यह विशिष्ट परिदृश्यों में शीर्ष स्तर का प्रदर्शन करता है, लेकिन सामान्य परिदृश्यों में अभी भी एक अंतर है। इसका वास्तविक दीर्घकालिक प्रभाव आज एपीआई कॉल की संख्या में नहीं हो सकता है, लेकिन इस तथ्य में कि कुछ दिनों में वजन आधिकारिक तौर पर खुला होने के बाद, यह पूरे एआई पारिस्थितिकी तंत्र को सशक्त बनाने के लिए आधार मॉडल के रूप में काम करेगा।
उपयोगकर्ता समीक्षाएं
-
CarolynBakerJr—K3 的前端代码能力是真的强,丢了个复杂的企业后台需求进去,生成出来的页面审美在线,交互逻辑也基本对的。不过速度是真的慢,等得有点着急。 -
goldenlion904—用 K3 做了个 3D 游戏 demo,效果超出预期。它自己从零写代码、修 bug、调样式,全程不用我怎么管就是每次等它改完都要喝杯咖啡。 -
Brjen—API 价格从 K2.6 的 4 刀涨到 15 刀,涨幅快 3 倍。虽然缓存命中能省不少,但心里还是有点难受。 -
程彤云—实测了三天,K3 最大的变化是开始有判断力了。以前问个问题给你列七八条,现在直接砍掉那些正确的废话,留下的全是真正决策有关的信息。这点比参数提升更难得。 -
KOgar—得承认这是国产开源模型第一次跟 Fable 5 和 GPT-5.6 Sol 站到一个台面上。以前说对标只是口号,这次评测数据是真的接近了。 -
SandraHart168—同一个 bug 修复任务,Claude Fable 5 用了 3.5 分钟,K3 用了 12 分钟。差距很明显,不光是速度,对话响应也偏慢。 -
游客_8—办公场景测了写周报和做 PPT。写周报真的香,把零散的工作记录丢进去,自动给你包装成专业版本。做 PPT 就比较弱了,只给文字大纲,页数还失控,不如豆包的一键生成好用。 -
Madison_Hall_7—精度确实有提升,中文综合从 72.9% 到 75.6%,coding 从 62.6% 到 70.3%。但 token 消耗也上去了,同样任务花的钱多了不少。只能说 SOTA 级模型配 SOTA 级价格吧。 -
Karen836—K3 有点太爱表现了,让它总结一段产品说明,它不光总结,还自作主张加了一段风险分析。问题是原文根本没提风险,纯属脑补。复杂任务用它,简单任务还是切回 K2 更省心。 -
月光_21—最搞笑的是官方自己都承认综合方面还落后 Fable 5 和 Sol,但社区吹得好像已经全面碾压了。理性看待吧,K3 在特定场景下确实强,通用能力还是有差距。 -
redzebra695—前端代码是真的强,Frontend Code Arena 1679 分登顶不是吹的。跟 Fable 5 和 Sol 同时生成同一个 SaaS 落地页,K3 的审美确实在线,按钮间距和配色比例看着更舒服。 -
AbigailMitchell_2024—把几十页的行业白皮书扔进去,让 K3 提炼三个关键变化,它给得很准,而且主动标出了需要留意风险的地方。长文档处理确实比 K2 强一个档次。 -
realSanjaSilić_dev—用 K3 检查租房合同,帮找出一条自动续约的隐藏条款。这功能说大不大,但省了我一笔可能的损失。 -
VEcoo—这个模型在科研编程的场景太适合了。我用来复现一篇计算化学的论文结果,K3 自己读了代码库、修了依赖冲突、跑了参数扫描,整个过程跑了大概 5 个小时,但我基本没干预。 -
HashHunter114—API 接入挺简单的,兼容 OpenAI SDK,改个 base_url 就行。速度偏慢但稳定性还不错,跑了几个长任务没有出现中断。 -
Olivia.Brooks007—刚发布就断售了,负载扛不住可见热度多夸张。好在 API 还能用,网页端等了两天才上去。希望扩容快点跟上。 -
唐兰—2.8万亿参数听起来很吓人,但实际激活的只有 16/896 个专家,推理算力要求其实没想象中那么离谱。问题是自部署需要 64 个以上加速器,个人开发者基本没戏。 -
Justin.Morales_99—蒸馏指控真的有点离谱。K3 公布的架构创新——KDA 注意力机制和 Attention Residuals——都是有技术论文支撑的。说靠蒸馏做出 2.8T 参数的模型,技术上就不可能。 -
DrErnestoMárquez_x—编程能力确实强,但推理速度偏慢。同样是生成一个 Three.js 的瀑布场景,GPT-5.6 Sol 几分钟搞定,K3 花了半小时。不过最后成片的质量 K3 反而更好,彩虹和水雾的细节处理更自然。慢工出细活吧。 -
blPAR—有些人的期望太高了,觉得发布后就应该吊打所有闭源。实际用下来,K3 是顶级编程选手但日常对话有过度推理的问题,选对场景很重要。 -
Judy_Morales52014—开通了 699 元/月的最高档会员,重度用了一天额度掉了 20%。虽然心疼但确实值,复杂文档处理效率至少翻倍。 -
Richard.RobertsX—用 K3 做了个流量回放平台,从需求到跑起来大概半天。之前用别的模型至少折腾两天。它对长代码库的理解力确实比前代强很多。 -
胡勇丹—做 2D 游戏很强,让 K3 复刻泡泡堂,它自己拆成两条并行工作线,地图、角色、逻辑一起写,最终跑起来能玩。就一句话需求,它理解得太好了。 -
BCooper_2023—普通用户可能感受不到 K3 的强大,因为日常写文案聊天跟 K2 差别不大。但如果你做编程或者研究,差距是非常明显的。 -
DanielleRamirez_668—马斯克又点赞了,还说要拿 Grok 4.6 跟 K3 对标。能被这个级别的玩家当成对标目标,本身就是实力认证了。 -
VincentPerezZ—刚上手就给它丢了一个大项目,自己写了个迷你 GPU 编译器,从零开始,最后跑通了 nanoGPT 训练。虽然不是生产级的,但 48 小时能做成这样确实让人惊讶。 -
吴秀龙—月之暗面的开放策略值得肯定,K3 权重将在 7 月 27 日前开源。国内中小企业可以基于这个基座做二次开发,不用从零训练大模型了。 -
MidhaelJensen—第一时间就试了,拿前端代码竞技场的题让它跑,确实一把过。这是第一次有开源模型在这个榜单上超过 Claude 和 GPT。