छोटे reasoning models के पक्ष में Thinking Machines का तर्क

पूर्व OpenAI CTO Mira Murati द्वारा स्थापित AI lab Thinking Machines ने Inkling Small जारी किया है, जो एक open-weights reasoning model है और कंपनी के पहले Inkling model की तुलना में बहुत छोटे active footprint का उपयोग करते हुए capability के मामले में प्रतिस्पर्धा करने के लिए डिज़ाइन किया गया है। यह launch AI market में एक परिचित लेकिन और भी महत्वपूर्ण होते जा रहे बदलाव को दिखाता है: efficiency अब केवल एक technical footnote नहीं, बल्कि अपने आप में एक product feature बन रही है।

प्रदान किए गए source text के अनुसार, Artificial Analysis अपने Intelligence Index में Inkling Small को 40 score देता है, जो Inkling के 41 से केवल एक point कम है। यह अंतर इतना छोटा है कि headline साफ़ हो जाता है। नए model को एक छोटे system के रूप में रखा गया है, जो बड़े model की समग्र स्थिति के करीब पहुँचता है और कुछ coding तथा reasoning benchmarks में उसे बेहतर भी करता है।

Model का reported size profile इस pitch का केंद्रीय बिंदु है। Inkling Small को 276 billion total parameters और 12 billion active parameters के साथ वर्णित किया गया है, जो source के अनुसार original Inkling के आकार का एक-तिहाई से भी कम है। Artificial Analysis यह भी कहता है कि समान या उससे छोटे आकार का कोई भी open model उसके index में इससे अधिक score नहीं करता।

Benchmark परिणाम लक्षित सुधार दिखाते हैं

Benchmark की कहानी केवल यह नहीं है कि Inkling Small कुल मिलाकर अपने predecessor जितना मजबूत है। source text कहता है कि यह कई coding और reasoning tests में बड़े Inkling से बेहतर प्रदर्शन करता है। उद्धृत दो उदाहरण हैं Humanity’s Last Exam, जहाँ Inkling Small 32% score करता है, जबकि Inkling 30%; और GPQA Diamond, जहाँ यह 89% तक पहुँचता है, जबकि Inkling 87% पर है।

ये संख्याएँ महत्वपूर्ण हैं, क्योंकि वे संकेत देती हैं कि model केवल एक compressed version नहीं है जो अधिकांश capability को बनाए रखता है। कम से कम कुछ tasks में, यह बड़े system को पीछे छोड़ने में सक्षम दिखाई देता है। ऐसे परिणाम उस market में उल्लेखनीय हैं, जहाँ बड़े models को अक्सर उच्च performance का default रास्ता माना गया है।

साथ ही, source Inkling Small को universal upgrade के रूप में प्रस्तुत नहीं करता। रिपोर्ट के अनुसार, यह agent-based tasks और factual knowledge में original Inkling से पीछे है। यह सीमा महत्वपूर्ण है, क्योंकि यह launch को hype नहीं बल्कि tradeoffs के दायरे में रखती है। अधिक मजबूत autonomous task execution या व्यापक recall चाहने वाले users के लिए, efficiency के लिहाज़ से आकर्षक होने पर भी, बड़ा model अभी बेहतर विकल्प हो सकता है।

Efficiency ही गहरा प्रतिस्पर्धी संदेश है

और मजबूत differentiator token efficiency हो सकती है। source के अनुसार, Inkling Small प्रति task औसतन 24,000 output tokens का उपयोग करता है, जबकि Deepseek V4 Flash 45,000 और GPT-5.4 mini 78,000 उपयोग करते हैं। सतही तौर पर, यह ऐसे model का संकेत देता है जो कुछ competing systems की तुलना में कम generated output के साथ पर्याप्त reasoning work कर सकता है।

इस तरह की efficiency अर्थशास्त्र और product design दोनों के लिए महत्वपूर्ण है। कम output token usage inference cost और latency कम कर सकता है, और उन environments में deployment को आसान बना सकता है जहाँ throughput या budget raw benchmark strength जितना ही महत्वपूर्ण है। उत्पादों में AI features बनाने वाली companies के लिए, कम output tokens के साथ अधिक काम करने वाला model आकर्षक हो सकता है, भले ही वह हर leaderboard में सबसे ऊपर न हो।

यह launch दिखाता है कि AI vendors progress को किस तरह frame कर रहे हैं, इसमें व्यापक बदलाव आ रहा है। केवल absolute frontier performance पर जोर देने के बजाय, developers अब quality-per-token equation पर अधिक प्रतिस्पर्धा कर रहे हैं। दिए गए figures के आधार पर, Inkling Small अपने बड़े sibling के सामान्य standing के करीब रहते हुए और efficiency profile सुधारते हुए इसी pattern में फिट बैठता है।

Open weights और multimodal input आकर्षण बढ़ाते हैं

Thinking Machines model की practical reach को भी बढ़ाने की कोशिश कर रही है। source text के अनुसार, Inkling Small text, image, और speech inputs support करता है और 256,000-token context window के साथ आता है। इसे Apache 2.0 license के तहत जारी किया गया है, और weights Hugging Face पर host किए गए हैं।

ये विवरण महत्वपूर्ण हैं, क्योंकि वे तय करते हैं कि model का उपयोग कौन कर सकता है और उसे कितनी जल्दी अनुकूलित किया जा सकता है। Apache 2.0 release experimentation और commercial use की बाधा कम करता है। Multimodal input support system को text-only reasoning से अधिक व्यापक applications के लिए उपयोगी बनाता है। और long context window बड़े documents, लंबे conversations, या विस्तृत working memory वाली tasks के लिए इसकी अपील बढ़ाता है।

source यह भी कहता है कि users Tinker Playground के माध्यम से browser में model fine-tune कर सकते हैं। यह feature Thinking Machines की positioning से मेल खाता है, जहाँ इसके models को users के अपने data के साथ customization के आधार के रूप में देखा जाता है। दूसरे शब्दों में, कंपनी केवल base model की कहानी नहीं बेच रही। वह एक ऐसा workflow भी बेच रही है जिसमें users उस base model को अधिक विशिष्ट लक्ष्यों के लिए ढालते हैं।

वर्तमान model market में यह release क्यों महत्वपूर्ण है

Inkling Small ऐसे समय में आया है जब AI developers पर practical value दिखाने का दबाव है; केवल scale का नहीं। साथ ही, लगातार बड़े models को train करना महँगा है, और उन्हें deploy करने वाली product teams को capability के साथ cost, speed, flexibility, licensing पर भी विचार करना पड़ता है। इससे ऐसे models के लिए जगह बनती है जो शायद सबसे बड़े या सबसे शक्तिशाली नहीं हैं, लेकिन key tasks में पर्याप्त अच्छे और चलाने में अधिक efficient हैं।

source Inkling Small को ठीक इसी तरह का offering बताता है: एक छोटा open-weights reasoning model जो अपने आकार के हिसाब से असाधारण रूप से अच्छा प्रदर्शन करता है। अगर यह positioning व्यापक उपयोग में टिकती है, तो यह तर्क मजबूत हो सकता है कि model development एक अधिक disciplined चरण में प्रवेश कर रहा है, जहाँ optimization और deployment value raw expansion जितनी ही महत्वपूर्ण हैं।

यह fine-tune किए जा सकने वाले और custom workflows में embed होने वाले open models के बढ़ते market segment पर भी ध्यान बनाए रखता है। Proprietary frontier systems अभी भी कई headline comparisons में हावी हैं, लेकिन open-weight releases रणनीतिक रूप से महत्वपूर्ण हैं, क्योंकि वे संगठनों को यह तय करने में अधिक प्रत्यक्ष नियंत्रण देते हैं कि model को कैसे adapt, host, और govern किया जाए।

अधिकतमवादी नहीं, बल्कि एक मापा हुआ कदम

Inkling Small के बारे में सबसे दिलचस्प बात शायद यह है कि यह क्या दावा नहीं करता। दिए गए text के आधार पर, Thinking Machines इसे हर category में single best model के रूप में पेश नहीं कर रही। इसके बजाय, release एक संकीर्ण, अधिक pragmatic प्रस्ताव रखता है: अपने आकार के करीब top-tier performance, बड़े sibling के मुकाबले कुछ benchmark wins, multimodal capability, long context, और एक उल्लेखनीय रूप से कम output-token profile।

इससे launch spectacle से अधिक engineering priorities के बारे में बन जाता है। छोटे active models जो अच्छी तरह reason कर सकते हैं, open रह सकते हैं, और token burn कम कर सकते हैं, AI deployment के परिपक्व होने के साथ आकर्षक बने रहने की संभावना रखते हैं। Inkling Small इस भविष्य पर एक सीधा दांव जैसा दिखाई देता है।

क्या यह एक व्यापक रूप से अपनाया जाने वाला foundation model बनेगा, यह यहाँ दी गई summary figures से आगे के वास्तविक-world testing पर निर्भर करेगा। लेकिन उपलब्ध जानकारी के आधार पर strategic message पहले ही स्पष्ट है। Thinking Machines यह साबित करने की कोशिश कर रही है कि AI में efficiency अब compromise category नहीं है। यह अपने आप में एक गंभीर competitive lane बन रही है।

यह लेख The Decoder की रिपोर्टिंग पर आधारित है। मूल लेख पढ़ें.

Originally published on the-decoder.com