Fanzin

Yapay zekâ ve girişimler, gürültüsüz.

Yapay Zekâ

Microsoft karar modellerini ayrı kategori ilan etti: Decision-1 ne vaat ediyor?

Microsoft 9 Ekim'de Microsoft-Decision-1'i tanıttı: metin üretmek yerine verilen seçenekler arasından seçim yapıp kalibre edilmiş olasılık döndüren bir karar modeli. Şirketin kendi ölçümünde GPT-6 Sol'dan 35 kat hızlı, girdi milyon token başına 0,042 dolar. Bu tür modeller ajan yığınında hangi kararı kime bıraktığımızı yeniden soruyor.

Üç seçenek çubuğundan yalnızca biri asit yeşiliyle dolu ve eşik çizgisini geçmiş; solda gösterge kadranlı bir model çipi, altta bir kronometre.
Üç seçenek, tek eşik: karar modeli her seçeneğe olasılık veriyor.Fanzin illüstrasyon hattı

Orijinal kaynak: commandline.microsoft.com, techcommunity.microsoft.com

Olay tarihi: 9 Ekim 2026. Yayım tarihi: 11 Ekim 2026.

Microsoft 9 Ekim’de Microsoft-Decision-1 adlı yeni bir model tanıttı. Tanıtım yazısı şirketin commandline.microsoft.com adresindeki mühendislik yayınında, Office of the CTO’dan Achint Srivastava imzasıyla çıktı. Şirketin cümlesiyle bu bir metin üretme modeli değil, karar modeli: kendisine verilen sabit seçenek kümesi içinde her seçenek için kalibre edilmiş bir olasılık döndürüyor.

Olgular

  • Ne: Microsoft-Decision-1, Qwen3.5-9B üzerine post-train edilmiş bir karar skorlama modeli. Evet/hayır, çoktan seçmeli, derecelendirme ve rubrik bazlı puanlama destekliyor; sonuç yapılı bir API çağrısıyla dönüyor.
  • Nerede: Bugün Microsoft Foundry’de, yakında OpenRouter’da. OpenRouter listesi modelin çıkış tarihini 9 Ekim 2026 olarak veriyor.
  • Ölçüm: Şirketin 36 benchmark karşılaştırmasında en yüksek doğruluk; yaklaşık 150.000 soru, eğitimden gizlenmiş benchmarklar üzerinde.
  • Hız: En hızlı ölçülen model. İkinci sıradaki Quyet-1.0-Large’dan 4,5 kat, GPT-6 Sol’dan 35 kat hızlı. P50 gecikmesi GPT-6 Sol’a göre yaklaşık 35 kat daha iyi.
  • Sağlamlık: Aynı istek sekiz farklı şekilde bozulduğunda karar ortalama yüzde 1,3 değişiyor; seçenek açıklamaları yeniden yazıldığında ya da seçenekler ters çevrilip karıştırıldığında sıfır değişim ölçülmüş.
  • Güvenlik: 5.250 istek ve 11 benchmark üzerinde test edilmiş.
  • İç kullanım: XBOX Research 10.000’den fazla açık uçlu geri bildirimi temalara ayırmış; kalite GPT-6 Sol ile rekabetçi, çalışma 14 kat hızlı ve 200 kat daha ucuz. Copilot ekibi kaliteyi GPT5.6 Luna ile rekabetçi, hızı 100 kat yüksek bulmuş. Microsoft Discovery, adaptif yeniden planlamada 46 kat daha tutarlı sonuç ve üç kat hız bildiriyor.
  • Fiyat: Girdi milyon token başına 0,042 dolar; çıktı tokenları ücretsiz.

Neden önemli

“Yeni kategori” iddiası burada ağırlık taşıyor. Bu tür modeller LLM’lerin yerini almak için değil, onların önüne bir yönlendirme katmanı olarak konumlanıyor. Microsoft’un saydığı kullanım alanları şu soruların cevabını arıyor: bir ajanın attığı adım devam etmeli mi, durmalı mı, tekrar denemeli mi, insana mı devredilmeli; gelen istek hangi modele gitmeli; bir yapay zekâ cevabı kabul mü edilmeli, düzeltilmeli mi, reddedilmeli mi.

Bunların hepsi az para ve az gecikmeyle çözülmesi gereken kararlar. Bir iş akışında ardışık 20 karar varsa ve her karara 100 milisaniye eklenirse toplam süreye iki saniye ekleniyor; Microsoft’un satış argümanı tam olarak bu.

Bize göre: asıl tartışma maliyet değil, eşik

(Yorum) Fiyat ve gecikme kazançları net ve satın alma kararını kolaylaştırıyor. Ama karar modelinin ürünleştirdiği şey yalnızca hız değil, olasılık eşiği. Uygulama yüzde 90 güven gördüğünde işlem yapmak, ertelemek ya da insana sormak arasında seçiyor. Yani modelin kalibrasyonu doğrudan iş kararı hâline geliyor.

Microsoft kalibrasyonu birinci sınıf özellik olarak sunuyor ve doğru yapıyor; yüzde 90 tahminin temsilî vakalarda yaklaşık onda dokuzunda doğru olması gerektiğini söylüyor. Ancak kalibrasyonun kendi verinizde de tutup tutmadığını ölçmek müşteri tarafında kalıyor. Bu da iki yeni iş doğuruyor: eşik değerlerini kimin belirlediği ve kalibrasyonu kimin denetlediği.

Tahmin

(Tahmin) İki yıl içinde karar modelleri, ajan yığınlarının varsayılan yönlendirme katmanı hâline gelebilir. Bu durumda iki soru öne çıkar: kalibrasyon denetimi için bağımsız bir ölçüm standardı çıkar mı, ve regüle edilen sektörlerde (finans, sağlık) karar eşiklerini belgelemek zorunlu hâle gelir mi. Model tek başına bunları çözmüyor.

Türkiye için çıkarım

(Yorum) Türkiye’de ajan tabanlı ürün geliştiren ekipler için pratik fayda maliyet tarafında: basit sınıflandırma ve yönlendirme işlerini pahalı bir LLM’de tutmak yerine ucuz bir karar katmanına vermek aylık maliyeti ciddi düşürebilir. Buna karşılık, kredi, sigorta ya da işe alım gibi kararlarda eşiğin nasıl belirlendiği ve kayıt altına alındığı sorulacak. Bu modelleri kara kutu hızlandırıcı gibi değil, denetlenmesi gereken bir eşik katmanı gibi ele almak gerekiyor.

Kaynaklar

Doğrulama notu

Doğrulanan: Modelin 9 Ekim 2026’da tanıtıldığı, Qwen3.5-9B üzerine post-train edildiği, kalibre edilmiş olasılık döndürdüğü, 36 benchmark ve yaklaşık 150.000 soru, GPT-6 Sol’a karşı 35 kat hız iddiası, girdi fiyatının milyon token başına 0,042 dolar olduğu, Microsoft Foundry’de yayında olduğu ve OpenRouter listesinin çıkış tarihini 9 Ekim 2026 verdiği, XBOX Research ve Copilot iç testleri. Birincil kaynak Microsoft’un kendi yayını; ikincil kaynaklar (MarkTechPost, OpenRouter, Tech Community blogu) bunu doğruluyor.

Düzeltilen: İlk tarama kopyasında ikinci sıradaki model “H2O-Lightning-4B v1.1” ve çarpan “2,5 kat” olarak görünüyordu; sayfanın tam metni ikinci sıradaki modeli Quyet-1.0-Large ve çarpanı 4,5 kat olarak veriyor. Metinde sayfanın tam metni esas alındı. Aynı sayfanın eki her iki rakip modeli de benchmark listesinde gösteriyor, bu yüzden ikinci model adı versiyona göre değişebilir.

Doğrulanmayan: Şirketin kendi kalibrasyon ve sağlamlık ölçümleri (yüzde 1,3 karar değişimi, yüzde 90 güven vaadi) bağımsız olarak tekrarlanmadı. GPT-6 Sol, GPT5.6 Luna ve Quyet-1.0-Large karşılaştırmaları Microsoft’un kendi test düzeneğine dayanıyor.

Bunları da oku