Fanzin

Yapay zekâ ve girişimler, gürültüsüz.

Yapay Zekâ

OpenAI 722 matematik makalesini yayımladı: darboğaz artık üretim değil doğrulama

OpenAI, yayımlanmamış bir iç modelin ürettiği 722 matematik makalesini 372 sonuç ailesi halinde açtı. Sonuçların bir kısmı Lean ile makine tarafından denetlenebiliyor, bir kısmı denetlenemiyor. Tartışma modelin ne ürettiğinde değil, üretilenin nasıl doğrulanacağında.

Yüzlerce küçük sayfadan oluşan bir ızgara; yalnızca birkaçı onay işaretli ve asit yeşili, bir büyüteç aralarında geziniyor.
Üretilen çok, doğrulanan az.Fanzin illüstrasyon hattı

Orijinal kaynak: openai.com, community.openai.com

Olay tarihi: 6 Ekim 2026. Yayım tarihi: 11 Ekim 2026.

OpenAI, 6 Ekim’de yayımlanmamış bir iç modelin ürettiği matematik sonuçlarını kamuya açtı. Şirketin openai/math deposunda şu an 722 makale, 372 ilgili sonuç ailesi halinde duruyor. Açıklamaya göre bu sonuçlar yaklaşık 4.000 problemlik bir değerlendirmeden çıktı ve sonuç başına ortalama hesaplama, iç modelle “yaklaşık üç saat ChatGPT Pro düşünmesine” eşdeğer.

Bu haberin manşet tarafı kolay: bir yapay zekâ, insan matematikçilerin alanına toplu sonuç bıraktı. Zor ve daha ilginç tarafı başka: OpenAI aynı yazıda sonuçların nasıl doğrulanacağını da bir sorun olarak kabul ediyor.

Ne yayımlandı, ne yayımlanmadı

  • Makaleler, destekleyici kanıt dosyaları, birçok sonuç için Lean biçimselleştirmeleri ve modelin muhakemesini gösteren 10 kısaltılmış özet.
  • Revizyon ve atıf protokolleri; önceki sürümler erişilebilir kalıyor.
  • Lean kanıtları “birçok ama hepsinde değil” ifadesiyle veriliyor. Yani sonuçların bir bölümü makine tarafından denetlenebilir, kalanı matematikçi okumasına kalıyor.
  • Modelin kendisi yayımlanmadı. OpenAI, sonuçları üreten modeli “sorumlu biçimde yayımlamak için çalıştığını” yazıyor.

Şirket, yayın biçimini Institute for Advanced Study bünyesindeki bağımsız Matematik ve Yapay Zekâ Danışma Grubu’yla geliştirdiğini belirtiyor. Ayrıca sonuçların anlaşılması için atölye, konferans ve özel programları fonlayacağını duyuruyor.

Bize göre: asıl mesele sindirim kapasitesi

(Yorum) Matematikte yapay zekâ tartışması uzun süre “yapabilir mi” sorusuna sıkışmıştı. Bu yayın soruyu değiştiriyor: elinde 372 sonuç ailesi olan bir topluluk, bunları ne kadar hızlı denetleyebilir? 722 makaleyi okuyup doğrulayacak hakem kapasitesi, bugün dünyada yok. Sonuçların bir kısmının Lean ile biçimselleştirilmiş olması tam da bu yüzden kritik: biçimselleştirilen kısım insan emeğinden bağımsız denetlenebilir hale geliyor, kalan kısım gelmiyor.

Bu, yapay zekâ araştırmasında yeni bir asimetri yaratıyor. Üretim tarafı otomatikleşirken doğrulama tarafı hâlâ insan zamanıyla çalışıyor. Bir alanda üretim hızı doğrulama hızını aştığında olan şey bilimsel bilginin birikmemesi, sadece yığılmasıdır.

Yayının ikinci tartışma noktası daha soğuk: modelin kendisi açıklanmadı. Sonuçlar denetlenebilir, ama sonuçları üreten sürecin ayrıntıları sınırlı. Bir başka laboratuvarın aynı sayılara ulaşıp ulaşamadığını ölçmenin yolu, modelin erişilebilir olmasından geçiyor.

Tahmin: doğrulama altyapısı yeni bir darboğaz sektörü olacak

(Tahmin) Üç başlıkta hareket beklemek makul:

  1. Biçimselleştirme talebi artacak. Lean gibi kanıt denetleyicilerini kullanan araştırma grupları, yapay zekâ çıktısını kabul edilebilir hale getiren ara katman olarak değer kazanır.
  2. Aracı yayın protokolleri doğacak. Hakemli dergilerin bir kısmı, yapay zekâ üretimi metinler için “biçimselleştirilmiş kanıt yoksa kabul yok” benzeri kurallar geliştirmek zorunda kalabilir.
  3. Model erişimi bir müzakere konusu olacak. Doğrulamanın tamamı için modelin kendisinin de araştırmacılara açılması istenecek.

Türkiye bağlantısı

(Yorum) Türkiye’de matematik ve bilgisayar bilimi bölümlerinde bu tür içerikle çalışabilecek insan sayısı sınırlı. Bu yayın, ülkede iki farklı tepkiyi besleyecek: “bize de model verin, biz de üretelim” ve “doğrulayacak kadro yoksa üretimin anlamı yok”. İkinci tepki daha pahalı ama daha faydalı: biçimselleştirme ve denetim becerisi, model erişiminden bağımsız olarak kurulabilecek bir yetkinlik.

Kaynaklar

Doğrulama notu

Doğrulanan: yayının tarihi ve kapsamı, 722 makale ve 372 sonuç ailesi sayıları, yaklaşık 4.000 problemlik değerlendirme, sonuç başına yaklaşık üç saat ChatGPT Pro eşdeğeri hesaplama, Lean biçimselleştirmelerinin kısmi olduğu, 10 muhakeme özeti, IAS danışma grubu ve modelin yayımlanmadığı. Bu bilgiler OpenAI’ın kendi duyurusu ve topluluk yazısından alındı.

Doğrulanmayan: depodaki makalelerin matematiksel doğruluğu (bu yazı içeriği hakem denetiminden geçirmedi), modelin adı ve mimarisi, sonuçların hangi alanlarda yoğunlaştığı. Depo içeriği satır satır incelenmedi; sayılar OpenAI’ın kendi duyurusundan aktarıldı.

Bunları da oku

Yapay Zekâ

Google'ın TPU'su yörüngede: uzayda veri merkezi fikri test aşamasına geçti

Google, Project Suncatcher kapsamında prototip uydusunu 1 Ekim'de yörüngeye gönderdi ve uyduyla temas kuruldu. Amaç, yapay zekâ çiplerinin uzayda radyasyon, ısı ve titreşim altında çalışıp çalışmadığını ölçmek. Uzayda veri merkezi anlatısı ilgi çekici, mühendislik gündemi ise çok daha sıradan: ısı atma ve donanım ömrü.

3 dk okuma