GPT-6 Astra Benchmarks: Is It Really Better Than Fable 5.1?

A bilingual English story with sentence-by-sentence Turkish translation. Level: INTERMEDIATE (CEFR). Tap any word in the DuoBook reader for an instant translation.

Mina worked on a small research team that examined new artificial intelligence models.

Mina, yeni yapay zekâ modellerini inceleyen küçük bir araştırma ekibinde çalışıyordu.

The team was investigating whether GPT-6 Astra was truly better than Fable 5.1.

Ekip, GPT-6 Astra gerçekten Fable 5.1’den daha iyi mi, sorusunu araştırıyordu.

The company that created it had presented Astra as the world’s most intelligent model.

Üretici şirket, Astra’yı dünyanın en zeki modeli olarak tanıtmıştı.

However, independent evaluations showed that this claim needed more careful examination.

Ancak bağımsız değerlendirmeler, bu iddianın daha dikkatli incelenmesi gerektiğini gösteriyordu.

Mina knew that impressive headlines did not always describe real performance.

Mina, parlak başlıkların gerçek performansı her zaman anlatmadığını biliyordu.

Therefore, her team decided to compare the results under different tasks and conditions.

Bu nedenle ekibi, sonuçları farklı görevler ve koşullar altında karşılaştırmaya karar verdi.

The first results showed that Astra was clearly strong on some specialized tasks.

İlk sonuçlar, Astra’nın bazı özel görevlerde açıkça güçlü olduğunu gösterdi.

Computer use, terminal workflows, and finding information in long texts were among them.

Bilgisayar kullanımı, uçbirim işlemleri ve uzun metinlerden bilgi bulma bunlar arasındaydı.

Nevertheless, Fable 5.1 took the lead on Artificial Analysis’s broader Intelligence Index.

Buna rağmen, Yapay Zekâ Analizi’nin genel zekâ göstergesinde Fable 5.1 öne geçti.

Fable 5.1 scored 66 there, while Astra remained at 61.

Fable 5.1 burada 66 puan alırken Astra 61 puanda kaldı.

Fable 5.1 also won on the Coding Agent Index, scoring 70 against 67.

Kodlama aracısı göstergesinde de Fable 5.1, 70’e karşı 67 puanla kazandı.

Mina realized that Astra’s success was concentrated in particular areas, not spread everywhere.

Mina, Astra’nın başarısının genel değil, belirli alanlarda yoğunlaştığını fark etti.

Then the team examined Astra’s ARC-AGI-3 result in detail.

Sonra ekip, Astra’nın ARC-AGI-3 sonucunu ayrıntılı biçimde inceledi.

This test was designed to measure learning on the fly, not memorized patterns.

Bu sınav, ezberlenmiş kalıpları değil, anlık öğrenme yeteneğini ölçmek için tasarlanmıştı.

Earlier models had scored quite low, and the test was very difficult for language models.

Önceki modellerin sonuçları oldukça düşüktü ve sınav dil modelleri için çok zordu.

GPT-5.6 Sol had scored only 7.8 percent, while Claude Opus 5 had scored 30.2 percent.

GPT-5.6 Sol yalnızca yüzde 7,8, Claude Opus 5 ise yüzde 30,2 almıştı.

That was why Astra’s reported score of 99.9 percent looked extraordinary.

Astra’nın açıklanan yüzde 99,9’luk sonucu bu yüzden olağanüstü görünüyordu.

However, ARC Prize had tested Astra under two different evaluation setups.

Fakat ARC Prize, Astra’yı iki farklı değerlendirme düzeninde test etmişti.

In the provider-neutral standard setup, Astra scored 62.7 percent.

Sağlayıcıdan bağımsız standart düzende Astra yüzde 62,7 puan aldı.

This setup did not preserve the model’s private reasoning state between actions.

Bu düzen, modelin eylemler arasında özel düşünme durumunu korumuyordu.

The computing cost of that run was also reported to exceed 26,000 dollars.

Çalışmanın hesaplama maliyeti de 26.000 doların üzerinde raporlandı.

In the company’s own setup, the reasoning state was preserved and a special compaction system was used.

Şirketin kendi düzeninde ise düşünme durumu korunuyor ve özel sıkıştırma sistemi kullanılıyordu.

Under those conditions, Astra reached 99.9 percent, and the cost was about 18,800 dollars.

Bu koşullarda Astra yüzde 99,9’a ulaştı ve maliyet yaklaşık 18.800 dolardı.

Mina wrote that this setup was not necessarily unfair, but it made comparison difficult.

Mina, bu düzenin haksız olmadığını, fakat karşılaştırmayı zorlaştırdığını yazdı.

Vocabulary (English)

yapay zekâ modeli
artificial intelligence model
incelemek
to examine
gerçekten
truly
bağımsız değerlendirme
independent evaluation
iddia
claim
performans
performance
karşılaştırmak
to compare
koşul
condition
özel görev
specialized task
bilgisayar kullanımı
computer use
uçbirim işlemi
terminal workflow
uzun metin
long text
genel zekâ göstergesi
Intelligence Index
öne geçmek
to take the lead
kodlama aracısı
coding agent
yoğunlaşmak
to be concentrated
ayrıntılı biçimde
in detail
ezberlenmiş kalıp
memorized pattern
anlık öğrenme
learning on the fly
ölçmek
to measure
önceki model
earlier model
olağanüstü
extraordinary
açıklanan sonuç
reported result
değerlendirme düzeni
evaluation setup
sağlayıcıdan bağımsız
provider-neutral
özel düşünme durumu
private reasoning state
eylem arasında
between actions
hesaplama maliyeti
computing cost
korumak
to preserve
sıkıştırma sistemi
compaction system
koşul
condition
karşılaştırmayı zorlaştırmak
to make comparison difficult

More English stories

Create your own bilingual story on DuoBook · Explore more stories