Geniş dil modelleri ve yapay zekâ mimarileri, hesaplama kaynaklarının verimli kullanımı, çoklu modalite entegrasyonu ve uzun dizilimlerde bilgi akışının korunması açısından büyük bir teknolojik önem taşımaktadır. Açık kaynaklı ve açık ağırlıklı modellerin gelişimi, sınır düzeydeki yapay zekâ kabiliyetlerinin araştırmacılar tarafından incelenmesine ve dağıtık sistemlerde daha geniş ölçekte uygulanmasına olanak sağlamaktadır. Bu doğrultuda, modellerin bilgi işleme kapasitelerini artırırken birim hesaplama maliyeti başına elde edilen zekâ performansını yükseltmek, yapay zekâ araştırmalarının temel odak noktalarından birini oluşturmaktadır.
Büyük ölçekli yapay zekâ modellerinde parametre sayısının artırılması, bellek yönetimi ve hesaplama verimliliği açısından teknik darboğazlara yol açmaktadır. Araştırmacılar bu çalışmada, yüksek parametre kapasitesini korurken aktifleştirilen parametre miktarını dengede tutmayı, dizilim uzunluğu ile model derinliği boyunca bilgi akışını optimize etmeyi ve çok adımlı görevlerde ajan yeteneklerini geliştirmeyi amaçlamıştır. Bu teknik kısıtlamaları aşmak adına, Kimi K2 mimarisine kıyasla hesaplama birimi başına daha yüksek ölçekleme verimliliği sunan yeni bir model yapısının geliştirilmesi hedeflenmiştir.
Çalışmada, 2,8 trilyon parametreli MoE (büyük modellerde yalnızca ilgili alt ağların çalıştırıldığı mimari) yapısına sahip Kimi K3 modeli geliştirilmiştir. Model mimarisinde, bilgi akışını iyileştirmek amacıyla KDA (Kimi Delta Attention) ve AttnRes (dikkat artık bağlantıları) yöntemleri kullanılmış; Stable LatentMoE yapısı ile token başına 896 yönlendirilmiş uzmandan 16’sı etkin şekilde aktifleştirilerek token başına 104 milyar aktif parametre çalıştırılmıştır. Doğal görsel anlama yeteneği ve 1 milyon token’lık bağlam penceresi (bir kerede işlenebilen metin/veri miktarı) ile donatılan model, genel, ajan ve kodlama alanlarında pekiştirmeli öğrenme (reinforcement learning) süreçlerinden geçirilmiştir. Ayrıca KDA için algoritma-sistem ortak tasarımı, bellek yönetimli uzman-paralel eğitim ve kalıcı durum yönetimli sandviç ortam altyapıları kurulmuştur.
Yapılan performans değerlendirmelerinde Kimi K3, bir önceki model Kimi K2’ye kıyasla genel ölçekleme verimliliğinde yaklaşık 2,5 kat artış sağlamıştır. Model, kodlama ve ajan görevlerinde üst düzey performans sergileyerek Terminal-Bench 2.1 testinde 88.3, FrontierSWE testinde 81.2, SWE-Marathon testinde 42.0, BrowseComp testinde 91.2 ve AutomationBench testinde 38.8 puan elde etmiştir. Claude Fable 5 ve GPT-5.6 Sol gibi en güçlü mülk modellerin hemen ardından gelen Kimi K3; GPT-5.5, Opus 4.8 ve GLM-5.2 gibi diğer açık ve kapalı kaynaklı modelleri değerlendirme paketindeki birçok testte geride bırakmıştır.
Kimi K3 modelinin geliştirilmesi ve tüm model ağırlıklarının erişime açılması, açık kaynaklı yapay zekâ araştırmalarını destekleme ve sınır düzeydeki zekâ teknolojilerinin yaygınlaşmasını hızlandırma potansiyeline sahiptir. Model ile birlikte dikkat çekirdeklerinin, MoE iletişim kütüphanelerinin ve ölçeklenebilir ajan ortamı altyapılarının paylaşılması, uzun soluklu kodlama ve otonom ajan araştırmalarında yeni geliştirme süreçlerine zemin hazırlamaktadır.
Yazar: Hazel BİRGÜL
Editör: Elinsu AK
Referans: Kimi Team. Releasing the model weights and technical report of Kimi K3. Moonshot AI (2026). http://github.com/MoonshotAI/Kimi-K3/blob/master/k3_tech_report.pdf
-Bioinforange Bilimsel Haber Servisi-
Haber Yazıları, 20> Etki Faktörlü Q1 dergilerinde yayınlanan (listesi için tıklayınız)
bilimsel araştırmaların ekip arkadaşlarımız tarafından incelenip derlenmesi ile hazırlanmaktadır.

