ChatGPT vs Gemini: Görsel tanımada hangisi daha iyi?
Aynı fotoğraflarla yapılan dört basit sınavda Gemini, el yazısı ve film esinini doğru tanıdı; ChatGPT bitki teşhisinde daha faydalı cevaplar verdi. Satranç turu tartışmalı kaldı.

OpenAI’nin ChatGPT’si ve Google’ın Gemini’si metinde güçlü, ama artık gündelik kullanım kameraya da uzanıyor. Çok kipli yapay zekâ (metin, görsel, ses gibi farklı veri türlerini birlikte işleyebilen sistem) çağında iki popüler sohbet botunun “görerek anlama” yetenekleri, aynı fotoğraflar ve aynı komutlarla dört basit senaryoda sınandı.
Nasıl test edildi
Yalnızca fotoğraf kullanıldı; canlı video yoktu.
Aynı kareler, aynı istem (prompt) ile hem ChatGPT’ye hem Gemini’ye yüklendi.
Dört senaryo seçildi: karalanmış el yazısı, canlı bir satranç pozisyonu, Venus flytrap (Sinekkapan) bitkisinde kararma nedeni ve filmden esinli el yapımı tablolar.
Sorular basitti: “Bu metni çöz ve kaynağını tanı”, “Siyah için en iyi hamle nedir?”, “Neden kararıyor, ne yapmalı?”, “Hangi filmden esinlenmiş?”
Satranç turu için bağımsız uzman görüşü alınamadı; ilgili federasyona ulaşıldı ancak yanıt gelmedi. Çapraz kontrol amaçlı bir başka yapay zekâya aynı konum ve yanıtlar gösterildi; sonuç, satrançta Gemini’nin tahtayı yanlış okumuş olabileceği yönündeydi.

Sonuçlar: Kimin nerede eli güçlü?
Karalanmış el yazısı: Gemini, metni hatasız çözüp kaynağı tanımladı; ChatGPT anlamı dağıttı ve belirsiz yerleri işaretlemekle yetindi.
Satranç pozisyonu: İki bot farklı ana hamleler önerdi; alternatif hamlede kesiştiler. Dış kontrol, ChatGPT’nin yanıtını daha uygun buldu. Kesin hüküm yok.
Sinekkapan bitkisi: İki bot da muhtemel nedenleri sıraladı; ChatGPT daha ayrıntılı açıklama ve pratik öneriler sundu.
Film esini: Gemini doğru filmi hızla belirledi ve sahne/oyuncu bilgisiyle destekledi; ChatGPT tanıyamadı, ipucu istedi.
Testlerin ayrıntıları
Test 1: Karalanmış notlar
E-mürekkep bir tablette aceleyle yazılmış, Arthur Conan Doyle’un The Hound of the Baskervilles eserinden bir paragrafın kopyası iki bota yüklendi. ChatGPT, ilk satırdan itibaren ciddi yazım ve anlam hataları yaptı; anlaşılmayan kısımları köşeli parantezle işaretledi ve metnin içeriğini yanlış bağlamda yorumladı. Gemini ise kelime kelime doğru çözümleme yaptı, metnin kaynağını tanıdı ve görüntüden el yazısına özgü ipuçlarını (örneğin belirli harflerde açık döngü biçimleri) tarif etti. Bu turda açık farkla Gemini öndeydi.
Test 2: Satranç pozisyonu
Bir e-spor turnuvasının canlı yayınından alınmış oyun pozisyonu için “Siyahın en iyi hamlesi nedir?” sorusu soruldu. Gemini uzun bir varyant dizisi anlattı ve nihai öneri olarak filin alışı (Bxf4) hamlesini verdi. ChatGPT yanıtı hazırlarken bir satranç motoru aradığını belirtti ve cevap için 4 dakikadan fazla süre harcadı; ana önerisi c5’ten d4’e piyon sürüşüydü, ikinci en iyi hamle olarak ise filin alışı (Bxf4) seçeneğini paylaştı. Bağımsız hakemlik sağlanamadığı için somut kazanan ilan edilmedi; üçüncü bir yapay zekânın hızlı kontrolü, Gemini’nin tahtayı hatalı okuduğu, ChatGPT’nin hamlesinin daha uygun olduğu yönündeydi.

Test 3: Sinekkapan (Venus flytrap)
Fotoğraftaki kültivarın tam adını saptamak her iki bot için de zordu. Gemini, doğru kültivarı söyleyemedi ancak kapanın kararması için bir dizi gerekçe sıraladı; bunlar arasında “kapanın, fazla büyük bir avı sindirmeye çalışması” olasılığını da belirtti. ChatGPT, belirli bir kültivar adı vermekte temkinliydi; kararmanın nedenlerini daha ayrıntılı açıkladı ve “ne yapılmalı” bölümüyle pratik bakım önerileri sundu. Bu turda daha faydalı yanıt ChatGPT’den geldi.
Test 4: Filmden esinli sanat
Üç küçük tablo, Hocus Pocus filmindeki Sanderson Sisters karakterlerinin ağızlarını stilize ederek resmediyordu ve resmi ürün değildi. ChatGPT tabloyu doğru betimledi fakat filmi tanımlayamadı; yılı gibi ek ipuçları istedi. Gemini ise Hocus Pocus’u doğrudan işaret etti, tablolardaki sıralamayı karakterlere göre eşledi ve oyuncu adlarıyla bilgiyi pekiştirdi. Bu tur Gemini’nin hanesine yazıldı.

Neden önemli?
Görselden anlama; belge, tahtadaki not, ürün/bitki teşhisi ve kültür-sanat referanslarını yakalama gibi günlük işlerde kritikleşiyor. Bu karşılaştırma, “görerek anlama”nın tek boyutlu olmadığını gösteriyor: salt tanıma isabeti, açıklamanın ayrıntısı, hız ve bağlamsal gerekçelendirme aynı anda önemli.
Bu küçük örneklem, tek oturum ve tek cihazda yapılan kısa testlerden oluşuyor; bir kıyaslama standardı sayılmamalı. Modeller sık güncelleniyor; versiyon, ayar ve görüntü kalitesi sonuçları değiştirebilir. Yine de eğilim net: Kaynağı ve görsel esini tanıma işlerinde Gemini daha istikrarlı görünürken, çoklu olasılıkları tartıp kullanıcıya eylem planı çıkarma konusunda ChatGPT’nin üslubu avantaj sağlayabiliyor.
Bu haber işinize yaradı mı?
Hüseyin Gülbahçe
Kurucu · Genel Yayın YönetmeniAjans Dijital'in kurucusu ve genel yayın yönetmeni. Teknoloji, bilim, yapay zekâ, pazarlama ve kültür-sanat gündemini izler; sitedeki haberlerin seçimi, yazımı ve podcast yayınlarından sorumludur.



