VLM nedir? Görsel-dil modelleri video analizinde nasıl çalışır?
Yazan: Alphan Eker, Kurucu OrtakGüncellendi:
VLM (görsel-dil modeli), görüntüyü ya da videoyu dille birlikte okuyan bir yapay zekâ modelidir: sahnede ne olduğunu anlatabilir, sahneyle ilgili soruları cevaplayabilir ve vardığı sonucun gerekçesini sade bir dille açıklayabilir. Klasik görüntü işleme nesneleri tespit edip "insan var, forklift var" noktasında dururken, VLM eylemi ve bağlamı okuyabilir: kim ne yapıyor ve bu olağan mı? Video analizinde bu, birinin hâlâ yorumlaması gereken kutular ve etiketler yerine, kanıt klibiyle birlikte cümle olarak yazılmış bulgular demektir.
VLM (görsel-dil modeli) nedir?
VLM (vision-language model, görsel-dil modeli), görsel bir girdiyi — bir fotoğrafı, bir kare dizisini, bir video klibini — alıp onunla dil üzerinden çalışan bir modeldir. Sahneyle ilgili bir soru sorulabilir ("Bu makinenin koruyucusu açık mı?"), neye bakması gerektiği söylenebilir ("iki bacak arasında lehim köprüsü") ve sözle cevap verir: ne gördüğünü ve sonuca neden vardığını.
İşe yarayan taraf bu birleşimdir. Görsel taraf modele sahneyi verir; dil tarafı ise o sahneye dair bilgiyi — bir iş güvenliği kuralını, bir kabul kriterini, bir mağaza prosedürünü — taşımanın ve bulduğunu bir kişinin okuyup kontrol edebileceği biçimde raporlamanın yolunu verir. Bu yüzden VLM'ler, deneyimli birinin bakarak çözdüğü problemlere doğal olarak uyar: sahadaki bir İSG profesyoneli, kasadaki bir kayıp önleme denetçisi, doğrulama istasyonundaki bir muayene uzmanı.
Terim nereden geliyor?
Ad, modelin neyi birleştirdiğini söyler: görsel (görüntü ve video) ve dil (metin). Büyük dil modelleri yalnızca metinle çalışır; VLM ise görsel girdiyi okuma yeteneğini ekler, böylece aynı türden muhakeme bir kameranın gördüğüne de uygulanabilir.
VLM'in klasik görüntü işlemeden farkı ne?
Klasik görüntü işleme — nesne tespiti, sınıflandırma, bölütleme — her kare için sabit bir soruyu cevaplar: hangi nesneler var ve neredeler? İnsan ve forklift üzerine eğitilmiş bir tespit modeli, her birinin etrafına bir kutu çizip "insan" ve "forklift" der. Sonrasında olan — ikisinin karşılaşmak üzere olup olmadığı, kişinin ziyaretçi mi sürücü mü olduğu — o kutuların üzerine yazılmış kurallara ya da ekranı izleyen bir kişiye kalır.
- Nesne ve eylem. Tespit modeli karede ne olduğunu söyler. VLM ne yapıldığını okuyabilir: makineye uzanan bir operatör, siparişi teslim eden bir kasiyer, arkasındaki birine doğru geri giden bir forklift.
- Etiket ve açıklama. Tespit modeli bir sınıf ve bir puan verir. VLM bir cümle verebilir: ne oldu, nerede ve neden önemli.
- Sabit sınıflar ve tarif edilen hedefler. Tespit modeli eğitildiği sınıfları bilir. VLM'e ise neye bakacağı ve sahanın kuralları dille anlatılabilir — alan bilgisi modelin üzerine bu şekilde konur.
- Tek kare ve bağlam. Tespit modeli her kareyi kendi başına değerlendirir. VLM sahneyi bağlamıyla okuyabilir: bölge, yapılan iş, birkaç saniye önce ne olduğu.
Klasik görüntü işlemenin hâlâ yeri vardır: iyi tanımlanmış sorular için hızlı, hafif ve öngörülebilirdir. Tarafsız bir karşılaştırma için VLM ve kural tabanlı video analizi rehberimize bakabilirsiniz.
Klasik görüntü işleme "karede ne var?" sorusunu cevaplar. Görsel-dil modeli ise "burada ne oluyor ve bu olağan mı?" sorusunu cevaplayabilir — ve nedenini söyler.
VLM videoyu nasıl okur?
Video anlama, kareleri tek tek okumaktan fazlasıdır. Bir sahada ya da kasada önemli olanların çoğu birkaç saniyeye yayılan bir eylemdir; bu yüzden VLM tabanlı bir sistem videoyu tek kareler hâlinde değil, zaman pencereleri hâlinde okur.
01
Kare değil, pencere
Akış kısa pencerelere bölünür; böylece bir eylemin öncesi ve sonrası birlikte okunur. Yönü, sırayı ve niyeti görünür kılan budur: iptal edilmeden önce ödenip teslim edilmiş bir satış, bir forkliftin girmek üzere olduğu kesişime yürüyen bir kişi.
02
Ön filtre anları seçer
Bir video akışının büyük kısmında olağan dışı bir şey olmaz. Daha hafif bir ilk aşama her akışı izler ve dikkat gerektiren pencereleri derin analize taşır; böylece maliyetli okuma, önemli olduğu yerde harcanır.
03
Üzerine alan bilgisi
Model pencereyi, konfigüre edildiği bilgiyle okur: sahanın iş güvenliği kuralları, kartın kabul kriterleri, mağazanın prosedürleri. Aynı çekirdek bir yerde İSG uzmanı, başka bir yerde muayene uzmanı gibi çalışabilir.
04
Dille yazılmış, kanıtlı bulgu
Sonuç, bir kişinin okuyabileceği bir cümledir; okunduğu zaman damgalı klibe eklenir ve daha sonra sorgulanabilecek bir hafızada saklanır.
VLM sahada neyi mümkün kılar?
VLM yalnızca nesneleri değil, eylemi ve bağlamı okuduğu için, eskiden kayıtları izleyen bir kişi gerektiren problemler her kamerada, her saat okunabilir. Her biri kendi rehberinde ele alınan birkaç örnek:
İş güvenliği
Bir forklift ile yaya arasındaki ramak kala olay, zararsız biten — ve genellikle kayda geçmeyen — birkaç saniyelik yol kesişmesidir. VLM rotayı ve yönü birlikte okuyup o anı kayda geçirebilir; bkz. ramak kala olay tespiti. Aynı bağlamsal okuma, KKD'nin bölgeye ve yapılan işe göre değerlendirilmesini de sağlar; böylece ziyaretçi ile kaynakçı aynı kurala tabi tutulmaz; bkz. KKD uyumu.
Kasa
POS kaydı neyin girildiğini söyler; kamera ne olduğunu gösterir. VLM kasadaki eylemi — okutmayı, atlanan ürünü, kasada kimse yokken girilen iadeyi — okuyabilir ve aynı saniyedeki POS satırıyla karşılaştırabilir. Bkz. kasiyer hileleri ve yapay zekâ ile tespiti.
Görsel kalite kontrol
Bir elektronik hattında VLM, AOI makinesinin işaretlediği noktalara ikinci bir bakış atabilir ve her birini deneyimli bir muayene uzmanı gibi okuyabilir; bkz. AOI yanlış alarmları. Aynı yaklaşım, atlanan bir adımın ya da hasarlı bir paletin görsel bir soru olduğu giriş kalite kontrol ve paketleme ve sevkiyat kontrolü için de geçerlidir.
Sınırlar ve bunlarla nasıl çalışılır?
VLM güçlü bir sahne okuyucusudur, bir garanti değil. Sınırlarını bilmek, onu iyi kullanmanın parçasıdır.
- Yalnızca görüntünün gösterdiğini okur. Kamerası olmayan kör bir köşe, bir komponentin altında kalan bir bağlantı, bir rafın arkasında kalan bir eylem: bunların hiçbiri okunamaz. Kapsam önce bir kamera yerleşimi sorusudur.
- Kendi görüntüleriniz üzerinde kanıtlanması gerekir. Işık, kamera açıları ve işin yapılış biçimi sahadan sahaya değişir. Başlamadan önce üzerinde anlaşılmış kriterlere göre değerlendirilen, kendi kameralarınız ya da görüntülerinizle yapılan bir pilot tek adil testtir.
- Bulgular kişilerin incelemesi içindir. Her bulgu kanıt klibi ya da görüntüsüyle gelmeli; böylece bir kişi harekete geçmeden önce kontrol edebilir. Tekil bir olay bakmak için bir nedendir, hüküm değil.
- Basit bir tespit modelinden daha fazla işlem gücü ister. Video pencerelerini büyük bir modelle okumak, kutu saymaktan daha fazla işlem gerektirir. Sistemler bunu bir ön filtreyle yönetir; derin analiz yalnızca önemli anlarda çalışır.
- Görüntüler hassastır. Çalışan insanların görüntüsü mahremiyet soruları doğurur. On-premise kurulum, anonimleştirme ve ilgili bölgeye odaklanan analiz, sonradan eklenen özellikler değil, sorulması gereken tasarım tercihleridir.
VLM tabanlı bir çözümde nelere bakmalı?
Hangi sağlayıcıyla görüşürseniz görüşün, görsel-dil modelleri üzerine kurulu bir video analiz sistemi için şu sorular yerindedir:
- Mevcut kameralarınızla çalışıyor mu? Elinizdeki IP kameralara bağlanabiliyor mu, yoksa yeni donanım mı gerekiyor?
- Her bulguyu açıklıyor mu? Her sonuç kanıt klibiyle okunabilir bir açıklama olarak mı geliyor, yoksa yalın bir etiket ve puan olarak mı?
- Alan bilginizi alabiliyor mu? Kurallarınız, prosedürleriniz ve kabul kriterleriniz sahnenin okunma biçimine işlenebiliyor mu; bunları değiştirmek ne kadar iş?
- Yanlış alarmları açıkça ele alıyor mu? Bulguların bir kişi tarafından nasıl incelendiğini ve tekil olayların tekrar eden örüntülerden nasıl ayrıldığını sorun.
- Kendi görüntüleriniz üzerinde pilot yapılabiliyor mu? Demo videosu değil; sizin kameralarınız, sahanız ve kriterleriniz.
- Veriniz sizde kalıyor mu? Görüntünün tesisten çıkmadığı on-premise bir seçenek var mı; KVKK ve GDPR gerekliliklerini karşılıyor mu?
- Hatırlıyor mu? Geçmiş bulgular aranıp sorgulanabiliyor mu; bölge, vardiya ya da hatta göre tekrarlar görülebiliyor mu?
- Sonuçlar doğru role ulaşıyor mu? Anlık uyarılar, periyodik özetler ve panolar — her biri harekete geçecek kişi için.
Primarch VLM'leri nasıl kullanır?
Bu bölüm ürünümüzü anlatır. Primarch, çözümlerini görsel-dil modelleri (VLM) üzerine kurar ve bu modelleri geliştirir. Primarch Vision çekirdektir: sahneyi bir insan gibi okur ve bulduğunu sade bir dille yazar. İş güvenliğinden kasaya her Primarch uzmanı, bu çekirdeğin farklı bir konfigürasyonudur; Özel VLM Çözümleri ise onu, katalogda olmayan ama görülebilen problemler için konfigüre eder.
- Bütünsel sahne okuma. Akış gerçek zamanlı pencerelere bölünür; ön filtre dikkat gerektiren anları derin analiz katmanına taşır. Çıktı bir etiket değil, eylem düzeyinde bir yorumdur.
- Konfigürasyonla tanımlanan uzmanlar. Bir uzman, aynı çekirdeğin üzerinde alan dokümantasyonu, mevzuat ve eşiklerle tanımlanır. Sıfırdan model eğitmiyoruz; uzmanı özel yapan bilgidir.
- Kanıt klipli, doğal dilde bulgular. Her bulgu, sahnenin insan diliyle yazılmış yorumudur; yanında zaman damgalı bir görüntü segmenti bulunur.
- Sorgulanabilir olay hafızası. Bulgular tesise ait bir hafızaya işlenir ve doğal dille sorgulanabilir.
- Uyarılar, özetler ve panolar. Anlık bildirimler, periyodik özetler ve role göre panolar.
- Her görsel girdi. RTSP kameraların yanı sıra fotoğraf arşivleri, periyodik çekimler, drone görüntüsü ve mikroskop çıktısı da bir uzmanın kaynağı olabilir.
- Gerçek zamanlı, çoklu kamera. Onlarca akış paralel izlenir; dikkat gerektiren pencereler otomatik olarak önceliklendirilir.
Nasıl devreye alınır?
01
Keşif
Problemi ve başarı kriterini birlikte tanımlarız: hangi sahne, hangi karar, hangi aksiyon?
02
Konfigürasyon
Alan bilgi tabanı, kural şablonları ve eşiklerle uzman profili oluşturulur; gerekirse hedefli ince ayar yapılır.
03
Pilot
Kendi sahanızdan gerçek görüntülerle doğrulama: ölçülebilir kriterlere karşı birlikte test ederiz. Kapsama bağlı olarak keşiften pilota geçiş tipik olarak birkaç hafta sürer.
04
Devreye alma
On-premise veya cloud kurulum, ekip eğitimi ve sürekli iyileştirme döngüsü.
- Mevcut kameralarınız. Primarch, elinizdeki RTSP destekli IP kameralara bağlanır; yeni kamera ya da özel donanım gerekmez.
- Veriniz sizde kalır. On-premise kurulumda görüntüler tesisten çıkmaz; KVKK uyumlu anonimleştirme tasarımın parçasıdır.
Sık sorulan sorular
VLM nedir?
VLM (görsel-dil modeli), görüntüyü ya da videoyu dille birlikte okuyan bir yapay zekâ modelidir. Sahnede ne olduğunu anlatabilir, sahneyle ilgili soruları cevaplayabilir ve vardığı sonucu sade bir dille açıklayabilir.
VLM ile görüntü işleme arasındaki fark nedir?
Klasik görüntü işleme nesneleri kare kare tespit eder ve sınıflandırır: "insan var, forklift var". VLM sahneyi dille okur: eylemi ve bağlamını anlatabilir, neye bakacağı ona söylenebilir ve sonucunun gerekçesini açıklayabilir. Klasik tespit modelleri basit, iyi tanımlanmış sorular için yararlı olmaya devam eder; VLM'ler muhakeme gerektiren problemleri açar.
VLM ile LLM arasındaki fark nedir?
Büyük dil modeli (LLM) metinle çalışır. Görsel-dil modeli girdi olarak görüntü ya da video da alır; böylece aynı türden dile dayalı muhakemeyi bir kameranın gördüğüne uygulayabilir.
VLM mevcut kameralarla çalışır mı?
Çalışabilir. Primarch, mevcut RTSP destekli IP kameralara yeni donanım gerekmeden bağlanır. VLM'in neyi okuyabileceği yine de kameranın ne gördüğüne bağlıdır; bu yüzden kapsam pilot sırasında kontrol edilir.
Görüntülerimiz tesisten çıkar mı?
Hayır. On-premise kurulumda görüntüler tesisinizde işlenir ve dışarı çıkmaz.
VLM'i yeni bir probleme uygulamak ne kadar sürer?
Primarch uzmanları sıfırdan eğitilmek yerine konfigürasyonla tanımlandığı için yeni bir kullanım alanı tipik olarak günler içinde devreye girer. Özel bir çözümde, kapsama bağlı olarak keşiften pilota geçiş tipik olarak birkaç hafta sürer.
