Canlı Yayınımı Yapay Zeka Klipliyor: 3 Saatten 6 Short
Üç Saat Yayın Yaptım, Sonra Klip Çıkarmaya Üşendim
Üç saatlik bir canlı yayının en iyi 30 saniyesi nerede? Bunu bulmak için kaydı baştan sona izlemen, notlar alman, sonra her kesiti dikey formata kırpıp altyazı geçmen gerekiyor. Ben bunu bir kez elle yaptım: yayın 3 saat, klip çıkarma 2,5 saat. İkinci yayında hiç yapmadım. Üçüncüde de yapmadım. Yayınlar birikti, Shorts kanalı boş kaldı.
Sorunun kaynağı ilham eksikliği değil — sürtünme. Yayın bittiğinde en son isteyeceğin şey, üç saatlik bir kaydı tekrar izlemek.
Bu yüzden yayını izleyen, viral anları kendi seçen, dikey kırpan, altyazı basan ve YouTube’a zamanlayan bir hat kurdum. Şu an elimi hiç sürmüyorum: yayın biter, ertesi gün Shorts sıraya girer. Bu yazıda o hattın tam mimarisini, kullandığım puanlama rubriğini (kopyala-kullan) ve canlıda öğrendiğim üç dersi anlatıyorum.
Hattın Beş Aşaması
Sistem tek bir sihirli model değil, birbirine bağlı beş adım. Her adım bir öncekinin çıktısını yiyor:
- Mikrofon kontrolü (ön eleme). Kayıttan üç ses örneği alınır (çeyrek, yarı, üç-çeyrek noktalarından) ve küçük bir konuşma tanıma modeliyle “burada gerçekten konuşma var mı?” diye bakılır. Mikrofon kapalı kalmış ya da sadece müzik çalmış bir yayını indirmeden eler. Bu adım olmadan sistem üç saatlik sessizliği işlemeye çalışıyor.
- Deşifre (kelime zaman damgalı). Tüm yayın kelime-kelime zaman damgasıyla metne çevrilir. Cümle bazlı değil, kelime bazlı — karaoke altyazı bunsuz olmuyor.
- Viral an seçimi (LLM + rubrik). Deşifre üst üste binen pencerelere bölünür, her pencere bir dil modeline verilir ve 9 sinyalli bir rubrikle puanlanır. Eşiği geçen kesitler klip adayı olur.
- Dikey kurgu. Her aday 1080×1920 dikey videoya dönüşür: üstte webcam kutusu, altta ekranın aktif bölgesi zoom’lanmış halde, ortada kelime-kelime karaoke altyazı. Kamera kutusu ve aktif bölge yüz tespiti + kare farkı analiziyle otomatik bulunur.
- Zamanlama ve yayın. Kalite kontrolünden geçen klipler YouTube’a private yüklenir ve ileri tarihli bir yayın saati verilir — hafta içi günde 1 klip, 12:00. Ben istemezsem yayına girmeden Studio’dan iptal edebiliyorum: otomasyon var ama veto hakkı bende.
Gerçek Sayılar: Bir Yayın Ne Kadar Tutuyor
Kritik soru şu: bir dil modeline üç saatlik deşifre okutmak pahalı mı? İki gerçek çalışmanın motorun ürettiği özet çıktısından çıkan sayılar:
| Yayın | Taranan pencere | Eşiği geçen klip | Model maliyeti |
|---|---|---|---|
| Yayın A | 19 | 7 → tekrar ayıklaması sonrası 6 | 0,34 dolar |
| Yayın B | 32 | 5 (+ 3 “işaretli” klip) | 0,37 dolar |
Yani bir yayının tamamını yapay zekaya okutup, puanlatıp, klip sınırlarını rafine ettirmek yarım dolardan az. Bu, kliplerin sağladığı zaman tasarrufuna kıyasla hesaba bile katılmayacak bir maliyet. Pahalı olan şey model değil, senin üç saatin.
Asıl Sır Modelde Değil, Rubrikte
“Bu yayından viral klipler çıkar” dediğinde model sana konuşmanın özetini verir — viral anı değil. Fark, ne aradığını sayısal olarak tarif etmekte. Motorun kullandığı rubrik 9 sinyalden oluşuyor, her biri 0-2 puan, toplam 18 üzerinden. Eşiğin altında kalan hiçbir şey klip olmuyor.
Kopyala, kendi içeriğine uyarla:
PUANLAMA RUBRİĞİ — her sinyal 0, 1 veya 2 puan (max 18). Eşik: 13.
1. TEK KONSEPT — 2 = tek net fikir | 0 = konular karışık, "neyse" ile zıplıyor
2. TWEET-EDİLEBİLİR — 2 = kesitten söküp tweet atsan tek başına anlamlı bir cümle var
3. MİNİ-ARK — 2 = problem→çözüm yayı kendi içinde kapanıyor | 0 = ortadan başlıyor
4. HOOK GÜCÜ — 2 = ilk 1-2 cümle TEK BAŞINA swipe durdurur (iddia/soru/sayı)
5. GÖRSEL DESTEK — 2 = demo var ("şunu açtım", "burada görüyorsunuz" = demo sinyali)
6. DUYGU / UYARILIM — 2 = şaşkınlık, net iddia, karşıt görüş (yüksek uyarılım = paylaşım)
7. BAĞIMSIZ ANLAŞILIRLIK — EN KRİTİK. 2 = bağlamdan koparılınca %100 anlaşılır
0 = "bu/şu/demin/dediğim gibi" ile BAŞLIYOR
8. SÜREYE SIĞAR MI — 2 = doğal 20-50 saniye (~50-160 kelime), tek konu
9. CTA BAĞLANIR MI — 2 = konu ürüne/topluluğa zorlamadan bağlanıyor
Eşiği geçen yoksa boş liste döndür. Zorlama.
Bu rubriği yazarken en çok tartıştığım madde 7 oldu. “Bağımsız anlaşılırlık” olmadan model, senin harika bulduğun ama “işte tam da bu yüzden” diye başlayan kesitleri seçiyor. İzleyici o kesiti akışta görür, bağlamı yoktur, 1,5 saniyede kaydırır. Bu yüzden geri-referansla başlayan hiçbir kesit tam puan alamıyor — kural motorun içine gömülü.
”Buraya Klip Al” — Yayında Sesli İşaretleme
Rubrik iyi ama her şeyi yakalayamıyor. Bazen yayında bir şey anlatıyorum ve o anda biliyorum: bu klip olacak. Model o anı 12 puanla eleyebilir, ben 20 puan veririm.
Çözüm basit oldu: yayında sesli komut veriyorum — “buraya klip alabilirsin”, “burayı klip at”. Motor deşifrede bu ifadeleri arıyor ve komutun işaret ettiği anlatım yayını (genelde komuttan geriye doğru, doğal başlangıç ve bitişiyle) zorunlu klip olarak işaretliyor. Rubrikten geçmesi gerekmiyor.
Küçük ama kritik ayrıntı: klibin bitişi komut cümlesinden önce olmalı — izleyici “burayı klip at” dediğimi duymamalı. Motor bunu ayrı bir sınır rafine adımıyla hallediyor.
Bu bana şunu öğretti: otomasyona insan işareti bırakma kanalı aç. Tam otonomi hedeflemek yerine, “insanın bildiğini sisteme ucuza söyleyebildiği” bir arayüz (burada: sesli komut) kaliteyi en çok artıran şey oldu.
Canlıda Aldığım Üç Ders
1. Ön eleme yapmayan hat, çöpü işler. Mikrofon kontrolünü sonradan ekledim. Öncesinde sistem, mikrofonun kapalı kaldığı bir yayını sonuna kadar indirip deşifre etmeye çalışıyordu — ve konuşma tanıma modeli sessizlikte halüsinasyon üretiyordu. Uydurma cümlelerden klip seçmeye çalışan bir yapay zeka izlemek eğlenceli değil. Her otomasyon hattının başına “bu girdi işlenmeye değer mi?” kapısı koy.
2. Diskini otomasyon doldurur. Üç saatlik 1080p yayın indirmesi ciddi yer kaplıyor. Hat, klipler üretildikten sonra ham videoyu siliyor — bu bir optimizasyon değil, zorunluluk. Aksi halde birkaç yayın sonra disk doluyor ve hat sessizce çöküyor.
3. Otomatik yayın ≠ kontrolsüz yayın. Klipler doğrudan public çıkmıyor: private yükleniyor + ileri tarihli yayın saati alıyor. Ben o pencerede istediğimi iptal edebiliyorum. Otomasyonun geri alınamaz olduğu her nokta, ilerde seni sabaha karşı panikleten bir noktadır.
Bugün Sen Ne Yapabilirsin — Kontrol Listesi
Kendi kliplerini otomatikleştirmek istiyorsan sırayla:
- Kaydını kelime zaman damgalı deşifre et (cümle bazlı çıktı yeterli değil — karaoke altyazı kelime ister).
- Deşifreyi üst üste binen 10-15 dakikalık pencerelere böl (klip pencere sınırında kaybolmasın diye bindirme şart).
- Yukarıdaki 9 sinyalli rubriği prompt’a göm, eşiği yaz, modele sıcaklık 0 ile puanlat.
- Eşiği geçen kesitler için sınırları ayrı bir çağrıda rafine ettir (“cümle ortasında başlama/bitirme”).
- Dikey kurguyu ffmpeg ile yap: kamera üstte, ekranın aktif bölgesi altta zoom’lu, karaoke altyazı ortada.
- Yayını private + ileri tarih olarak zamanla, kendine veto penceresi bırak.
- Hattın başına ön eleme, sonuna disk temizliği koy.
Bu Hat Nereye Bağlanıyor
Bu klip motoru tek başına çalışan bir oyuncak değil — yapay zeka ajan takımımın ürettiği işlerden biri. Takımı sprintlerle otopilotta nasıl çalıştırdığımı AI ajan takımını otopilotta çalıştırma yazısında anlattım. O takımın en büyük sorunu olan “her oturumda sıfırdan başlama” derdini ise ajanlara kalıcı hafıza vermek yazısında ele aldım.
Haftada 1 e-posta: Bu hattın kodunu, prompt’larını ve hatalarını — çalışan otomasyonları ve çöpe gidenleri — haftada bir e-postayla paylaşıyorum. Sayfanın sonundaki formdan abone olabilirsin; tek tıkla çıkarsın.
Kendi klip motorunu kurmak istiyorsan: Rubriği, ffmpeg kompozit ayarlarını ve zamanlama akışını bültende birebir paylaşıyorum — kopyala, kendi kanalına uyarla. Aşağıdaki formdan abone ol.
Sonuç
Bir yayını klipletmek artık benim için bir karar değil, bir arka plan süreci. Bunu mümkün kılan şey daha iyi bir model değil; ne aradığımı sayısal olarak tarif eden bir rubrik, hatanın ucuz olduğu bir ön eleme kapısı ve insanın müdahale edebildiği bir veto penceresi. Yapay zeka otomasyonunda işe yarayan kalıp genelde bu: modeli zeki varsayma, ölçütü sen yaz.
Yazar: Murat Baskıcıoğlu