Bizimle iletişime geçin

Haberler

OpenAI, gerçekçi, duygusal konuşmalar üretebilen yeni nesil bir “Ses Motoru” tanıttı

OpenAI, daha güvenilir konuşmadan metne dönüştürme ve arka plan gürültüsü ve aksanlar gibi zorlu ses koşullarının daha iyi işlenmesini sağlayan gpt-4o-transcribe ve gpt-4o-mini-transcribe adlı geliştirilmiş ses modellerini yayınladı.

Yayınlanma tarihi

on

OpenAI, API’sine, şirketin önceki sürümlerini geliştirdiğini iddia ettiği yeni transkripsiyon ve ses üreten yapay zeka modelleri getiriyor.

OpenAI için bu modeller, kullanıcılar adına görevleri bağımsız olarak yerine getirebilen otomatik sistemler oluşturmak anlamına gelen daha geniş “ajan” vizyonuna uyuyor. “Temsilci” tanımı tartışmalı olabilir, ancak OpenAI Ürün Başkanı Olivier Godement bir yorumu, bir işletmenin müşterileriyle konuşabilen bir sohbet robotu olarak tanımladı.

Godement, “Önümüzdeki aylarda giderek daha fazla temsilcinin ortaya çıktığını göreceğiz. Genel tema, müşterilerin ve geliştiricilerin faydalı, kullanılabilir ve doğru aracılardan yararlanmasına yardımcı olmak” dedi.

OpenAI, yeni metinden konuşmaya modeli “gpt-4o-mini-tts ‘nin sadece daha nüanslı ve gerçekçi bir konuşma sunmakla kalmayıp aynı zamanda önceki nesil konuşma sentezleme modellerine göre daha ’yönlendirilebilir” olduğunu iddia ediyor. Geliştiriciler gpt-4o-mini-tts’e doğal dilde bir şeyleri nasıl söyleyeceği konusunda talimat verebiliyor; örneğin, “çılgın bir bilim adamı gibi konuş” veya “bir farkındalık öğretmeni gibi sakin bir ses kullan”.

İşte “gerçek suç tarzı”, yıpranmış bir ses:

OpenAI ürün ekibinin bir üyesi olan Jeff Harris, TechCrunch’a verdiği demeçte, amacın geliştiricilerin hem ses “deneyimini” hem de “bağlamı” uyarlamasına izin vermek olduğunu söyledi.

Harris, “Farklı bağlamlarda, sadece düz, monoton bir ses istemezsiniz. Bir müşteri destek deneyimindeyseniz ve sesin bir hata yaptığı için özür dilemesini istiyorsanız, aslında sesin içinde bu duyguyu barındırmasını sağlayabilirsiniz… Buradaki en büyük inancımız, geliştiricilerin ve kullanıcıların yalnızca ne konuşulduğunu değil, nasıl konuşulduğunu da gerçekten kontrol etmek istedikleridir” dedi.

OpenAI’nin yeni konuşmadan metne modelleri olan “gpt-4o-transcribe” ve “gpt-4o-mini-transcribe” ise şirketin uzun süredir kullandığı Whisper transkripsiyon modelinin yerini alıyor. OpenAI, “çeşitli, yüksek kaliteli ses veri kümeleri” üzerinde eğitilen yeni modellerin kaotik ortamlarda bile aksanlı ve çeşitli konuşmaları daha iyi yakalayabildiğini iddia ediyor.

Harris ayrıca halüsinasyon görme olasılıklarının da daha düşük olduğunu sözlerine ekledi. Whisper, ırkçı yorumlardan hayali tıbbi tedavilere kadar her şeyi transkriptlere ekleyerek, konuşmalarda kelimeleri ve hatta tüm pasajları uydurma eğilimindeydi.

Harris, “Bu modeller bu konuda Whisper’a kıyasla çok daha gelişmiş durumda. Modellerin doğru olduğundan emin olmak, güvenilir bir ses deneyimi elde etmek için tamamen önemlidir ve [bu bağlamda] doğru olması, modellerin kelimeleri tam olarak duydukları [ve] duymadıkları ayrıntıları doldurmadıkları anlamına gelir” diye konuştu.

Bununla birlikte, kat ettiğiniz mesafe yazıya dökülen dile bağlı olarak değişebilir.

OpenAI’nin dahili kıyaslamalarına göre, iki transkripsiyon modelinden daha doğru olan gpt-4o-transcribe, Tamil, Telugu, Malayalam ve Kannada gibi Indic ve Dravidian dilleri için %30’a yaklaşan (%120 üzerinden) bir “kelime hata oranına” sahip. Bu, modelden alınan her 10 kelimeden üçünün bu dillerde insan transkripsiyonundan farklı olacağı anlamına gelir.

OpenAI, geleneği bozarak yeni transkripsiyon modellerini açık bir şekilde kullanıma sunmayı planlamıyor. Şirket geçmişte Whisper’ın yeni sürümlerini MIT lisansı altında ticari kullanım için yayınlamıştı.

GPT-4o-transcribe ve gpt-4o-mini-transcribe’ın “Whisper’dan çok daha büyük” olduğunu ve bu nedenle açık bir sürüm için iyi adaylar olmadığını söyleyen Harris, “Whisper gibi dizüstü bilgisayarınızda yerel olarak çalıştırabileceğiniz türden bir model değiller. Bir şeyleri açık kaynak olarak yayınlıyorsak, bunu düşünceli bir şekilde yaptığımızdan ve bu özel ihtiyaç için gerçekten geliştirilmiş bir modele sahip olduğumuzdan emin olmak istiyoruz. Ve son kullanıcı cihazlarının açık kaynak modelleri için en ilginç durumlardan biri olduğunu düşünüyoruz” dedi.

Kaynak: TechCrunch

Araştırma

Podcast yayıncılığındaki “format savaşı” sona mı eriyor?

Yayınlanma tarihi

=>

Acast, Podcast Pulse raporunun 2026 edisyonunu yayınladı. Başlıca bulgu şu:

“Format tartışması sona erdi. İzleyiciler umursamayarak tartışmayı bitirdiler.”

Kaygısız, evet, ve verilerle destekleniyor. Acast CEO’su Greg Glenday: “Podcast sektörü formatlara ve platformlara takıntılı […] Dinleyiciler böyle düşünmüyor.”

Aşağıda, 49 sayfalık bu basın bülteninin giriş bölümünde yer alan önemli bir ölçüt bulunuyor:

Podcast tüketicileri hakkında iki önemli bulguyu hızla öğreniyoruz:

  • “On kişiden dokuzu, en sevdikleri podcast yayıncılarını podcast’in kendisinin ötesinde bir yerlerde takip ediyor […] Podcast yayıncılığı akışkan bir yapıya sahip. Platformlar ve formatlar sadece birer kap görevi görüyor.”
  • Sesli/görüntülü içerik tüketici grubu her yıl hızla artıyor; ankete katılan tüketicilerin %88’i artık hem sesli hem de görüntülü podcast dinliyor, bu da geçen yılki ankete göre %78’lik büyük bir artış anlamına geliyor.

Genel olarak podcast tüketiminin, hem dinleme hem de izleme açısından artacağı tahmin ediliyor:

  • — %49’u podcast’leri daha sık dinlemeyi bekliyor.
  • — %48’i podcast’leri daha sık dinlemeyi bekliyor.

(Şunu da aklınızda bulundurmanızda fayda var: “YouTube’da podcast izlemek” ifadesi , aynı kolaylıkla (ve belki de aynı sıklıkla) YouTube’da podcast dinlemek anlamına da gelebilir.)

İlginç bir şekilde, bu araştırma, tek bir podcast’i dinlerken platformlar arasında geçiş yapan dinleyicileri test etti; katılımcıların %63’ü bunu yaptığını, %75’inin ise bunu yapmak için uygulama veya platform değiştirmek zorunda kaldığını belirtti.

Günün saati de burada önemli bir rol oynuyor: “Ses kayıtları sabah saatlerine, videolar ise gece saatlerine hakim. ‘Öğle arası videoları’ ise öğle saatlerine hakim,” diye öğreniyoruz ki bu da mantıklı.

Ekran olmadan dinleme kısmen bir tercih… ve aynı zamanda bir zorunluluk. Bu şekilde dinleyen katılımcıların %50’si ekranı istemiyor ve %50’si de çeşitli nedenlerle ekrana erişemiyor.

Bu çalışma, video podcast dinlemenin medya sınırlarını aşan reklam fırsatları yarattığına dikkat çekiyor. Bu nokta şu ölçütle vurgulanıyor: “Acast podcast’leri ve içerik oluşturucularının sosyal ağlarda 3,75 milyar takipçisi var.”

Bu kapsamlı sunumda ele alınan diğer konular şunlardır:

  • Markalar için canlı podcast yayıncılığının avantajları
  • Podcast yayıncılığında marka güveni, diğer birçok medya kategorisine göre daha yüksektir.
  • Podcast’lerde dinleyici ilgisi, müzik yayını veya radyoya kıyasla daha yoğundur.
  • Podcast’ler “aranan, sunulan değil” şeylerdir.
  • Podcast’ler “gerçekleri yansıtır” (bu, yapay zeka çağının bir değeridir).
  • Podcast’lerin dinleyici üzerindeki etkisi, tüketici davranışını etkileme söz konusu olduğunda diğer medya türlerine göre “daha etkili”dir.
  • Podcast’lerde reklam atlama diğer medya türlerine göre daha az yaygındır.
  • Bir markaya tekrar tekrar maruz kalmak markaya zarar vermez; aksine fayda sağlar.

Bu sunum dosyası, 30 saniyelik video podcast reklamları oluşturmaya dair kısa bir eğitim içeriyor.

Araştırmanın orijinaline BURADAN ulaşabilirsiniz.

Kaynak: RainNews

Okumaya devam et

Haberler

YouTube, yeni içerik oluşturma araçlarını ve alışveriş özelliklerini tanıttı

YouTube, New York’ta düzenlenen yıllık Made on YouTube etkinliğinde bir dizi yapay zeka aracı, alışveriş güncellemeleri ve kişiselleştirilmiş izleyici özelliklerini tanıttı.

Yayınlanma tarihi

=>

Alphabet’e ait YouTube, New York’ta düzenlenen yıllık Made on YouTube etkinliğinde bir dizi yapay zeka aracı, alışveriş güncellemeleri ve kişiselleştirilmiş izleyici özelliklerini tanıttı.

Bu yeni özellikler şunlardan oluşuyor:

  • Yeni içerik oluşturucu araçları arasında YouTube Studio’ya eklenen, video taslakları üzerinde geri bildirim alma, kanala uygun küçük resimler oluşturma ve üç adede kadar video kesitini test etme özellikleri yer alıyor.
  • Shorts ve YouTube Create’deki Gemini destekli asistan, klipleri düzenlemeye, duraklamaları kırpmaya ve müziği senkronize etmeye de yardımcı olacak.
  • Video platformu, içerik oluşturucuların tercihlerine uyum sağlayan, isteğe bağlı yapay zeka tabanlı yorum denetimini test ediyor. Ayrıca, benzerlik koruma araçlarında ses ve yüz tanımayı birleştirecek.
  • Şirket, yıl sonuna kadar YouTube Alışveriş ortaklık programını 35 ülkeye genişletecek ve halihazırda 1,3 milyondan fazla içerik üreticisi programa kayıtlı durumda.
  • Hindistan ve Brezilya’daki içerik üreticileri yakında Amazon ürünlerini etiketleyebilecekler; ürün etiketleri ise farklı pazarlardaki izleyicilere yerelleştirilmiş teklifler gösterecek.
  • YouTube, ABD’deki kullanıcılar için web, mobil ve TV platformlarında Özel Akışlar özelliğini sunacak. Bu özellik sayesinde kullanıcılar, belgeseller veya kendin yap videoları gibi ilgi alanlarına göre uyarlanmış ana sayfa sekmelerini kaydedebilecekler.
  • YouTube’un “YouTube’a Sor” özelliği, TV kullanıcıları için ürün karşılaştırma tabloları ve sesli komutlar da dahil olmak üzere alışveriş sorguları ve takip soruları ekleyecek.

Kaynak: Youtube Blog

Okumaya devam et

Haberler

Substack, uygulamasına podcast sekmesi ekledi

Substack, uygulamasında yeni bir podcast sekmesi başlattı. Substack’in eklediği yeni sekme, “Mevcut dinleyicilerinize kolayca ulaşabileceğiniz ve yeni dinleyicilerin sizi bulmasına yardımcı olabileceğiniz özel bir alan” sunuyor.

Yayınlanma tarihi

=>

Substack, uygulamasında yeni bir podcast sekmesi başlattı.

Substack’in eklediği yeni sekme, “Mevcut dinleyicilerinize kolayca ulaşabileceğiniz ve yeni dinleyicilerin sizi bulmasına yardımcı olabileceğiniz özel bir alan” sunuyor.

Bu sekmede, Substack içerik üreticilerinin programları listeleniyor. Şirket, Podnews’e “Substack’te podcast yayınlayan içerik üreticilerinin toplamda yılda 200 milyon doların üzerinde gelir elde ettiğini” belirtti.

İşte en popüler programların listesi.

Substack web sitesinden yapılan açıklamada ise şunlar kaydedildi:

“Substack uygulamanızda artık sevdiğiniz sesli ve yazılı içerikleri keşfetmek için iki bölüm var: Podcast Sekmesi ve Okuma Sekmesi.

Binlerce içerik üreticisi, podcast’leri için Substack’i tercih etti. Bize en büyük zorluklarının yeni dinleyicilerin çalışmalarını bulmasına yardımcı olmak olduğunu söylediler. Podcast Sekmesi tam da bunu yapmak için tasarlandı. İçerik üreticileri için Podcast Sekmesi, mevcut dinleyicilerinize kolayca ulaşabileceğiniz ve yeni dinleyicilerin sizi bulmasına yardımcı olabileceğiniz özel bir alandır.

Substack uygulaması büyüdükçe siz de büyürsünüz. Uzun metin yazımı her zaman Substack’in kalbi olacaktır. Okuma sekmesinde , okuyucular abone oldukları tüm Substack’leri okuyabilir ve yeni harika yazılar keşfedebilirler.

Podcast yayıncılarına ve yazarlara kitlelerini genişletmeleri için yeni yollar sunuyoruz ve milyonlarca insanın sevdikleri yeni podcast’leri ve yazıları keşfetmelerine yardımcı oluyoruz.”

Okumaya devam et

En son