Bizimle iletişime geçin

Haberler

OpenAI bir yıl önce duyurduğu ses klonlama aracı ‘Voice Engine’i hala yayınlamadı

OpenAI, geçen yıl Mart ayında sadece 15 saniyelik bir konuşma ile bir kişinin sesini klonlayabileceğini iddia ettiği Voice Engine adlı yapay zeka hizmetinin “küçük ölçekli bir önizlemesini” duyurdu. Yaklaşık bir yıl sonra, araç önizleme aşamasında kalmaya devam ediyor ve OpenAI ne zaman piyasaya sürülebileceğine ya da hiç piyasaya sürülüp sürülmeyeceğine dair hiçbir belirti vermedi.

Yayınlanma tarihi

on

OpenAI, geçen yıl Mart ayında sadece 15 saniyelik bir konuşma ile bir kişinin sesini klonlayabileceğini iddia ettiği Voice Engine adlı yapay zeka hizmetinin “küçük ölçekli bir önizlemesini” duyurdu. Yaklaşık bir yıl sonra, araç önizleme aşamasında kalmaya devam ediyor ve OpenAI ne zaman piyasaya sürülebileceğine ya da hiç piyasaya sürülüp sürülmeyeceğine dair hiçbir belirti vermedi.

Şirketin hizmeti yaygınlaştırma konusundaki isteksizliği, kötüye kullanım korkusuna işaret ediyor olabilir, ancak aynı zamanda düzenleyici incelemeyi davet etmekten kaçınma çabasını da yansıtabilir. OpenAI geçmişte güvenlik pahasına “parlak ürünlere” öncelik vermekle ve rakip firmaları pazara sürmek için acele etmekle suçlanmıştı.

Bir OpenAI sözcüsü yaptığı açıklamada, şirketin Voice Engine’i sınırlı sayıda “güvenilir ortak” ile test etmeye devam ettiğini söyledi.

Sözcü, “[Ortaklarımızın] teknolojiyi nasıl kullandıklarını öğreniyoruz, böylece modelin kullanışlılığını ve güvenliğini geliştirebiliriz” dedi. “Konuşma terapisinden dil öğrenimine, müşteri desteğine, video oyunu karakterlerine ve yapay zeka avatarlarına kadar farklı kullanım şekillerini görmek bizi heyecanlandırdı.”

Geri itildi

OpenAI’nin metinden konuşmaya API’sinde ve ChatGPT’nin Ses Modunda bulunan seslere güç veren Voice Engine, orijinal konuşmacıya çok benzeyen doğal sesli konuşma üretir. Araç, yazılı karakterleri konuşmaya dönüştürüyor ve yalnızca içerikle ilgili belirli korkuluklarla sınırlı. Ancak en başından beri gecikmelere ve değişen sürüm pencerelerine maruz kaldı.

OpenAI’nin Haziran 2024 tarihli bir blog yazısında açıkladığı gibi, Ses Motoru modeli, farklı sesleri, aksanları ve konuşma tarzlarını dikkate alarak, bir konuşmacının belirli bir metin transkripti için çıkaracağı en olası sesleri tahmin etmeyi öğreniyor. Bundan sonra, model yalnızca metnin sözlü versiyonlarını değil, aynı zamanda farklı konuşmacı türlerinin metni yüksek sesle nasıl okuyacağını yansıtan “sözlü ifadeler” de üretebilir.

TechCrunch tarafından görülen taslak bir blog yazısına göre OpenAI başlangıçta Özel Sesler olarak adlandırılan Ses Motorunu 7 Mart 2024’te API’sine getirmeyi amaçlıyordu. Plan, “sosyal fayda” sağlayan veya teknolojinin “yenilikçi ve sorumlu” kullanımlarını gösteren uygulamalar geliştiren geliştiricilere öncelik verilerek, daha geniş bir çıkıştan önce 100’e kadar “güvenilir geliştirici” grubuna erişim sağlamaktı. OpenAI bu teknolojiyi markalaştırmış ve fiyatlandırmıştı bile: “standart” sesler için milyon karakter başına 15 dolar ve “HD kalitesinde” sesler için milyon karakter başına 30 dolar.

Ardından, on birinci saatte şirket duyuruyu erteledi. OpenAI, Voice Engine’i birkaç hafta sonra herhangi bir kayıt seçeneği olmadan tanıttı. OpenAI, araca erişimin şirketin 2023’ün sonlarında birlikte çalışmaya başladığı yaklaşık 10 geliştiriciden oluşan bir kohortla sınırlı kalacağını söyledi.

OpenAI, Voice Engine’in Mart 2024 sonundaki duyuru blog yazısında “Sentetik seslerin sorumlu bir şekilde konuşlandırılması ve toplumun bu yeni yeteneklere nasıl uyum sağlayabileceği konusunda bir diyalog başlatmayı umuyoruz” diye yazdı. “Bu konuşmalara ve küçük ölçekli testlerin sonuçlarına dayanarak, bu teknolojinin geniş ölçekte kullanılıp kullanılmayacağı ve nasıl kullanılacağı konusunda daha bilinçli bir karar vereceğiz.”

Uzun süredir üzerinde çalışılıyor

OpenAI’ye göre Voice Engine 2022’den beri üzerinde çalışılan bir araç. Şirket, aracın potansiyelini ve risklerini göstermek için 2023 yazında “en üst düzeydeki küresel politika yapıcılara” demo yaptığını iddia ediyor.

Bugün aralarında engelli insanların daha doğal iletişim kurmasını sağlayan cihazlar geliştiren Livox’un da bulunduğu çok sayıda iş ortağı Voice Engine’e erişebiliyor. Livox’un CEO’su Carlos Pereira TechCrunch’a verdiği demeçte, aracın çevrimiçi olması gerekliliği nedeniyle (Livox’un müşterilerinin çoğunun interneti yok) Voice Engine’i bir ürün haline getiremediklerini, ancak teknolojiyi “gerçekten etkileyici” bulduğunu söyledi.

Pereira TechCrunch’a e-posta yoluyla yaptığı açıklamada, “Sesin kalitesi ve seslerin farklı dillerde konuşması imkanı benzersiz – özellikle de müşterilerimiz olan engelli insanlar için” dedi. “Gerçekten de gördüğüm en etkileyici ve kullanımı kolay ses oluşturma [aracı] […] OpenAI’nin yakında çevrimdışı bir sürüm geliştirmesini umuyoruz.”

Pereira, OpenAI’den olası bir Voice Engine lansmanı konusunda rehberlik almadığını ve şirketin hizmet için ücret almaya başlamayı planladığına dair herhangi bir işaret görmediğini söylüyor. Livox şimdiye kadar kullanımı için ödeme yapmak zorunda kalmadı.

Yukarıda bahsedilen Haziran 2024 tarihli gönderide OpenAI, Voice Engine’i geciktirirken göz önünde bulundurduğu hususlardan birinin geçen yılki ABD seçim döngüsü sırasında kötüye kullanım potansiyeli olduğunu ima etti. Paydaşlarla yapılan görüşmeler sonucunda Voice Engine, üretilen sesin kaynağını izlemek için filigran da dahil olmak üzere çeşitli hafifletici güvenlik önlemlerine sahiptir.

OpenAI’ye göre, geliştiriciler Voice Engine’i kullanmadan önce orijinal konuşmacıdan “açık onay” almalı ve izleyicilerine seslerin yapay zeka tarafından üretildiğine dair “açık açıklamalar” yapmalıdır. Ancak şirket bu politikaları nasıl uygulayacağını açıklamadı. OpenAI’nin kaynaklarına sahip bir şirket için bile bunu geniş ölçekte yapmak son derece zor olabilir.

OpenAI blog yazılarında ayrıca hoparlörleri doğrulamak için bir “ses kimlik doğrulama deneyimi” ve tanınmış kişilere çok benzeyen seslerin oluşturulmasını engelleyen bir “gidilmeyecekler” listesi oluşturmayı umduğunu ima etti. Her ikisi de teknolojik açıdan iddialı projeler ve bunları yanlış yapmak, sık sık güvenlik girişimlerini bir kenara bırakmakla suçlanan bir şirkete kötü yansıyacaktır.

Etkili filtreleme ve kimlik doğrulama, sorumlu ses klonlama teknolojisi sürümleri için hızla temel gereksinimler haline geliyor. Bir kaynağa göre yapay zeka ses klonlama, 2024’ün en hızlı büyüyen üçüncü dolandırıcılığı oldu. Gizlilik ve telif hakkı yasaları ayak uydurmakta zorlanırken, dolandırıcılık ve banka güvenlik kontrollerinin atlanmasına yol açtı. Kötü niyetli aktörler, ünlülerin ve politikacıların kışkırtıcı deepfake’lerini yaratmak için ses klonlamayı kullandı ve bu deepfake’ler sosyal medyada orman yangını gibi yayıldı.

OpenAI Voice Engine’i önümüzdeki hafta yayınlayabilir ya da hiç yayınlamayabilir. Şirket defalarca bu hizmetin kapsamını küçük tutmayı düşündüğünü söyledi. Ancak net olan bir şey var: Optik nedenlerden, güvenlik nedenlerinden ya da her ikisinden dolayı, Voice Engine’in sınırlı önizlemesi OpenAI’nin tarihindeki en uzun önizlemelerden biri haline geldi.

Kaynak: TechCrunch

Okumaya devam et
Yorum yapmak için tıklayın

Yanıt Ver

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Araştırma

Podcast yayıncılığındaki “format savaşı” sona mı eriyor?

Yayınlanma tarihi

=>

Acast, Podcast Pulse raporunun 2026 edisyonunu yayınladı. Başlıca bulgu şu:

“Format tartışması sona erdi. İzleyiciler umursamayarak tartışmayı bitirdiler.”

Kaygısız, evet, ve verilerle destekleniyor. Acast CEO’su Greg Glenday: “Podcast sektörü formatlara ve platformlara takıntılı […] Dinleyiciler böyle düşünmüyor.”

Aşağıda, 49 sayfalık bu basın bülteninin giriş bölümünde yer alan önemli bir ölçüt bulunuyor:

Podcast tüketicileri hakkında iki önemli bulguyu hızla öğreniyoruz:

  • “On kişiden dokuzu, en sevdikleri podcast yayıncılarını podcast’in kendisinin ötesinde bir yerlerde takip ediyor […] Podcast yayıncılığı akışkan bir yapıya sahip. Platformlar ve formatlar sadece birer kap görevi görüyor.”
  • Sesli/görüntülü içerik tüketici grubu her yıl hızla artıyor; ankete katılan tüketicilerin %88’i artık hem sesli hem de görüntülü podcast dinliyor, bu da geçen yılki ankete göre %78’lik büyük bir artış anlamına geliyor.

Genel olarak podcast tüketiminin, hem dinleme hem de izleme açısından artacağı tahmin ediliyor:

  • — %49’u podcast’leri daha sık dinlemeyi bekliyor.
  • — %48’i podcast’leri daha sık dinlemeyi bekliyor.

(Şunu da aklınızda bulundurmanızda fayda var: “YouTube’da podcast izlemek” ifadesi , aynı kolaylıkla (ve belki de aynı sıklıkla) YouTube’da podcast dinlemek anlamına da gelebilir.)

İlginç bir şekilde, bu araştırma, tek bir podcast’i dinlerken platformlar arasında geçiş yapan dinleyicileri test etti; katılımcıların %63’ü bunu yaptığını, %75’inin ise bunu yapmak için uygulama veya platform değiştirmek zorunda kaldığını belirtti.

Günün saati de burada önemli bir rol oynuyor: “Ses kayıtları sabah saatlerine, videolar ise gece saatlerine hakim. ‘Öğle arası videoları’ ise öğle saatlerine hakim,” diye öğreniyoruz ki bu da mantıklı.

Ekran olmadan dinleme kısmen bir tercih… ve aynı zamanda bir zorunluluk. Bu şekilde dinleyen katılımcıların %50’si ekranı istemiyor ve %50’si de çeşitli nedenlerle ekrana erişemiyor.

Bu çalışma, video podcast dinlemenin medya sınırlarını aşan reklam fırsatları yarattığına dikkat çekiyor. Bu nokta şu ölçütle vurgulanıyor: “Acast podcast’leri ve içerik oluşturucularının sosyal ağlarda 3,75 milyar takipçisi var.”

Bu kapsamlı sunumda ele alınan diğer konular şunlardır:

  • Markalar için canlı podcast yayıncılığının avantajları
  • Podcast yayıncılığında marka güveni, diğer birçok medya kategorisine göre daha yüksektir.
  • Podcast’lerde dinleyici ilgisi, müzik yayını veya radyoya kıyasla daha yoğundur.
  • Podcast’ler “aranan, sunulan değil” şeylerdir.
  • Podcast’ler “gerçekleri yansıtır” (bu, yapay zeka çağının bir değeridir).
  • Podcast’lerin dinleyici üzerindeki etkisi, tüketici davranışını etkileme söz konusu olduğunda diğer medya türlerine göre “daha etkili”dir.
  • Podcast’lerde reklam atlama diğer medya türlerine göre daha az yaygındır.
  • Bir markaya tekrar tekrar maruz kalmak markaya zarar vermez; aksine fayda sağlar.

Bu sunum dosyası, 30 saniyelik video podcast reklamları oluşturmaya dair kısa bir eğitim içeriyor.

Araştırmanın orijinaline BURADAN ulaşabilirsiniz.

Kaynak: RainNews

Okumaya devam et

Haberler

YouTube, yeni içerik oluşturma araçlarını ve alışveriş özelliklerini tanıttı

YouTube, New York’ta düzenlenen yıllık Made on YouTube etkinliğinde bir dizi yapay zeka aracı, alışveriş güncellemeleri ve kişiselleştirilmiş izleyici özelliklerini tanıttı.

Yayınlanma tarihi

=>

Alphabet’e ait YouTube, New York’ta düzenlenen yıllık Made on YouTube etkinliğinde bir dizi yapay zeka aracı, alışveriş güncellemeleri ve kişiselleştirilmiş izleyici özelliklerini tanıttı.

Bu yeni özellikler şunlardan oluşuyor:

  • Yeni içerik oluşturucu araçları arasında YouTube Studio’ya eklenen, video taslakları üzerinde geri bildirim alma, kanala uygun küçük resimler oluşturma ve üç adede kadar video kesitini test etme özellikleri yer alıyor.
  • Shorts ve YouTube Create’deki Gemini destekli asistan, klipleri düzenlemeye, duraklamaları kırpmaya ve müziği senkronize etmeye de yardımcı olacak.
  • Video platformu, içerik oluşturucuların tercihlerine uyum sağlayan, isteğe bağlı yapay zeka tabanlı yorum denetimini test ediyor. Ayrıca, benzerlik koruma araçlarında ses ve yüz tanımayı birleştirecek.
  • Şirket, yıl sonuna kadar YouTube Alışveriş ortaklık programını 35 ülkeye genişletecek ve halihazırda 1,3 milyondan fazla içerik üreticisi programa kayıtlı durumda.
  • Hindistan ve Brezilya’daki içerik üreticileri yakında Amazon ürünlerini etiketleyebilecekler; ürün etiketleri ise farklı pazarlardaki izleyicilere yerelleştirilmiş teklifler gösterecek.
  • YouTube, ABD’deki kullanıcılar için web, mobil ve TV platformlarında Özel Akışlar özelliğini sunacak. Bu özellik sayesinde kullanıcılar, belgeseller veya kendin yap videoları gibi ilgi alanlarına göre uyarlanmış ana sayfa sekmelerini kaydedebilecekler.
  • YouTube’un “YouTube’a Sor” özelliği, TV kullanıcıları için ürün karşılaştırma tabloları ve sesli komutlar da dahil olmak üzere alışveriş sorguları ve takip soruları ekleyecek.

Kaynak: Youtube Blog

Okumaya devam et

Haberler

Substack, uygulamasına podcast sekmesi ekledi

Substack, uygulamasında yeni bir podcast sekmesi başlattı. Substack’in eklediği yeni sekme, “Mevcut dinleyicilerinize kolayca ulaşabileceğiniz ve yeni dinleyicilerin sizi bulmasına yardımcı olabileceğiniz özel bir alan” sunuyor.

Yayınlanma tarihi

=>

Substack, uygulamasında yeni bir podcast sekmesi başlattı.

Substack’in eklediği yeni sekme, “Mevcut dinleyicilerinize kolayca ulaşabileceğiniz ve yeni dinleyicilerin sizi bulmasına yardımcı olabileceğiniz özel bir alan” sunuyor.

Bu sekmede, Substack içerik üreticilerinin programları listeleniyor. Şirket, Podnews’e “Substack’te podcast yayınlayan içerik üreticilerinin toplamda yılda 200 milyon doların üzerinde gelir elde ettiğini” belirtti.

İşte en popüler programların listesi.

Substack web sitesinden yapılan açıklamada ise şunlar kaydedildi:

“Substack uygulamanızda artık sevdiğiniz sesli ve yazılı içerikleri keşfetmek için iki bölüm var: Podcast Sekmesi ve Okuma Sekmesi.

Binlerce içerik üreticisi, podcast’leri için Substack’i tercih etti. Bize en büyük zorluklarının yeni dinleyicilerin çalışmalarını bulmasına yardımcı olmak olduğunu söylediler. Podcast Sekmesi tam da bunu yapmak için tasarlandı. İçerik üreticileri için Podcast Sekmesi, mevcut dinleyicilerinize kolayca ulaşabileceğiniz ve yeni dinleyicilerin sizi bulmasına yardımcı olabileceğiniz özel bir alandır.

Substack uygulaması büyüdükçe siz de büyürsünüz. Uzun metin yazımı her zaman Substack’in kalbi olacaktır. Okuma sekmesinde , okuyucular abone oldukları tüm Substack’leri okuyabilir ve yeni harika yazılar keşfedebilirler.

Podcast yayıncılarına ve yazarlara kitlelerini genişletmeleri için yeni yollar sunuyoruz ve milyonlarca insanın sevdikleri yeni podcast’leri ve yazıları keşfetmelerine yardımcı oluyoruz.”

Okumaya devam et

En son