Bizimle iletişime geçin

Haberler

Sesame AI etkileyici sesli asistanını tanıttı

Kaliforniya merkezli start-up Sesame AI, daha gerçekçi diyaloglar oluşturmak için mikro duraklamalar, tonlama ve kahkaha gibi kasıtlı kusurları kullanan bir konuşma modeli geliştirdi.

Yayınlanma tarihi

on

Kaliforniya merkezli bir startup olan Sesame AI, konuşma çıktısına kasıtlı olarak kusurları dahil ederek sesli yapay zekaya alışılmadık bir yaklaşım getiriyor. Yeni modelleri, daha otantik diyaloglara ve yapay zeka sistemlerinde “ses varlığı” olarak adlandırdıkları şeye doğru erken bir adımı temsil ediyor.

İlk testlere göre, Sesame’ın en etkileyici özellikleri, konuşmalar sırasında mikro duraklamalar, vurgu değişimleri ve kahkahalar gibi ince unsurlar. Bir etkileşimde, Sesame’in avatarı Maya, bir kullanıcının ani kıkırdamasına gerçek zamanlı olarak yanıt vererek duygusal farkındalık gösterdi.

Sistem, cümle ortasında kendi kendini düzeltme, kesintiler için özür dileme ve dolgu sözcükleri gibi insan benzeri davranışları kasıtlı olarak içeriyor. Techradar bu kasıtlı kusurları özellikle övdü ve ChatGPT veya Gemini’nin cilalı kurumsal tonundan ne kadar farklı olduklarına dikkat çekti.

İş stresi veya parti planlaması hakkındaki tartışmalar gibi simüle edilmiş senaryolarda, sistem genel ifadelere geri dönmek yerine bağlama uygun yanıtlar ve sorular sağladı.

Sesame AI semantik ve akustik belirteçleri kullanıyor

Henüz resmi bir makale yayınlanmamış olsa da, Sesame’in blog yazısı mimarileri hakkında fikir veriyor. CSM, temel işleme için bir omurga transformatörünü (1-8 milyar parametre) ses üretimi için daha küçük bir kod çözücü (100-300 milyon parametre) ile birleştiren iki parçalı bir transformatör yapısı kullanıyor.

Sistem, perde ve vurgu gibi ses özellikleri için akustik belirteçlerin yanı sıra dilsel özellikler ve fonetik için semantik belirteçler kullanarak konuşmayı işliyor. Eğitimi optimize etmek için, ses kod çözücü ses karelerinin yalnızca on altıda biri üzerinde eğitilirken, anlamsal işleme tüm veri kümesini kullanıyor.

Model, beş dönem boyunca bir milyon saatlik İngilizce ses verisi üzerinde eğitildi. Uçtan uca bir mimaride 2.048 jetona kadar (yaklaşık iki dakikalık ses) dizileri işleyebiliyor. Bu yaklaşım, metin ve sesi entegre bir şekilde işlemesiyle geleneksel metinden sese sistemlerinden ayrılıyor.

Blog yazısında doğrudan belirtilmese de demo ses, Google’ın açık kaynaklı LLM Gemma’sının 27 milyar parametreli bir versiyonunu kullandığını ortaya koyuyor.

Testler insana yakın performans ortaya koyuyor

Sesame ile yapılan kör testlerde, katılımcılar kısa konuşma parçacıkları sırasında CSM ile gerçek insanlar arasında ayrım yapamadı. Bununla birlikte, daha uzun diyaloglar, zaman zaman doğal olmayan duraklamalar ve ses artefaktları gibi sınırlamaları ortaya çıkardı.

Sesame, model performansını ölçmek için özel fonetik kıyaslamalar geliştirdi. Dinleme testlerinde, katılımcılar üretilen konuşmayı bağlam olmadan duyduklarında gerçek kayıtlara eşdeğer olarak değerlendirdiler, ancak bağlam sağlandığında orijinali tercih etmeye devam ettiler.

Deneklerin yapay zeka tarafından üretilen konuşma tercihi neredeyse insani seviyelere ulaşıyor. | Resim: Sesame AI

Gelecekteki gelişmeler ve açık kaynak planları

Sesame, araştırmalarının temel bileşenlerini Apache 2.0 lisansı altında açık kaynak olarak yayınlamayı planlıyor. Önümüzdeki aylarda, hem model boyutunu hem de eğitim kapsamını büyütmeyi ve 20’den fazla dile genişletmeyi planlıyorlar.

Şirket özellikle önceden eğitilmiş dil modellerini entegre etmeye ve konuşmacı geçişleri, duraklamalar ve hızlanma gibi konuşma dinamiklerini doğrudan verilerden öğrenebilen tam çift yönlü yetenekli sistemler geliştirmeye odaklanıyor. Bu gelişme, veri küratörlüğünden eğitim sonrası yöntemlere kadar işleme hattı boyunca temel değişiklikler gerektirecek.

Geliştiriciler, “Sesli varlığa sahip dijital bir yol arkadaşı oluşturmak kolay değil, ancak kişilik, hafıza, ifade ve uygunluk dahil olmak üzere birçok cephede istikrarlı bir ilerleme kaydediyoruz” diyor.

Eski Oculus CTO’su Brendan Iribe ve ekibi tarafından kurulan Sesame AI, Andreessen Horowitz liderliğinde önemli bir A Serisi fon sağladı. Bir demo mevcut.

Doğal yapay zeka seslerinin asistanların benimsenmesi üzerindeki etkisi, ChatGPT’nin Gelişmiş Ses Modu etrafındaki heyecanla kanıtlandı. LLM’ler tarafından desteklenen sesli asistanların, Amazon’un Alexa+’ı piyasaya sürmesinin de gösterdiği gibi, giderek daha yaygın hale gelmesi muhtemel.

Kaynak: The Decoder

Okumaya devam et
Yorum yapmak için tıklayın

Yanıt Ver

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Araştırma

Podcast yayıncılığındaki “format savaşı” sona mı eriyor?

Yayınlanma tarihi

=>

Acast, Podcast Pulse raporunun 2026 edisyonunu yayınladı. Başlıca bulgu şu:

“Format tartışması sona erdi. İzleyiciler umursamayarak tartışmayı bitirdiler.”

Kaygısız, evet, ve verilerle destekleniyor. Acast CEO’su Greg Glenday: “Podcast sektörü formatlara ve platformlara takıntılı […] Dinleyiciler böyle düşünmüyor.”

Aşağıda, 49 sayfalık bu basın bülteninin giriş bölümünde yer alan önemli bir ölçüt bulunuyor:

Podcast tüketicileri hakkında iki önemli bulguyu hızla öğreniyoruz:

  • “On kişiden dokuzu, en sevdikleri podcast yayıncılarını podcast’in kendisinin ötesinde bir yerlerde takip ediyor […] Podcast yayıncılığı akışkan bir yapıya sahip. Platformlar ve formatlar sadece birer kap görevi görüyor.”
  • Sesli/görüntülü içerik tüketici grubu her yıl hızla artıyor; ankete katılan tüketicilerin %88’i artık hem sesli hem de görüntülü podcast dinliyor, bu da geçen yılki ankete göre %78’lik büyük bir artış anlamına geliyor.

Genel olarak podcast tüketiminin, hem dinleme hem de izleme açısından artacağı tahmin ediliyor:

  • — %49’u podcast’leri daha sık dinlemeyi bekliyor.
  • — %48’i podcast’leri daha sık dinlemeyi bekliyor.

(Şunu da aklınızda bulundurmanızda fayda var: “YouTube’da podcast izlemek” ifadesi , aynı kolaylıkla (ve belki de aynı sıklıkla) YouTube’da podcast dinlemek anlamına da gelebilir.)

İlginç bir şekilde, bu araştırma, tek bir podcast’i dinlerken platformlar arasında geçiş yapan dinleyicileri test etti; katılımcıların %63’ü bunu yaptığını, %75’inin ise bunu yapmak için uygulama veya platform değiştirmek zorunda kaldığını belirtti.

Günün saati de burada önemli bir rol oynuyor: “Ses kayıtları sabah saatlerine, videolar ise gece saatlerine hakim. ‘Öğle arası videoları’ ise öğle saatlerine hakim,” diye öğreniyoruz ki bu da mantıklı.

Ekran olmadan dinleme kısmen bir tercih… ve aynı zamanda bir zorunluluk. Bu şekilde dinleyen katılımcıların %50’si ekranı istemiyor ve %50’si de çeşitli nedenlerle ekrana erişemiyor.

Bu çalışma, video podcast dinlemenin medya sınırlarını aşan reklam fırsatları yarattığına dikkat çekiyor. Bu nokta şu ölçütle vurgulanıyor: “Acast podcast’leri ve içerik oluşturucularının sosyal ağlarda 3,75 milyar takipçisi var.”

Bu kapsamlı sunumda ele alınan diğer konular şunlardır:

  • Markalar için canlı podcast yayıncılığının avantajları
  • Podcast yayıncılığında marka güveni, diğer birçok medya kategorisine göre daha yüksektir.
  • Podcast’lerde dinleyici ilgisi, müzik yayını veya radyoya kıyasla daha yoğundur.
  • Podcast’ler “aranan, sunulan değil” şeylerdir.
  • Podcast’ler “gerçekleri yansıtır” (bu, yapay zeka çağının bir değeridir).
  • Podcast’lerin dinleyici üzerindeki etkisi, tüketici davranışını etkileme söz konusu olduğunda diğer medya türlerine göre “daha etkili”dir.
  • Podcast’lerde reklam atlama diğer medya türlerine göre daha az yaygındır.
  • Bir markaya tekrar tekrar maruz kalmak markaya zarar vermez; aksine fayda sağlar.

Bu sunum dosyası, 30 saniyelik video podcast reklamları oluşturmaya dair kısa bir eğitim içeriyor.

Araştırmanın orijinaline BURADAN ulaşabilirsiniz.

Kaynak: RainNews

Okumaya devam et

Haberler

YouTube, yeni içerik oluşturma araçlarını ve alışveriş özelliklerini tanıttı

YouTube, New York’ta düzenlenen yıllık Made on YouTube etkinliğinde bir dizi yapay zeka aracı, alışveriş güncellemeleri ve kişiselleştirilmiş izleyici özelliklerini tanıttı.

Yayınlanma tarihi

=>

Alphabet’e ait YouTube, New York’ta düzenlenen yıllık Made on YouTube etkinliğinde bir dizi yapay zeka aracı, alışveriş güncellemeleri ve kişiselleştirilmiş izleyici özelliklerini tanıttı.

Bu yeni özellikler şunlardan oluşuyor:

  • Yeni içerik oluşturucu araçları arasında YouTube Studio’ya eklenen, video taslakları üzerinde geri bildirim alma, kanala uygun küçük resimler oluşturma ve üç adede kadar video kesitini test etme özellikleri yer alıyor.
  • Shorts ve YouTube Create’deki Gemini destekli asistan, klipleri düzenlemeye, duraklamaları kırpmaya ve müziği senkronize etmeye de yardımcı olacak.
  • Video platformu, içerik oluşturucuların tercihlerine uyum sağlayan, isteğe bağlı yapay zeka tabanlı yorum denetimini test ediyor. Ayrıca, benzerlik koruma araçlarında ses ve yüz tanımayı birleştirecek.
  • Şirket, yıl sonuna kadar YouTube Alışveriş ortaklık programını 35 ülkeye genişletecek ve halihazırda 1,3 milyondan fazla içerik üreticisi programa kayıtlı durumda.
  • Hindistan ve Brezilya’daki içerik üreticileri yakında Amazon ürünlerini etiketleyebilecekler; ürün etiketleri ise farklı pazarlardaki izleyicilere yerelleştirilmiş teklifler gösterecek.
  • YouTube, ABD’deki kullanıcılar için web, mobil ve TV platformlarında Özel Akışlar özelliğini sunacak. Bu özellik sayesinde kullanıcılar, belgeseller veya kendin yap videoları gibi ilgi alanlarına göre uyarlanmış ana sayfa sekmelerini kaydedebilecekler.
  • YouTube’un “YouTube’a Sor” özelliği, TV kullanıcıları için ürün karşılaştırma tabloları ve sesli komutlar da dahil olmak üzere alışveriş sorguları ve takip soruları ekleyecek.

Kaynak: Youtube Blog

Okumaya devam et

Haberler

Substack, uygulamasına podcast sekmesi ekledi

Substack, uygulamasında yeni bir podcast sekmesi başlattı. Substack’in eklediği yeni sekme, “Mevcut dinleyicilerinize kolayca ulaşabileceğiniz ve yeni dinleyicilerin sizi bulmasına yardımcı olabileceğiniz özel bir alan” sunuyor.

Yayınlanma tarihi

=>

Substack, uygulamasında yeni bir podcast sekmesi başlattı.

Substack’in eklediği yeni sekme, “Mevcut dinleyicilerinize kolayca ulaşabileceğiniz ve yeni dinleyicilerin sizi bulmasına yardımcı olabileceğiniz özel bir alan” sunuyor.

Bu sekmede, Substack içerik üreticilerinin programları listeleniyor. Şirket, Podnews’e “Substack’te podcast yayınlayan içerik üreticilerinin toplamda yılda 200 milyon doların üzerinde gelir elde ettiğini” belirtti.

İşte en popüler programların listesi.

Substack web sitesinden yapılan açıklamada ise şunlar kaydedildi:

“Substack uygulamanızda artık sevdiğiniz sesli ve yazılı içerikleri keşfetmek için iki bölüm var: Podcast Sekmesi ve Okuma Sekmesi.

Binlerce içerik üreticisi, podcast’leri için Substack’i tercih etti. Bize en büyük zorluklarının yeni dinleyicilerin çalışmalarını bulmasına yardımcı olmak olduğunu söylediler. Podcast Sekmesi tam da bunu yapmak için tasarlandı. İçerik üreticileri için Podcast Sekmesi, mevcut dinleyicilerinize kolayca ulaşabileceğiniz ve yeni dinleyicilerin sizi bulmasına yardımcı olabileceğiniz özel bir alandır.

Substack uygulaması büyüdükçe siz de büyürsünüz. Uzun metin yazımı her zaman Substack’in kalbi olacaktır. Okuma sekmesinde , okuyucular abone oldukları tüm Substack’leri okuyabilir ve yeni harika yazılar keşfedebilirler.

Podcast yayıncılarına ve yazarlara kitlelerini genişletmeleri için yeni yollar sunuyoruz ve milyonlarca insanın sevdikleri yeni podcast’leri ve yazıları keşfetmelerine yardımcı oluyoruz.”

Okumaya devam et

En son