Generalist AI’nın Yeni Robot Modülü GEN‑1.5 ile Görev Öğrenme Devrimi
Generalist AI, robotların yeni fiziksel görevleri tek bir gösterimle öğrenmesini sağlayan yeni temel modeli GEN‑1.5’i tanıttı. Şirketin paylaştığı bilgilere göre GEN‑1.5, 3 ila 12 saniyelik bir gösterimi bağlam içinde değerlendirerek herhangi bir gradyan güncellemesi veya ince ayar sürecine ihtiyaç duymadan görevi yerine getirebiliyor. 3-12 saniye arası bir gösterim, modelin bağlam penceresi içinde 30 saniyelik süreyle saniyede 100 hareket komutu üretmesini sağlıyor.
Modelin yetenekleri, sensör verileri ile hareket dizilerinden oluşan örnekleri “fiziksel istem” olarak tanımlayan bir yapı içeriyor. Video görüntülerinin yanı sıra sensör, dil ve robotun kendi konum ile hareket bilgilerini de işliyor. Sadece gösterilen hareketi tekrar etme yeteneği değil, iki bağımsız fiziksel istemi birleştirerek daha uzun bir görev dizisi oluşturabiliyor. Örneğin kalem kutusunun fermuarını açma ve içindeki parayı alma gösterimleri ayrı ayrı sunulduğunda model, iki görevi tek bir kesintisiz hareket dizisi halinde gerçekleştirebiliyor.
Deneylerde GEN‑1.5, 10 farklı kısa süreli manipülasyon görevinde tek gösterimle ortalama yüzde 59 başarı oranına ulaştı. Görev başına yaklaşık 50 gösterim içeren beş dakikalık veriyle 10 gradyan adımı boyunca uyarlandığında ise başarı oranı yüzde 83’e yükseldi. Bir dakikalık veri ve tek bir gradyan adımının kullanıldığı testte başarı oranı yüzde 66,5 olarak ölçüldü. 10 görevde %59, 50 gösterimde %83 başarı, 1 dakikada %66,5 başarı – bu rakamlar modelin gerçek dünyada hızla adapte olabileceğini gösteriyor.
GEN‑1.5’in öne çıkan yeteneklerinden biri, simülasyondan gerçek dünyaya sıfır örnekli aktarım yapabilmesidir. Modelin ön eğitiminde herhangi bir simülasyon verisi bulunmamasına rağmen, simülasyon ortamında kaydedilen bir gösterim gerçek bir robot için fiziksel istem olarak kullanılabiliyor. Aynı zamanda insanların kendi elleriyle yaptığı hareketleri robotun kameralarından izleyerek aynı görevi robot elleriyle tekrar edebiliyor. Fırçayla kaseye süpürme görevi gösterilen model, daha sonra aynı amaç için muzu geçici bir fırça olarak kullandı; faraşla karşılaştığında ise nesneyi süpürmek yerine faraşla kaldırıp kasenin içine döken farklı bir yöntem geliştirdi.
Model, beklenmedik durumlarda farklı stratejiler geliştirebildiğini de gösterdi. Örneğin, kasenin üzerini kapatan kağıdı kaldırmak, kavrama sırasında parmağına takılan Lego parçasını diğer eliyle çıkarmak gibi davranışlar sergiledi. Bu yetenekler, modelin bağlam içinde öğrenme ve doğaçlama yeteneklerinin ön eğitim sürecinde kendiliğinden ortaya çıktığını gösteriyor; ekstra hedef ya da özel eğitim yöntemi kullanılmadı.
GEN‑1.5’in ön eğitim süreci sekiz aydan uzun süredir kesintisiz devam ediyor. Şirkete göre model, fiziksel etkileşimlerden oluşan büyük ölçekli verilerle eğitildikçe yeni görevlere daha az veri ve hesaplama gücüyle uyum sağlamaya başladı. Ancak test edilen görevlerin basit ve kısa süreli, mevcut başarı oranlarının henüz sınırlı olduğuna dikkat çekiyor. Şirket, GEN‑1.5’in farklı fiziksel görevleri tek veya birkaç gösterimden öğrenebilen ilk genel robot modellerinden biri olduğunu savunuyor.
Bu yaklaşımın gelişmesiyle, aylar süren uzman programlama süreçleri yerine robota ne yapması gerektiğinin birkaç saniye boyunca gösterildiği eğitim süreçleri tercih edilebilir. Bir dakikadan kısa süreli gösterimler, robotları hızlıca yeni görevler için donatabilir; bu da endüstriyel otomasyon ve ev robotları için devrim yaratabilir. Bakalım bundan sonra bu teknoloji ile hangi alanlar daha hızlı dönüşüm geçirecek?
Kaynak: Orijinal Haber
