תוצאות נוספות...

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors
× Send

הרובוט של גוגל דיפמיינד לומד לזהות מתי המשימה השתבשה

גוגל דיפמיינד מציגה את Gemini Robotics ER 2
תוכן עניינים

החלק הקשה ברובוטיקה מתחיל בדיוק ברגע שבו ההוראה נראית פשוטה. “תביא לי שקית פופקורן” נשמע כמו משפט שילד מבין מיד, אבל עבור רובוט זו שרשרת ארוכה של החלטות. הוא צריך להבין איפה הוא נמצא, איפה החפץ, איך להגיע אליו, האם הזרוע שלו יכולה לאחוז בו, אם הפעולה הצליחה, ומה לעשות אם משהו השתבש בדרך. גוגל דיפמיינד (Google DeepMind) מציגה עכשיו את Gemini Robotics ER 2, מודל חדש שנועד לשמש שכבת חשיבה גבוהה לרובוטים. החברה מתארת אותו כמודל “embodied reasoning”, כלומר מודל חשיבה שמחובר לעולם הפיזי ולא רק לטקסט או לתמונה. הוא אמור להבין וידאו, קול, תמונה וטקסט, לתכנן משימות רב-שלביות, ולתאם בין מודלים או מערכות נמוכות יותר שאחראים על התנועה עצמה. ההכרזה כאן לא מדברת על רובוט ביתי חדש שאפשר לקנות מחר בבוקר. Gemini Robotics ER 2 זמין כיום למפתחים דרך Gemini API, כלומר ממשק שמאפשר למערכות לעבוד עם המודל, דרך Google AI Studio, ובתצוגה מקדימה פרטית דרך Gemini Enterprise Agent Platform. זו בעיקר הכרזה תשתיתית למפתחים, חברות רובוטיקה וארגונים שמנסים לבנות מערכות פיזיות חכמות יותר.

 

הישארו מעודכנים

רוצים לקבל עדכונים בלייב? רוצים מקום בו אתם יכולים להתייעץ עם מומחי AI, לשאול שאלות ולקבל תשובות? רוצים לשמוע על מבצעים והטבות לכלי ה-AI שמשנים את העולם? הצטרפו לקהילות ה-AI שלנו.

אפשר גם להרשם לניוזלטר שלנו

שכבת החשיבה יושבת מעל הגוף של הרובוט

הנקודה המרכזית במודל היא ההפרדה בין תכנון לבין ביצוע. Gemini Robotics ER 2 לא בהכרח מזיז בעצמו את הזרוע או הגלגלים. הוא מקבל את תמונת המצב, מבין מה צריך לקרות, בוחר את הצעד הבא, ואז מעביר את הביצוע למערכות אחרות. אחת מהן יכולה להיות VLA, קיצור של vision-language-action, כלומר מודל שמחבר ראייה, שפה ופעולה ומתרגם הוראות לתנועה פיזית.

 

גוגל קוראת לזה תזמור (Orchestration). המודל אמור להפעיל כלים שונים, למשל ממשק ניווט, מודל תנועה או אפילו חיפוש מידע, ולנהל את הרצף ביניהם. במקרה של רובוט, תזמור כזה חשוב במיוחד כי הפעולה לא מתרחשת במסמך או בצ’אט. היא מתרחשת במרחב שיש בו חפצים, אנשים, תאורה משתנה, תקלות וטעויות מכניות.

 

גוגל מציגה שיפור בשיעור ההצלחה של Gemini Robotics ER 2 בשלושה מצבי שליטה ברובוטים

שיפור בשיעור ההצלחה של ER 2 בשלושה מצבי שליטה ברובוטים | Google

 

לפי גוגל, ER 2 משיג תוצאות טובות יותר מ-ER 1.6 בשליטה ב-VLA אמיתי, ב-VLA בסימולציה ובתרחיש שבו אדם מפעיל רובוט מרחוק. גוגל מדגישה גם את עניין המהירות. בעולם פיזי, מודל שלא מגיב בזמן עלול להחמיץ את הרגע הנכון. לכן ER 2 משתלב ב-Gemini Live API, חיבור דו-כיווני בזמן אמת שנועד למשימות רגישות להשהיה. הרעיון הוא שהרובוט יוכל להמשיך לפעול בזמן שהמודל כבר מתכנן את הצעד הבא, בלי עצירות ארוכות שבהן המערכת “חושבת” ואז חוזרת לפעולה.

 

 

לדעת אם המשימה באמת מתקדמת

אחד החידושים החשובים בהכרזה קשור לדבר שנשמע כמעט מובן מאליו. רובוט צריך לדעת אם המשימה שהוא מבצע באמת מתקדמת. אם הוא מחבר נורה, קושר שקית אשפה או מוזג נוזל לכוס, לא מספיק שהוא יבצע תנועה דומה לפעולה הנכונה. הוא צריך להבין אם הפעולה הושלמה, אם היא נתקעה באמצע, ואם צריך לנסות שוב.

 

גוגל מתארת שתי יכולות בסיסיות בתחום הזה. הראשונה היא סיווג התקדמות, כלומר הערכה של השלב שבו נמצאת המשימה מתוך וידאו רציף. בבדיקה שערכה החברה, המודל נדרש לצפות בווידאו ולהעריך באיזה שלב נמצאת המשימה. במקום לקבוע אחוז מדויק, כל רגע בווידאו שוייך לאחת מחמש דרגות התקדמות, מהתחלה מוקדמת של המשימה ועד לשלב שבו היא כמעט הושלמה.

 

במבחן סיווג התקדמות, Gemini Robotics ER 2 הגיע לדיוק של 57.4%

במבחן סיווג התקדמות, ER 2 הגיע לדיוק של 57.4% | Google

 

57.4 אחוז הם לא מספר שמאפשר להכריז שהבעיה נפתרה. אבל זה כן מצביע על כיוון משמעותי, רובוטים שיכולים לעקוב אחרי התקדמות בזמן אמת ולתקן צעד שנכשל בלי להתחיל את כל המשימה מהתחלה. עבור עבודה במחסן, מעבדה או קו ייצור, היכולת לזהות תקלה באמצע התהליך יכולה להיות חשובה לא פחות מהיכולת לבצע את הפעולה עצמה.

 

היכולת השנייה היא moment finding, כלומר זיהוי הרגע המדויק שבו אירוע חשוב התרחש בווידאו. דוגמה פשוטה היא הרגע שבו צריך להפסיק למזוג קפה לכוס. עצירה מוקדמת מדי לא משלימה את המשימה. עצירה מאוחרת מדי תגרום לכוס להתמלא מעבר לכמות הרצויה, ואולי גם להישפך.

הגרף בוחן גם דיוק בזיהוי האירוע וגם את המרחק הממוצע מהרגע הנכון

הגרף בוחן גם דיוק בזיהוי האירוע וגם את המרחק הממוצע מהרגע הנכון | Google

 

כאן הערך המעשי ברור יותר. רובוט שפועל בעולם אמיתי צריך לזהות לא רק מה קורה, אלא מתי בדיוק לעבור לשלב הבא. גוגל מדווחת כי ER 2 מגיע במבחן הזה לדיוק של 91.3 אחוז ולסטייה ממוצעת של 0.96 שניות. אלה נתונים חזקים יותר ממבחן סיווג ההתקדמות.

רובוט אחד לא מתאים לכל משימה

חלק נוסף בהכרזה עוסק בשיתוף פעולה בין כמה רובוטים. גוגל מסבירה שרובוט גלגלי יכול להתאים היטב לתנועה בתוך מבנה, בזמן שרובוט דמוי אדם עשוי להתאים טוב יותר לשטח לא אחיד או למשימות שמצריכות מבנה גוף אחר. לכן המטרה אינה רק לשפר רובוט יחיד, אלא לאפשר לכמה רובוטים להבין משימה משותפת ולהעביר אחריות ביניהם.

 

בהדגמות שמוזכרות בהכרזה מופיעים Spot של Boston Dynamics וכן שיתוף פעולה בין Apollo 2 של Apptronik לבין Franka F3 Duo. אלה דוגמאות חשובות משום שהן מראות לאן גוגל מכוונת את הטכנולוגיה, לעולם שבו מודל אחד מתאם בין מכונות שונות.

התמונה הרחבה של המדדים

מעבר למשימות ספציפיות, גוגל מציגה שיפור בכמה מדדים רחבים יותר של הבנה מרחבית. אלה כוללים זיהוי הצלחה או כישלון מתוך תמונה ווידאו, מענה על שאלות חזותיות על הסביבה, וקריאת מכשירים. קריאת מכשירים היא יכולת שנשמעת צרה, אבל יכולה להיות חשובה מאוד בעולם פיזי, למשל כאשר רובוט צריך לקרוא צג דיגיטלי, סרגל, מד נוזלים או מד חום.

 

המדדים הרחבים מציגים יתרון ל-Gemini Robotics ER 2 בזיהוי הצלחה, מענה חזותי וקריאת מכשירים

יתרון ל- ER 2 בזיהוי הצלחה, מענה חזותי וקריאת מכשירים | Google

 

הגרף הזה מראה שגוגל לא מדברת רק על פעולה אחת כמו מזיגה או אחיזה, אלא על סט יכולות שמאפשר לרובוט להבין סביבת עבודה. חשוב להבהיר שהמדדים האלה לא שקולים ל”רובוט שמבין את העולם כמו אדם”. הם בודקים משימות מוגדרות, בתנאים שגוגל בחרה, ולכן הם רלוונטיים בעיקר כמדד להתקדמות יחסית.

בטיחות היא לא הערת שוליים

החלק הרגיש ביותר בהכרזה הוא הבטיחות. רובוט שמקבל יכולת תכנון טובה יותר גם מקבל פוטנציאל גדול יותר לטעות בעולם פיזי. טעות בצ’אט יכולה להיות תשובה לא נכונה. טעות של רובוט יכולה להפיל חפץ, לחסום מעבר, לפגוע בציוד או להתקרב לאדם בזמן הלא נכון.

 

גוגל מציגה את Gemini Robotics ER 2 כמודל הרובוטיקה הבטוח ביותר שלה עד כה. החברה מדווחת על שיפור בשני מדדים, ציות להוראות בטיחות וזיהוי קרבת אדם. בהדגמה שהיא מתארת, המודל מצליח לעצור רובוט דמוי אדם כאשר אדם נמצא קרוב מדי, ולחדש את העבודה רק כשהאזור מתפנה.

 

מדדי הבטיחות של גוגל מציגים שיפור בציות להוראות ובזיהוי קרבת אדם

מדדי הבטיחות של גוגל מציגים שיפור בציות להוראות ובזיהוי קרבת אדם | Google

 

ככל שרובוטים מקבלים יכולת לתכנן, להפעיל כלים ולתקן את עצמם, כך עולה החשיבות של מגבלות ברורות, ניטור סביבתי, בקשת הבהרה מאדם, ועצירה כאשר המערכת לא בטוחה בפעולה הבאה.

ההבטחה מרשימה, המבחן יהיה מחוץ לדמו

Gemini Robotics ER 2 הוא צעד משמעותי בניסיון לחבר בין מודלים מולטימודליים, כלומר מודלים שמבינים כמה סוגי קלט כמו טקסט, וידאו וקול, לבין רובוטים שפועלים בעולם האמיתי. החידוש המרכזי הוא לא רק הבנה טובה יותר של תמונה, אלא ניהול משימה לאורך זמן. לראות מה קורה, להעריך התקדמות, לזהות את הרגע הנכון, להפעיל כלי מתאים, ולעבור לשלב הבא.

 

הדרך מכאן לרובוטים מועילים בסביבה יומיומית עדיין ארוכה. השאלות החשובות הן איך המודל מתפקד מחוץ לתנאי בדיקה, כמה מהר הוא מגיב במצבים לא צפויים, כמה עולה להריץ אותו על וידאו רציף, ואילו שכבות בטיחות יידרשו סביבו לפני שמפקידים בידיו משימות רגישות.

 

עבור גוגל, זו הכרזה שממקמת את Gemini כשכבת תיאום לעולם הרובוטיקה. עבור התעשייה, זו תזכורת לכך שהקרב סביב AI מתקדם בהדרגה מהמסך אל המרחב הפיזי.

הישארו מעודכנים

רוצים לקבל עדכונים בלייב? רוצים מקום בו אתם יכולים להתייעץ עם מומחי AI, לשאול שאלות ולקבל תשובות? רוצים לשמוע על מבצעים והטבות לכלי ה-AI שמשנים את העולם? הצטרפו לקהילות ה-AI שלנו.

אפשר גם להרשם לניוזלטר שלנו

רוצים הרצאה או ייעוץ של רון גולד?
השאירו פרטים ונשמח לחזור אליכם עם המידע הרלוונטי
אולי יעניין אותך גם...

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

Let's update

רוצים לקבל עדכונים על כל מה שחדש ומעניין בעולם ה-AI? הרשמו לניוזלטר שלנו!

רוצים לראות יותר תכנים שלנו?

סמנו אותנו כמקור מועדף בגוגל וקבלו יותר כתבות, עדכונים ותובנות AI ישירות בתוצאות החיפוש!

הסבר קצר איך מוסיפים:

  • לוחצים על הכפתור "הוספה כמקור מועדף".
  • מסמנים את התיבה ליד Let’s AI.
  • סוגרים את החלון.
אירועי AI קרובים

תפריט נגישות

תוצאות נוספות...

Generic selectors
Exact matches only
Search in title
Search in content
Post Type Selectors