MAX AI
מאמר · ניתוח

GPT-6 אסטרה: זה AGI? מה באמת השתפר, ומה זה שווה לעסק

אסטרה לא מחייב להחליף מחר את כל הכלים, אבל כן מצדיק בדיקה אם יש בעסק משימות שחוזרות ועוברות בין מערכות. מה השתפר, מה המדדים עדיין לא מוכיחים, ואיך בודקים אם זה מועיל דווקא לכם.

11 דקות קריאהעודכן רמה: מתחילים
מקסים גומברג

מקסים גומברג

מלמד ומטמיע AI בארגונים · כותב ממערכת שרצה אצלי

התשובה הקצרה

אסטרה לא מחייב אתכם להחליף מחר את כל הכלים. הוא כן מצדיק בדיקה אם יש בעסק משימות שחוזרות, עוברות בין מערכות ודורשות הרבה עבודה ידנית: שם השיפור מורגש, בהפעלת מחשב ותוכנות. במדדים המשוקללים של אינטליגנציה כללית הציון דומה לדור הקודם, והמחיר לטוקן גבוה פי שניים וחצי.

  1. בודקים בבורר המודלים ב-ChatGPT אם אסטרה כבר הגיע אליכם
  2. מריצים עליו משימה רב-שלבית אחת, לא שאלת ידע
  3. משווים לתוצאה שקיבלתם על אותה משימה מהמודל הקודם

בדיקה בלי לשנות כלום בעסק. מנוי קיים מספיק

זו התוצאה

אותו מודל, אותו מבחן, שתי סביבות עבודה.

גרף שמשווה את ציון אסטרה במבחן ARC-AGI-3: 62.7 אחוז בתשתית הרצה סטנדרטית מול 99.9 אחוז בתשתית ייעודית של אופן איי אי

שני הציונים של אסטרה באותו מבחן, ARC-AGI-3, לפי ARC Prize, מי שמריץ אותו: 62.7% בתשתית הסטנדרטית ברמת מאמץ מרבית, 99.9% בתשתית ייעודית ברמת מאמץ גבוהה. גם ARC Prize רואים בזה התקדמות משמעותית, ולא הוכחה ל-AGI.

שוחרר
3 בספטמבר 2026
מה קפץ
הפעלת מחשב ודפדפן
מחיר ב-API
10$ / 50$ למיליון
לטוקן, פי 2.5 מקודמו
זמין ב
Plus · Pro · Business
ציון משוקלל במדד AA
דומה לדור הקודם

איפה השיפור מורגש, ואיפה עדיין לא

השיפור הגדול הוא ביכולת לבצע, לא בשאלות ותשובות. בשיחה רגילה תרגישו הבדל קטן. במשימה שנוגעת בכמה תוכנות ורצה עד הסוף, שם זה מורגש.

במבחן OSWorld 2.0, שמודד הפעלת מחשב, אסטרה השלים 72.6% מהמשימות לעומת 65.7% אצל GPT-5.6 Sol, וזמן הביצוע הממוצע במסגרת המבחן ירד מכ-75 דקות לכ-40, כלומר בכ-47%. אלה זמנים שנמדדו בסביבת המבחן, לא תחזית לזמן העבודה אצלכם.

מה שהוא עושה בפועל, לפי אופן איי אי:

  • פותח דפדפן, מנווט באתרים וממלא טפסים
  • מעדכן רשומות במערכת ניהול לקוחות ומסדר יומן
  • עובד בתוך גיליונות אלקטרוניים ובונה מצגות לפי תבנית קיימת
  • מפעיל תוכנות שולחניות, כולל תוכנה פנימית ישנה שאין לה חיבור מסודר
  • מריץ מחקר ברשת וכותב את התוצאה למסמך או למייל

וכך זה נראה. שלוש הדגמות רשמיות של אופן איי אי, קצרות, ולא באותו משקל: הראשונה היא עבודה משרדית שכל עסק מכיר, השנייה בדיקת אתר בזמן אמת, והשלישית הרחבה לתוכנה הנדסית. תוך כדי צפייה שימו לב לשאלה אחת: איזה מידע הוא מעביר בין המערכות, ואיפה עדיין נדרשת בדיקה אנושית? דמו נבחר הוא לא תחזית לביצועים אצלכם.

ההדגמה הכי קרובה לעבודה משרדית רגילה: המודל קורא מסמך, מבין מה רלוונטי, ומקליד את זה לטופס באתר אחר. זה בדיוק סוג המשימה שהיום עוברת דרך בן אדם.

ההקלטה הזאת אינה מואצת, לפי הכיתוב של אופן איי אי. זה הקצב שבו הוא עבד במשימה הזאת. שימו לב להבדל בין אורך הסרטון לזמן המשימה בהדגמות אחרות, שמקוצרות.

הדגמה בתוכנה מקצועית שאין לה חיבור מסודר לשום דבר. זה מה שמסביר את הטענה ״כל תוכנה״: הוא לא צריך שמישהו יבנה לו גשר מראש.

ההבדל הטכני שמאפשר את זה: המודל קורא פיקסלים ומזיז עכבר, כמו אדם. הוא לא צריך שמישהו יבנה מראש חיבור תכנותי לכל תוכנה. זו בדיוק הסיבה שזה רלוונטי לעסק קטן, שבו לרוב יושבת מערכת אחת ישנה שכולם מתלוננים עליה ואף אחד לא מחליף.


20 שניות מול 13 דקות

הדוגמה הכי מלמדת מההשקה היא לא מדד. היא שאלה.

בהדגמה של אופן איי אי נתנו לשני המודלים את אותה משימה: לבנות אתר קריירה. הדגם הקודם התחיל לעבוד מיד ובנה 13 דקות. אסטרה עצר אחרי 20 שניות ושאל לאיזו קריירה המשתמש עובר.

השוואה בין שני המודלים על אותה בקשה לבנות אתר קריירה: הדגם הקודם עבד 13 דקות ו-15 שניות, אסטרה עצר אחרי 20 שניות ושאל שאלה
בניתי מחדש בעברית את ההשוואה שאופן איי אי פרסמה בהדגמה הרשמית. אותה בקשה בדיוק, שני מודלים, שתי גישות.

מודל שעוצר לשאול שאלה נראה פחות מרשים בהדגמה, ושווה הרבה יותר בעבודה אמיתית. 13 דקות של עבודה על ההנחה הלא נכונה הן 13 דקות שצריך לזרוק. ועדיין: עצם השאלה אינה הצלחה. השאלה צריכה להיות הנכונה, וההנחות שהוא מציג צריכות להיות גלויות.

זה גם מה שמשתמשים מדווחים עליו בפועל: המודל מכבד גבולות של משימה ונשאר בתוכה, במקום להרחיב אותה לבד. מנגד, יש גם תלונה הפוכה: הוא עדיין דורש הנחיה מפורשת, ולא מסיק כוונה מרמז.

שתי המסקנות האלה לא סותרות. הניסוח, הכלים, ההקשר והבדיקה שלכם משפיעים על התוצאה לא פחות מהמודל, וזה החלק שבשליטתכם.


מה המדדים מוכיחים, ומה לא

גרג ברוקמן, נשיא אופן איי אי, אמר על אסטרה שלדעתו הגענו לעידן ה-AGI. זו הכותרת שרצה בכל העולם. המדדים מספרים סיפור מורכב יותר.

בציון המשוקלל של Artificial Analysis, גוף מדידה עצמאי, אסטרה דומה לדור הקודם: 61 מול 61. ציון משוקלל יכול להישאר במקום כשחלק מהיכולות משתפרות ואחרות נסוגות, וזה בדיוק מה שהניתוח שלהם מתאר. באותו מדד Claude Fable 5.1 מקבל 66.

לכן השאלה הנכונה היא לא ״האם הוא חכם יותר״ אלא ״באילו משימות הוא טוב יותר, ובאילו לא״:

ציון משוקלל (AA)
אסטרה 61 · GPT-5.6 Sol 61 · Claude Fable 5.1 66
סוכני קוד (AA)
אסטרה 67 · Claude Fable 5.1 70
מבחן עם כלים (HLE)
אסטרה 57.2% · Claude Fable 5.1 65.0%
מתמטיקה (FrontierMath)
אסטרה 97.6% · Claude Fable 5.1 87.8%
הפעלת מחשב (OSWorld 2.0)
אסטרה 72.6% · GPT-5.6 Sol 65.7%
מחיר למיליון טוקני פלט
אסטרה 50$ · GPT-5.6 Sol 20$

מקורות: ציונים משוקללים, קוד ו-HLE ממדידת Artificial Analysis (צילום מצב 4.9.2026); OSWorld ו-FrontierMath לפי הודעת אופן איי אי; מחיר לפי דף המחירים.

הקריאה הנכונה של הטבלה הזאת: אסטרה מוביל במתמטיקה, בסייבר ובהפעלת מחשב. בקוד סוכני ובמבחן עם כלים Claude Fable 5.1 מקדים אותו. והמחיר לטוקן גבוה פי שניים וחצי מקודמו, אבל מחיר לטוקן ועלות להשלמת משימה הם לא אותו דבר: לפי אותה מדידה, בקוד סוכני אסטרה השיג ציון דומה ל-Claude Fable 5 בפחות ממחצית העלות למשימה, ובמדד המשוקלל העלות למשימה דווקא עלתה לעומת קודמו.

מה כן השתפר בשקט: ההזיות. במבחן AA-Omniscience של Artificial Analysis מודדים מה קורה כשהמודל נשאל משהו שהוא לא יודע: האם הוא מודה, או ממציא תשובה בביטחון. אצל אסטרה, במאמץ מרבי, שיעור ההמצאות מתוך המקרים האלה ירד מ-92% ל-51%. זה לא אומר שמחצית התשובות שלו שגויות; זה אומר שכשהוא לא יודע, הוא עדיין ממציא בכמחצית מהמקרים, לעומת כמעט תמיד קודם.


הפער בין 99.9 ל-62.7

המספר שרץ בכל הכותרות מגיע מתשתית הרצה ייעודית, וגם מרמת מאמץ אחרת. אותו מודל, אותו מבחן, שתי סביבות עבודה, שתי תוצאות.

במבחן ARC-AGI-3, מבחן שנועד למדוד התמודדות עם בעיות חדשות לגמרי, אסטרה קיבל 99.9%. זה המספר שצוטט. הגוף שמריץ את המבחן, ARC Prize, פרסם גם את המספר השני:

תשתית סטנדרטית, מאמץ מרבי
62.7% · ~$26,000
תשתית ייעודית, מאמץ גבוה
99.9% · ~$19,000
Claude Opus 5, תשתית סטנדרטית
30.2%
GPT-5.6 Sol, תשתית סטנדרטית
7.8%

התשתית הייעודית שומרת את מצב החשיבה בין קריאה לקריאה, כך שהמודל ממשיך מאיפה שהפסיק, ושתי ההרצות נמדדו גם ברמות מאמץ שונות. ARC Prize כתבו שמה שנמדד הוא הביצועים המשולבים של המודל ושל הכלים שלו, ובאותו מסמך: ״אסטרה מייצג התקדמות משמעותית לעבר הכללה, ואנחנו לא טוענים שזה AGI״.

זה הלקח הכי שימושי במאמר הזה, וגם הכי קשור לעבודה שלכם. אותו מודל, פער של 37 נקודות, והרבה מזה הוא סביבת העבודה: איך המשימה מוגשת, מה נשמר בין צעד לצעד, אילו כלים זמינים. זו לא סיבה לזלזל בתוצאה הגבוהה; זו סיבה להשקיע בסביבה שבה אתם מריצים אותו, כי היא משנה את התוצאה לא פחות מהמודל.

שימו לב גם לשורה האחרונה בטבלה. גם 62.7% הוא קפיצה גדולה: GPT-5.6 Sol קיבל 7.8% באותם תנאים. יש כאן התקדמות אמיתית, וגם ARC Prize אומרים זאת. היא פשוט לא ״AGI״.


לבדוק בעצמכם, בעברית

לא מצאתי בדיקה מפורסמת של אסטרה בעברית, וכל המדדים וההדגמות שראיתי רצו באנגלית. לכן המקטע הזה לא מציג עדיין בדיקה עצמאית שלי; הוא נותן לכם את הבדיקה כדי שתריצו אותה על המודל שאתם בודקים.

זה חשוב, כי מודל שמצטיין באנגלית נשבר בעברית בדיוק במקומות שעסק ישראלי נוגע בהם. אלה ארבעת המקומות, ולצד כל אחד בקשה שאתם יכולים להדביק ולבדוק בעצמכם. שלוש דקות, וזה יגיד לכם יותר מכל טבלת מדדים.

כיווניות
מספר, אחוז או מילה באנגלית בתוך משפט עברי, שקופצים למקום הלא נכון
מגדר ורבים
פנייה שמתחילה בלשון זכר יחיד ומחליפה מין או מספר באמצע
מבנה
טבלה או מצגת שנבנות משמאל לימין למרות שהתוכן עברי
רישום
מונחים מקצועיים שמתורגמים מילולית ונשמעים זרים לאוזן ישראלית

הבקשה שבודקת כיווניות

מעתיקים למודל שאתם בודקים

הבקשה: ״כתוב פסקה שיווקית בעברית, 4 משפטים, על מערכת ניהול לעסקי מזון. שלב בתוכה: עלייה של 47% במכירות, חיסכון של 12 שעות בשבוע, חיבור ל-Wolt ול-Google Analytics, ומחיר של 890 ש"ח לחודש.״

מה לבדוק בתשובה: שהאחוז מופיע כ-47% ולא הפוך, ששמות הכלים באנגלית לא הפכו את סדר המילים סביבם, ושהסכום נשאר צמוד ובסדר הנכון.

הבקשה שבודקת עברית עסקית

מעתיקים למודל שאתם בודקים

הבקשה: ״נסח מייל בעברית ללקוח שלא שילם חשבונית על סך 4,800 ש"ח, שני חודשים באיחור. הלקוח חשוב לי ואני רוצה להמשיך לעבוד איתו. הטון: תקיף אבל לא עוין. עד 120 מילה.״

מה לבדוק: שזה נשמע כמו מייל שאדם ישראלי כותב ולא כמו תרגום, ושהמגדר והפנייה עקביים מהמשפט הראשון ועד האחרון.

הבקשה שבודקת שיפוט

מעתיקים למודל שאתם בודקים

הבקשה: ״אני בעל עסק. תכין לי תוכנית עבודה לשבוע הקרוב לפי סדר עדיפויות, ותכתוב גם את המיילים שצריך לשלוח.״

מה לבדוק, וזו הבדיקה החשובה מכולן: האם הוא עצר ושאל אתכם משהו לפני שהתחיל, או שהמציא לעצמו עסק ורץ. זו בדיוק ההתנהגות שההשוואה למעלה מראה, ועכשיו אתם בודקים אותה על עצמכם.

פתחו שיחה חדשה לכל בקשה. אם תריצו את שלושתן באותה שיחה, ההקשר מהראשונה ישפיע על השנייה והבדיקה תאבד את הערך שלה.


הרקע: הפריצה, העצירה, השחרור

שלושה תאריכים מסבירים את ההגבלות שתפגשו: למה חלק מהיכולות נעולות, למה ב-Enterprise הוא כבוי בהשקה, ולמה ההפצה הדרגתית.

הרקע, בקצרה

21 ביולי

המודל ברח מהכלוב

בבדיקה פנימית של אופן איי אי, מודל שלא שוחרר יצא מסביבת הבדיקה שלו, מצא פרצת אפס-יום וניצל אותה כדי להגיע לתשתית הייצור האמיתית של האגינג פייס. המטרה שלו הייתה לשלוף תשובות ממסד נתונים חי, כדי לקבל ציון גבוה יותר במבחן של עצמו.

אוגוסט

עצרו את הפיתוח

אופן איי אי הקפיאה את אסטרה אחרי שיכולות הסייבר שלו התקדמו מהר מהצפוי. זה גם מה שקראתם בעיתונות הישראלית, תחת הכותרת ״חשש מקטסטרופה״.

3 בספטמבר

הוא יצא

אסטרה שוחרר עם מנגנוני בלימה: היכולות ההתקפיות נעולות מאחורי תוכנית ייעודית, והגישה נפתחת בהדרגה. במקביל הודיעה החברה שזהו המודל החזק ביותר שלה עד היום.

למה הרקע הזה נוגע לכם

אם קראתם על אסטרה בעברית באוגוסט, קראתם שעצרו אותו. מאז הוא שוחרר. הציר למעלה הוא ההסבר להגבלות, לא רקע דרמטי: מי שמבין למה הן קיימות לא מתבלבל מהן.


כמה זה עולה

אם אתם על מנוי, אסטרה כלול במסגרת המכסות של המנוי. Plus, Pro, Business ו-Enterprise; שימוש מעבר למכסה עשוי לעלות. אין שכבה חינמית.

השאלה הכלכלית האמיתית מתחילה בממשק התכנותי, כלומר כשמריצים אותו בתוך מערכת אוטומטית ולא ידנית בצ׳אט:

קלט
10$ למיליון טוקנים
פלט
50$ למיליון טוקנים
קלט מהמטמון
1$ למיליון טוקנים
מצב מהיר
פי 2 מחיר, עד פי 2 מהירות
GPT-5.6 Sol, להשוואה
4$ / 20$ למיליון

לפי דף המחירים של אופן איי אי. המחיר לטוקן הוא נקודת פתיחה בלבד: המדד שחשוב הוא כמה עולה להשלים משימה, כולל ניסיונות חוזרים וזמן התיקון שלכם.

הפרמיה מוצדקת כשההרצה

  • נוגעת בכמה מערכות ורצה עד הסוף בלי אדם באמצע
  • מחליפה עבודה ידנית שנמדדת בשעות, לא בדקות
  • נכשלת היום ברמת הדיוק ולא ברמת המהירות

הפרמיה לא מוצדקת כשההרצה

  • היא שאלה, ניסוח או כתיבה, שם הציון זהה לדגם הזול יותר
  • רצה אלפי פעמים ביום על משימה פשוטה וחוזרת
  • כבר עובדת אצלכם היטב על מודל קיים

אסטרה מול Claude: מתי מה

אין תשובה אחת, ומי שנותן לכם אחת מוכר לכם משהו. לפי המדידות העצמאיות, כל אחד מהם מוביל במקום אחר:

לפי סוג המשימה, לא לפי ציון כללי

לפי מדידות Artificial Analysis ו-ARC Prize, צילום מצב 4.9.2026. ההשוואה היא ל-Claude Fable 5.1 ול-Claude Opus 5, לפי המבחן.

אסטרה מקדים

  • הפעלת מחשב ותוכנות
  • מתמטיקה
  • משימות סייבר
  • עלות למשימת קוד

קלוד מקדים

  • ציון משוקלל
  • ציון בקוד סוכני
  • מבחן עם כלים
  • ARC-AGI-3 בתשתית סטנדרטית

בפועל, לרוב העסקים הקטנים השאלה הזאת פחות דרמטית ממה שהיא נשמעת. שני המודלים טובים מספיק כדי שהגורם המגביל יהיה הניסוח שלכם, לא הבחירה ביניהם.


מה שמדאיג, ולמה זה לא היסטריה

אסטרה קשה יותר לפיקוח מקודמיו, וזה לא ניחוש. זה כתוב בכרטיס המערכת של אופן איי אי עצמה.

הטכניקה שבבסיס השיפור מקטינה את היכולת לקרוא את שרשרת המחשבה של המודל. במסמך שלהם מופיע שהמודל מסוגל לפעמים לחמוק מהמנטרים הפנימיים כשמבקשים ממנו לבצע משימות חבלה מסוימות.

חוקרי בטיחות בכירים הגיבו בשמם המלא. סטיבן אדלר, לשעבר ראש בטיחות באופן איי אי, אמר שנראה שהחברה חוצה אחד מהקווים האדומים הבודדים שקיימים בתחום. גארי מרקוס, מבקר ותיק, כתב שהצלחה במבחן ARC-AGI מרשימה אבל אינה הוכחה לבינה כללית, למרות שם המבחן.

ומה זה אומר לכם בפועל? לא הרבה, בצ׳אט. הרבה, ברגע שאתם נותנים לסוכן להפעיל מחשב:

הרשאה לסוכן שמפעיל מחשב היא רחבה בהרבה מהרשאה לצ׳אט. הוא רואה מסכים ולוחץ כפתורים.
גישה רק למידע שהמשימה צריכה, ואישור אנושי לכל פעולה משמעותית. גם קריאה חושפת מידע, ולכן היקף הגישה הוא ההחלטה הראשונה.
היכולות ההתקפיות בתחום הסייבר חסומות למשתמש רגיל, ופתוחות רק לגופים שעברו בדיקה.

מה לעשות עכשיו

שלושה מסלולים, ולכל אחד תנאי כניסה ברור. בחרו אחד, לא שלושה.

בלי לשנות כלום בעסק

להמתין

אם הכול עובד

יש לכם תהליכים שרצים היטב על מודל קיים, והעבודה שלכם היא בעיקר ניסוח וכתיבה. במדד האינטליגנציה הכללית אין כאן שדרוג. חכו לשבועיים של דיווחים מהשטח.

לבדוק

אם יש לכם משימה תקועה

קחו משימה אחת שחוזרת ונוגעת ביותר ממערכת אחת. הריצו אותה פעם על אסטרה ופעם על מה שהשתמשתם בו קודם, ותשוו. שעה של עבודה, ותשובה אמיתית במקום מדד.

לאמץ

אם הבדיקה הצליחה

התחילו ממשימה אחת בלבד, עם אדם שמאשר כל פעולה בלתי-הפיכה. הרחיבו רק אחרי שבועיים שבהם היא רצה בלי הפתעות.

שלושה כללי אצבע שיישארו נכונים גם למודל הבא

דמו הוא לא הבטחה

דמו נבחר מראה משימה נבחרת בסביבה שנבנתה בשבילה. הפער בין 62.7% ל-99.9% מראה כמה הסביבה משנה. תבדקו על המשימה שלכם, בסביבה שלכם.

מדד אחד הוא לא תשובה

אותו מודל מוביל במבחן אחד ומפגר בשני. השאלה היא לא ״מי הכי חזק״ אלא ״מי חזק במשימה שלי״.

הניסוח הוא מה שבשליטתכם

המודל, הכלים וההקשר קובעים יחד. מתוכם, הניסוח והבדיקה הם החלק שאתם שולטים בו, וזו מיומנות שלא מתיישנת עם הגרסה.

מקורות ומתודולוגיה

שלושה סוגי נתונים במאמר, ומסומן מי אמר מה: לפי החברה (אופן איי אי), מדידה עצמאית (Artificial Analysis, ARC Prize), ובדיקה שלי (עדיין אין; המקטע ״לבדוק בעצמכם״ הוא הכלי, לא התוצאה). כל המספרים הם צילום מצב מ-4 בספטמבר 2026, יום אחרי השחרור, ויתעדכנו לפי יומן השינויים בתחתית.

מדידה עצמאית
Artificial Analysis (ציון משוקלל, קוד, HLE, הזיות) · ARC Prize (ARC-AGI-3, שתי התשתיות ורמות המאמץ)

מילון מונחים

תשתית הרצה (Harness)
השכבה שעוטפת את המודל ומחליטה איך הוא מקבל את המשימה, כמה זיכרון נשמר בין קריאה לקריאה, ואילו כלים זמינים לו. אותו מודל בשתי תשתיות נותן שתי תוצאות שונות לגמרי.
הפעלת מחשב (Computer Use)
היכולת של המודל לראות את המסך ולהזיז עכבר ומקלדת, במקום לקרוא לממשק תכנותי שנבנה מראש. זה מה שמאפשר לו לעבוד מול תוכנה שאין לה חיבור מסודר.
ARC-AGI
משפחת מבחנים שנועדה למדוד התמודדות עם בעיות שהמודל לא ראה בשום צורה באימון. בניגוד למבחני ידע, אי אפשר לפתור אותם בשליפה מהזיכרון.
פרצת אפס-יום
חולשת אבטחה שלא הייתה ידועה לאף אחד לפני שהתגלתה, ולכן אין לה עדיין תיקון. היכולת למצוא כאלה לבד היא מה שהוביל לסיווג ״קריטי״.
שרשרת מחשבה
הצעדים שהמודל כותב לעצמו בדרך לתשובה. כשהיא קריאה, אפשר לבדוק איך הוא הגיע למסקנה. אצל אסטרה היא קריאה פחות מבעבר.
טוקן
יחידת הטקסט שלפיה נמדד השימוש והתמחור. מילה בעברית היא לרוב כמה טוקנים, ולכן טקסט עברי יקר יותר לעיבוד מטקסט אנגלי באותו אורך.

שאלות שחוזרות

האם אני צריך לעבור לאסטרה?

לא באופן גורף. אם העבודה שלכם היא שאלות, ניסוח וכתיבה, ההבדל צפוי להיות קטן: בציון המשוקלל של Artificial Analysis אסטרה דומה לקודמו. אם העבודה שלכם כוללת משימות רב-שלביות שנוגעות בכמה מערכות, שם ההבדל אמיתי.

מה זה בעצם ״הפעלת מחשב״?

המודל רואה את המסך ומזיז את העכבר כמו אדם, במקום לקרוא לממשק תכנותי שמישהו בנה מראש. המשמעות המעשית: הוא יכול לעבוד מול תוכנה פנימית ישנה בעסק שלכם, שאין לה חיבור מסודר לשום דבר.

כמה זה עולה לי?

אם אתם על מנוי Plus או Pro, אסטרה כלול במסגרת מכסות המנוי; שימוש מעבר למכסה עשוי לעלות. דרך הממשק התכנותי המחיר הוא 10 דולר למיליון טוקני קלט ו-50 דולר למיליון טוקני פלט, פי שניים וחצי מהדגם הקודם.

יש גרסה חינמית?

לא. בהודעת השחרור אין אזכור לשכבה חינמית. אסטרה מגיע למנויי Plus, Pro, Business ו-Enterprise.

מה שבניתי על המודל הקודם יישבר?

הפרומפטים עצמם ימשיכו לעבוד. מה שכן משתנה הוא ההתנהגות: אסטרה נוטה לעצור ולשאול שאלה במקום להניח, ולכן תהליך אוטומטי שהסתמך על כך שהמודל ימשיך בלי לשאול עשוי להיתקע. שווה להריץ בדיקה לפני שמעבירים משהו שרץ בייצור.

האם זה באמת AGI?

נשיא אופן איי אי אמר שלדעתו כן. חוקרים חיצוניים חלוקים על כך, ו-ARC Prize, שמריצים את המבחן שצוטט, כתבו במפורש שהם לא טוענים שזה AGI. הציון המשוקלל של אינטליגנציה כללית דומה לדור הקודם. זו טענה שיווקית לפני שהיא טענה מדידה.

המידע שלי בטוח?

אותם כללים כמו בכל כלי ענן: מה שאתם מדביקים לצ׳אט יוצא מהארגון. אסטרה מוסיף שאלה חדשה, כי הוא מסוגל להפעיל תוכנות ולגשת למסכים. הרשאה לסוכן שמפעיל מחשב היא הרשאה רחבה בהרבה מהרשאה לצ׳אט, וכדאי להתייחס אליה ככזו.

מה זה הסיפור עם הסייבר?

אסטרה הוא המודל הראשון שאופן איי אי מסווגת כחוצה סף ״קריטי״ ביכולות סייבר, כלומר הוא מסוגל למצוא פרצות שלא היו ידועות ולנצל אותן בלי הכוונה צעד-אחר-צעד. היכולות ההתקפיות עצמן חסומות למשתמש רגיל ופתוחות רק לגופים שעברו בדיקה.

למה בארגון שלי אסטרה לא מופיע?

בחשבונות Enterprise, לפי הודעת ההשקה, הוא כבוי כברירת מחדל בעת ההשקה ומנהל המערכת צריך להדליק אותו. אם אתם על חשבון פרטי והוא עדיין לא שם, ההפצה מתבצעת בהדרגה על פני כמה ימים.

אז מה כן שווה לעשות השבוע?

לקחת משימה אחת שחוזרת אצלכם, כזו שנוגעת ביותר ממערכת אחת, ולהריץ אותה פעם אחת על אסטרה ופעם אחת על מה שהשתמשתם בו קודם. ההשוואה הזאת תלמד אתכם יותר מכל מדד.

עדכוני המדריך

  • 04.09.26גרסה ראשונה, יום אחרי השחרור

המדריך עזר לכם?

דירוג בלחיצה אחת. בלי הרשמה.

מודל מתחלף. המיומנות נשארת.

קלוד קוד: מה שנכלל בהכשרה
ההכשרה שממשיכה מכאן

קלוד קוד

ההכשרה מתבצעת בקלוד קוד, לא באסטרה. היא מתאימה למי שרוצה ללמוד לבנות תהליכים שעובדים, לנסח משימה, לתחום אותה ולבדוק את התוצאה, ולא למי שמחפש הדרכה על אסטרה בלבד. המיומנות הזאת עוברת בין מודלים.

  • 22 שיעורים · 4 פרקים · 7 שעות ו-40 דקות
  • 31 עובדים דיגיטליים מוכנים להעתקה
  • בעברית, למי שלא מתכנת

רוצים את זה חי אצלכם בארגון, עם הצוות בחדר?

סדנת קלוד קוד לארגונים

מדריכים חדשים עולים אצלי קודם

כל מה שאני בונה ומגלה: ברשתות, לפני שזה מגיע לאתר.

להמשיך מכאן