אנתרופיק בדקה 400 אלף סשנים של קלוד קוד, והפער בין מתחיל למומחה לא נסגר

תוכן עניינים

בסשנים של משתמשים מתחילים, המשימה הסתיימה בהצלחה מאומתת ב-15 אחוז מהמקרים. בסשנים של משתמשים מנוסים, בין 28 ל-33 אחוז.

המספרים האלה מגיעים ממחקר של אנתרופיק שניתח כ-400 אלף סשנים של קלוד קוד מכ-235 אלף אנשים, בין אוקטובר 2025 לאפריל 2026. זה כנראה מאגר הנתונים הגדול ביותר שפורסם עד היום על איך אנשים באמת עובדים עם סוכן קוד, ולא על איך הם מספרים שהם עובדים איתו.

הכותרת שנתפסה מהמחקר בדיונים ברשת הייתה שאי אפשר יותר להתלונן על היעדר רקע טכני. הנתונים אומרים משהו מסויג יותר.

מה נמצא במספרים

הממצאים המרכזיים, כפי שהם מופיעים בדוח:

  • חלוקת ההחלטות. בסשן טיפוסי, האדם מקבל כ-70 אחוז מהחלטות התכנון וכ-20 אחוז מהחלטות הביצוע. במילים אחרות, האדם קובע מה לבנות, והמודל קובע באיזה קובץ, באיזה תחביר ובאיזו פקודה.
  • תיקון באגים ירד. נתח הסשנים שהוקדשו לתיקון קוד שבור ירד מ-33 אחוז ל-19 אחוז לאורך התקופה.
  • הפעלה עלתה. סשנים של הפעלת תוכנה עלו מ-14 אחוז ל-21 אחוז, וכתיבה וניתוח נתונים הוכפלו בקירוב, מכ-10 אחוז לכ-20 אחוז.
  • הערך עלה. הערך המוערך של סשן ממוצע עלה ב-27 אחוז בין אוקטובר לאפריל. בפילוח, משימות בנייה עלו בכ-43 אחוז, הפעלה בכ-34 אחוז ותיקון בכ-32 אחוז.
  • המקצוע כמעט לא משנה. בסשנים שמייצרים קוד, כל אחד מעשרת המקצועות הגדולים במאגר נמצא בטווח של שבע נקודות ממהנדסי תוכנה בשיעור ההצלחה המאומתת.

הממצא האחרון הוא זה שנתפס ככותרת, והוא באמת מפתיע. מי שעוסק בשיווק, בפיננסים או בניהול מוצר מצליח לייצר קוד עובד בשיעור דומה למי שזה המקצוע שלו.

אבל המומחיות לא נעלמה, היא עברה מקום

כאן צריך לשים את שני הממצאים זה לצד זה, כי כל אחד מהם לבד מטעה.

המקצוע הרשמי כמעט לא משפיע. המומחיות כן, ובאופן חד. מתחילים מסיימים בהצלחה מאומתת ב-15 אחוז מהסשנים, מנוסים בין 28 ל-33 אחוז. גם כשהמשימה נתקלת בבעיה הפער נשמר: לפי הדוח, שיעור ההצלחה החלקית לפחות עומד על 60 אחוז אצל מתחילים ועל 80 עד 81 אחוז בקרב מנוסים.

מה שהשתנה הוא סוג המומחיות שנמדדת. כשהמודל מקבל 80 אחוז מהחלטות הביצוע, הידיעה איך לכתוב את הלולאה כבר לא מבדילה בין השניים. מה שמבדיל הוא הידיעה מה לבקש, איך לתאר את המצב הרצוי, ואיך לזהות שהתוצאה שחזרה נראית נכון אבל לא עושה את מה שצריך.

ההערכה שלי היא שזה מסביר גם את ירידת נתח הבאגים מ-33 ל-19 אחוז. לא בהכרח בגלל שהקוד השתפר, אלא בגלל שיותר עבודה נכנסת לשלב שלפני הכתיבה, ופחות תיקונים נדרשים בדיעבד. זו קריאה שלי בנתונים, לא טענה שהדוח מנסח.

הפיצ'ר שיצא באוגוסט מצביע לאותו כיוון

ב-17 באוגוסט אנתרופיק הוסיפה לקלוד קוד פקודה בשם design, בשלב של תצוגה מקדימה למחקר. היא מייצרת סקיצות ממשק מתוך הטרמינל, לפני שנכתב קוד.

השימוש נראה ככה:

/design a few options for <שם הפיצ'ר>

המודל קורא את בסיס הקוד הקיים, מתאים את הסקיצה לשפה העיצובית שכבר יש בפרויקט, ומחזיר כמה חלופות כלוחות עריכה שאפשר לשנות ולשתף. משם בוחרים אחת ובונים אותה.

כרטיס המאגר הרשמי של claude-code בגיטהאב
כרטיס המאגר הרשמי בגיטהאב.

אם הפקודה לא מזוהה אצלכם, היא דורשת גרסה עדכנית:

npm install -g @anthropic-ai/claude-code@latest

הקריאה שלי, ושוב, זו הערכה ולא משהו שאנתרופיק הצהירה עליו: הפקודה הזאת מזיזה את נקודת ההחלטה האנושית אחורה, לשלב הסקיצה. זה בדיוק המקום שבו הנתונים אומרים שהאדם עדיין מחליט. מי שמוסיף כלים לקלוד קוד ממילא ימצא כאן עוד כמה תוספים וסקילים בקוד פתוח שנוגעים באותו שלב.

מי מודד, ומה בדיוק נמדד

לפני שלוקחים את המספרים האלה כנתוני שוק, שווה לומר בקול את מה שברור: אנתרופיק פרסמה מחקר על המוצר של אנתרופיק. זה לא פוסל את הנתונים, ואין כאן טענה שמישהו סילף משהו. זה כן אומר שהמדידה, ההגדרות והחיתוך נעשו על ידי הצד שמוכר את הכלי.

הקטגוריה המרכזית בדוח נקראת הצלחה מאומתת. אין לי את המתודולוגיה המלאה שמאחוריה, ולכן אני מתייחס אליה כמדד פנימי של החברה ולא כתקן חיצוני. השוואה בין 15 אחוז ל-33 אחוז בתוך אותו מאגר היא משמעותית, כי שני הצדדים נמדדו באותו סרגל. השוואה של המספרים האלה למספרים שפרסם ספק אחר, על כלי אחר, לא תהיה משמעותית.

יש כאן גם הטיה שקשה לנטרל. מי שממשיך להשתמש בכלי שבעה חודשים ברצף הוא כנראה מי שהכלי עובד אצלו. אנשים שניסו והפסיקו לא מייצרים סשנים, ולכן הם לא נמצאים במאגר.

ההשקעה עברה מהתחביר אל הניסוח

הנתונים לא מבטיחים שכל אחד יכול לבנות הכול, והם גם לא אומרים שצריך ללמוד לתכנת כדי להתחיל. הם אומרים שהמקום להשקיע בו השתנה.

מי שמגיע עם ידע עמוק בתחום שלו, גם אם הוא לא מפתח, מקבל לפי הדוח יותר עבודה מהמודל לכל הוראה, ומסיים בהצלחה בשיעור גבוה יותר. הידע הזה הוא לא ידע בתחביר. הוא ידע במה שהמערכת אמורה לעשות.

מבחינה מעשית זה אומר שהזמן שמושקע בניסוח המשימה ובתיאור המצב הרצוי שווה יותר מהזמן שמושקע בתיקון הפלט אחרי שהוא חוזר. וזה גם אומר שצריך דרך לבדוק שהתוצאה באמת עובדת ולא רק נראית סבירה, תחום שלם בפני עצמו שלא נפתר בקריאה מהירה של הקוד.

מי שרק מתחיל וטרם התקין את הכלי, יש אצלנו מדריך התקנה מלא. ומי ששוקל לבנות סוכן משלו ולא רק להשתמש באחד, ההבדלים בין התשתיות הקיימות נסקרו כאן בנפרד.

המחקר מכסה תקופה שהסתיימה באפריל. בקצב שבו הנתונים עצמם זזו בתוך שבעה חודשים, הגרסה הבאה שלו כנראה תיראה אחרת לגמרי.

מבוסס על מחקר שפרסמה אנתרופיק, ועל דיווח על פקודת design שהתפרסם בthe-decoder.

הרשמה לניוזלטר

להרשמה חינמית לניוזלטר שלנו ולקבל עדכונים שוטפים על בינה מלאכותית, שיווק, אוטומציות ועוד מלאו את הפרטים

רוצה לייצר לקוחת חדשים דרך שיווק חדשני שמבוסס על אוטומציות ו-AI ?

אהבתם את הכתבה? פרגנו בשיתוף וקבלו מאיתנו קורס לבניית אוטומציות חינם, זה פשוט עוזר לנו ליצור יותר (:

מאמרים אחרונים...

לזמן מוגבל: מיני קורס חינמי לבניית סוכני AI

הצלחת! יש לבחור עכשיו בשעה מועדפת לפגישת אפיון צרכים חינם!

לאחר שסיימת, יש למלא את השאלון הבא כדי שנגיע לפגישה עם תוכנית עבודה סדורה!

https://smartrise.co.il/dream-client

מה שמפריד בינכם לבין להבין בדיוק איך לתקוף את השיווק, ולבנות פעם אחת מערכת אמיתית שתשרת אתכם שנים, זו שיחת פוקוס אחת בת 30 דק' איתנו

שנתחיל? (השיחה ללא עלות או התחייבות)

מהו תקציב הפרסום?
פרסמת ממומן בעבר?
כמה חשוב לך להצליח?

איזה כיף! החלטת לעשות צעד ולהכיר!

השאירו פרטים עכשיו, לאחר מכן תועברו לבחירת יום ושעה שמתאימים לכם

קבלו מיני קורס חינם לבניית סוכני AI שילמד אתכם את כל הבסיס (ומעבר) לאיך לבנות סוכנים בווצאפ שעובדים בשבילכם 24/7

הטבה לפניך!

קורס לבניית סוכני AI בווצאפ המתקדם בישראל עכשיו בהצעה מטורפת! 

כל הפרטים בעמוד הבא: