מובהקות סטטיסטית לבדיקות A/B
כשלקמפיין יש 2 וריאנטים או יותר, Joryio בודקת אוטומטית אם הבדלי הביצועים מובהקים סטטיסטית - כך שתדעו אם וריאנט באמת טוב יותר, ולא רק מוביל באופן אקראי.
מה תראו
רווחי סמך
כל מדד שיעור (שיעור פתיחה, שיעור לחיצה) מציג טווח מתחתיו:
Open Rate: 24.90%
[21.3% - 28.8%]
משמעות: יש סבירות של 95% שהשיעור האמיתי נמצא בטווח הזה. טווח צר יותר = נתונים אמינים יותר.
תגיות מובהקות
ליד כל שיעור תראו תג צבעוני:
- ירוק
12.5%+- הווריאנט הזה טוב באופן מובהק מקו הבסיס - אדום
5.2%-- הווריאנט הזה גרוע באופן מובהק מקו הבסיס - אפור
p=0.234- אין מספיק ראיות עדיין (צריך עוד נתונים)
תוצאה נחשבת "מובהקת" כאשר p < 0.05, כלומר יש פחות מ-5% סיכוי שההבדל נובע ממקריות.
תגיות מוביל ומנצח
- "מוביל" (תג כחול) - הווריאנט עם השיעור הגבוה ביותר במדד הראשי
- "מנצח" (תג ירוק + סמל גביע) - מנצח שאושר סטטיסטית והוכרז רשמית
הגדרת ניתוח סטטיסטי
הגדרת בדיקת A/B
בעת יצירה או עריכה של קמפיין עם 2+ וריאנטים, ניתן להגדיר את הניתוח:
| הגדרה | תיאור | ברירת מחדל |
|---|---|---|
| מדד ראשי | איזה מדד קובע את המנצח | שיעור פתיחה (In-App: CTR) |
| גודל מדגם מינימלי | מינימום נמענים לכל וריאנט לפני חישוב מובהקות | 100 |
| מנצח אוטומטי | הכרזה אוטומטית על מנצח כשמושגת מובהקות | כבוי |
| קידום אוטומטי | הסטת 100% מהתעבורה למנצח לאחר הכרזה | כבוי |
מדדים ראשיים זמינים
| מדד | מתאים ל | מה הוא מודד |
|---|---|---|
| פתיחות (שיעור פתיחה) | בדיקות שורת נושא | פתיחות אנושיות ייחודיות / הודעות שנמסרו |
| לחיצות (שיעור לחיצה) | בדיקות תוכן ו-CTA | לחיצות אנושיות ייחודיות / הודעות שנמסרו |
| המרה (שיעור המרה) | השפעה מקצה לקצה | המרות של אירוע ההמרה הראשי של הקמפיין (מעקב המרות) / נמענים |
| הכנסה (לנמען) | ערך הזמנה / AOV | סכום ערכי הרכישות (purchase / Order Completed) בחלון הייחוס / נמענים |
| CTR | הודעות in-app | לחיצות / חשיפות |
המרה משתמשת באירוע ההמרה הראשי של הקמפיין ממעקב ההמרות (הגדירו אירוע כזה שם, אחרת לא ניתן לדרג את המנצח לפי המרה). הכנסה היא מדד רציף שמבוסס על סכומים - אין לה מבחן מובהקות, ולכן מנצח לפי הכנסה נקבע לפי ההכנסה לנמען הגבוהה ביותר במועד היעד (ללא עצירה מוקדמת).
דוגמת הגדרה ב-API
{
"abTestConfig": {
"primaryMetric": "openRate",
"minSampleSizePerVariant": 200,
"autoWinnerEnabled": true,
"autoPromoteEnabled": false
}
}
כיצד קו הבסיס פועל
כל חישוב מובהקות משווה וריאנט מול קו בסיס:
- קבוצת בקרה - אם יש וריאנט בקרה (ללא שליחת הודעה), הוא משמש כקו בסיס
- הווריאנט המוביל - אם אין קבוצת בקרה, הווריאנט עם השיעור הגבוה ביותר במדד הראשי משמש כקו הבסיס
כל שאר הווריאנטים מציגים את ההבדל היחסי שלהם ביחס לקו הבסיס.
זיהוי מנצח אוטומטי
כאשר autoWinnerEnabled מופעל:
- משימת רקע בודקת כל 5 דקות
- מוודאת שכל הווריאנטים הגיעו לגודל המדגם המינימלי
- אם לווריאנט יש
p < 0.05במדד הראשי → המנצח מוכרז - אם
autoPromoteEnabledגם מופעל → התעבורה מוסטת ב-100% למנצח
מה קורה אחרי הכרזת מנצח
- באנר ירוק מופיע בראש טבלת השוואת הווריאנטים
- הווריאנט המנצח מקבל סמל גביע ותג "מנצח"
- משקלי התעבורה המקוריים נשמרים (לשחזור במידת הצורך)
- אם קידום אוטומטי מופעל, כל הנמענים החדשים מקבלים את הווריאנט המנצח
כשלא נמצא מנצח
אם הווריאנטים מציגים ביצועים דומים ולא מתגלה הבדל מובהק:
- תג "מוביל" מראה איזה וריאנט מוביל כרגע
- תגי
p=...האפורים מראים כמה כל השוואה קרובה למובהקות - שקלו להאריך את הבדיקה או להגדיל את גודל המדגם
הבנת המספרים
רווח סמך (CI)
מה זה אומר: "אנחנו 95% בטוחים שהשיעור האמיתי נמצא בטווח הזה."
דוגמה:
Variant A: Open Rate 20.0% [16.7% - 23.7%]
Variant B: Open Rate 24.9% [21.3% - 28.8%]
רווחי הסמך חופפים כאן, מה שמרמז שההבדל לא בהכרח מובהק. כשרווחי הסמך לא חופפים, ההבדל כמעט בוודאות מובהק.
ערך P (P-Value)
מה זה אומר: "ההסתברות לראות הבדל גדול כל כך (או גדול יותר) בשל מקריות בלבד."
p = 0.03→ רק 3% סיכוי שזה אקראי → מובהק (תג ירוק/אדום)p = 0.23→ 23% סיכוי שזה אקראי → לא מובהק (תג אפור)p = 0.001→ ראיות חזקות מאוד → מובהק מאוד
הבדל יחסי
מה זה אומר: "כמה טוב או גרוע יותר הווריאנט הזה ביחס לקו הבסיס, באחוזים."
Baseline: 20% open rate
Variant B: 25% open rate
Relative difference: +25% (ולא +5 נקודות אחוז)
באנר איסוף נתונים
כשהווריאנטים עוד לא הגיעו לגודל המדגם המינימלי, תראו באנר צהוב:
"אוסף נתונים - כל וריאנט צריך לפחות 100 דגימות לפני שניתן לחשב מובהקות."
זה מגן עליכם מהסקת מסקנות מנתונים מועטים מדי.
מדדים לפי ערוץ
| ערוץ | מדד ברירת מחדל | זמין |
|---|---|---|
| אימייל | שיעור פתיחה | פתיחות, לחיצות, המרה, הכנסה |
| SMS | שיעור פתיחה | פתיחות, לחיצות, המרה, הכנסה |
| Push | שיעור פתיחה | פתיחות, לחיצות, המרה, הכנסה |
| In-App | CTR | CTR, המרה |
| Webhook | שיעור לחיצה | לחיצות, המרה |
| שיעור פתיחה | פתיחות, לחיצות, המרה, הכנסה |
גרסה מותאמת אישית (לעומת גרסה מנצחת)
לבדיקת A/B יש שני מצבים, ושניהם בוחרים מאותם יעדים - פתיחות · לחיצות · המרה · הכנסה:
- גרסה מנצחת - מודדים ואז מקדמים. שולחים את כל הגרסאות, מדרגים אותן לפי המדד שלמעלה ומקדמים את הטובה ביותר לשאר הנמענים (זה הנושא של העמוד כולו).
- גרסה מותאמת אישית - חיזוי לכל אדם. לכל נמען, מודל ה-ML בוחר את הגרסה שסביר ביותר שאותו אדם יגיב אליה עבור היעד שבחרתם - ללא מנצח יחיד. הוא לומד מהתוצאות לאורך זמן (השתמשו בחימום לגרסאות חדשות לגמרי), והמרה משתמשת באותו אירוע המרה ראשי של הקמפיין. פתיחות ולחיצות הן יעדים נפרדים; פתיחות הן אות חלש יותר מכיוון ש-Apple Mail Privacy Protection מנפח את שיעורי הפתיחה.
טיפים לתוצאות אמינות
הנחיות גודל מדגם
| מה בודקים | מינימום לכל וריאנט |
|---|---|
| שיעור פתיחה (השפעה גדולה) | 100-500 |
| שיעור לחיצה | 500-1,000 |
| שיעור המרה | 1,000-5,000 |
| הבדלים קטנים (1-2%) | 5,000+ |
מלכודות נפוצות
- הצצה מוקדמת - אל תבדקו תוצאות כל שעה ותעצרו כשתראו ירוק. תנו לבדיקה להגיע לגודל המדגם המינימלי.
- יותר מדי וריאנטים - 2-3 וריאנטים הם מספר אידיאלי. ככל שיש יותר וריאנטים, נדרשים יותר נתונים לכל אחד.
- בדיקה בתקופות חריגות - הימנעו מחגים, תקלות או תקופות חריגות אחרות.
- התעלמות מרווח הסמך - תוצאה "מובהקת" עם רווח סמך רחב מאוד לא בהכרח משמעותית מבחינה מעשית.
צעדים הבאים
- יסודות בדיקות A/B - איך ליצור ולהריץ בדיקות A/B
- יצירת קמפיינים - מדריך הגדרת קמפיין
- אנליטיקת קמפיינים - הבנת התוצאות שלכם