الدلالة الإحصائية لاختبارات A/B
عندما تحتوي الحملة على صيغتين أو أكثر، تحسب Joryio تلقائيًا ما إذا كانت فروق الأداء ذات دلالة إحصائية، لتعرف ما إذا كانت صيغة ما أفضل فعلًا لا متقدمة عشوائيًا فقط.
ما الذي ستراه
فواصل الثقة
يعرض كل مقياس معدل (معدل الفتح أو معدل النقر) نطاقًا تحته:
معدل الفتح: 24.90%
[21.3% - 28.8%]
يعني ذلك أن احتمال وقوع المعدل الحقيقي ضمن ذلك النطاق هو 95%. النطاقات الأضيق = بيانات أكثر موثوقية.
شارات الدلالة
بجانب كل معدل، سترى شارة ملونة:
- أخضر
+12.5%: هذه الصيغة أفضل بكثير من الأساس إحصائيًا - أحمر
-5.2%: هذه الصيغة أسوأ بكثير من الأساس إحصائيًا - رمادي
p=0.234: لا يوجد دليل كافٍ بعد (تحتاج بيانات أكثر)
تكون النتيجة «دالة» عندما p < 0.05، أي أن احتمال أن يكون الفرق بسبب الصدفة أقل من 5%.
علامتا المتصدر والفائز
- «متصدر» (علامة زرقاء): الصيغة ذات أعلى معدل في المقياس الأساسي
- «فائز» (علامة خضراء + أيقونة كأس): فائز مؤكد إحصائيًا أُعلن رسميًا
إعداد التحليل الإحصائي
ضبط اختبار A/B
عند إنشاء أو تعديل حملة بصيغتين فأكثر، يمكنك ضبط التحليل:
| الإعداد | الوصف | الافتراضي |
|---|---|---|
| المقياس الأساسي | المقياس الذي يحدد الفائز | معدل الفتح (داخل التطبيق: CTR) |
| الحد الأدنى لحجم العينة | أدنى عدد مستلمين لكل صيغة قبل حساب الدلالة | 100 |
| الفائز التلقائي | أعلن الفائز تلقائيًا عند بلوغ الدلالة | معطل |
| الترقية التلقائية | حوّل 100% من الزيارات إلى الفائز بعد الإعلان | معطل |
المقاييس الأساسية المتاحة
| المقياس | الأفضل لـ | ما يقيسه |
|---|---|---|
| عمليات الفتح (معدل الفتح) | اختبارات سطر الموضوع | عمليات الفتح البشرية المميزة / المُسلّم |
| النقرات (معدل النقر) | اختبارات المحتوى وCTA | النقرات البشرية المميزة / المُسلّم |
| التحويل (معدل التحويل) | الأثر من البداية إلى النهاية | تحويلات حدث التحويل الأساسي للحملة (تتبع التحويل) / المستلمين |
| الإيرادات (لكل مستلم) | قيمة الطلب / AOV | مجموع مبالغ الشراء (purchase / Order Completed) في نافذة الإسناد / المستلمين |
| CTR | الرسائل داخل التطبيق | النقرات / الانطباعات |
يستخدم التحويل حدث التحويل الأساسي للحملة من تتبع التحويل (اضبط واحدًا هناك وإلا لا يمكن تقييم الفائز على التحويل). الإيرادات مقياس مستمر مرجّح بالمبلغ، ولهذا لا يملك اختبار دلالة؛ فيُعلن فائز الإيرادات حسب أعلى إيراد لكل مستلم عند الموعد النهائي (لا يتوقف مبكرًا).
مثال ضبط API
{
"abTestConfig": {
"primaryMetric": "openRate",
"minSampleSizePerVariant": 200,
"autoWinnerEnabled": true,
"autoPromoteEnabled": false
}
}
كيفية عمل الأساس
تقارن كل عملية حساب دلالة صيغةً بـ أساس:
- مجموعة ضابطة: إذا كانت لديك صيغة مجموعة ضابطة (لا تُرسل رسالة)، تستخدم كأساس.
- الأفضل أداءً: إن لم توجد مجموعة ضابطة، تستخدم الصيغة ذات أعلى معدل في المقياس الأساسي.
تعرض كل الصيغ الأخرى فرقها النسبي مقارنة بهذا الأساس.
اكتشاف الفائز تلقائيًا
عند تفعيل autoWinnerEnabled:
- تتحقق مهمة خلفية كل 5 دقائق.
- تتحقق من وصول كل الصيغ إلى الحد الأدنى لحجم العينة.
- إذا كانت لصيغة
p < 0.05في المقياس الأساسي ← يُعلن الفائز. - إذا كان
autoPromoteEnabledمفعلاً أيضًا ← تتحول الزيارات 100% إلى الفائز.
ما الذي يحدث بعد فائز
- تظهر لافتة خضراء أعلى جدول مقارنة الصيغ.
- تحصل الصيغة الفائزة على أيقونة كأس وعلامة «فائز».
- تُحفظ أوزان الزيارات الأصلية (للتراجع عند الحاجة).
- إذا كانت الترقية التلقائية مفعلة، يحصل كل المستلمين الجدد على الصيغة الفائزة.
عندما لا يُعثر على فائز
إذا أدت الصيغ أداء متشابهًا ولم يظهر فرق دال:
- تظهر علامة «متصدر» الصيغة المتقدمة حاليًا.
- توضح شارات
p=...الرمادية قرب كل مقارنة من الدلالة. - فكر في تشغيل الاختبار مدة أطول أو زيادة حجم العينة.
فهم الأرقام
فاصل الثقة (CI)
ما معناه: «نحن واثقون بنسبة 95% أن المعدل الحقيقي يقع ضمن هذا النطاق.»
مثال:
الصيغة A: معدل فتح 20.0% [16.7% - 23.7%]
الصيغة B: معدل فتح 24.9% [21.3% - 28.8%]
تتداخل فواصل الثقة هنا، ما يشير إلى أن الفرق قد لا يكون دالًا. عندما لا تتداخل، يكون الفرق دالًا على الأرجح.
قيمة P
ما معناها: «احتمال رؤية فرق بهذا الحجم، أو أكبر، بالصدفة البحتة.»
p = 0.03← احتمال عشوائي 3% فقط ← دال (شارة خضراء/حمراء)p = 0.23← احتمال عشوائي 23% ← غير دال (شارة رمادية)p = 0.001← دليل قوي جدًا ← دال جدًا
الفرق النسبي
ما معناه: «مقدار تحسن أو تراجع هذه الصيغة مقارنة بالأساس كنسبة مئوية.»
الأساس: معدل فتح 20%
الصيغة B: معدل فتح 25%
الفرق النسبي: +25% (وليس +5 نقاط مئوية)
لافتة جمع البيانات
عندما لا تبلغ الصيغ الحد الأدنى لحجم العينة بعد، سترى لافتة صفراء:
«جمع البيانات: تحتاج كل صيغة إلى 100 عينة على الأقل قبل حساب الدلالة.»
يحميك ذلك من استخلاص نتائج من بيانات قليلة جدًا.
المقاييس حسب القناة
| القناة | المقياس الافتراضي | المتاح |
|---|---|---|
| معدل الفتح | الفتح والنقرات والتحويل والإيرادات | |
| SMS | معدل الفتح | الفتح والنقرات والتحويل والإيرادات |
| Push | معدل الفتح | الفتح والنقرات والتحويل والإيرادات |
| داخل التطبيق | CTR | CTR والتحويل |
| Webhook | معدل النقر | النقرات والتحويل |
| معدل الفتح | الفتح والنقرات والتحويل والإيرادات |
الصيغة المخصصة (مقابل الصيغة الفائزة)
يقدم اختبار A/B وضعين، كلاهما يختار من الأهداف نفسها: الفتح · النقرات · التحويل · الإيرادات:
- الصيغة الفائزة: قِس ثم رقِّ. يرسل كل الصيغ ويقيمها على المقياس أعلاه ويرقي الأفضل الواحد إلى الجميع (هذه الصفحة كاملة).
- الصيغة المخصصة: تنبأ لكل شخص. لكل مستلم، يختار نموذج ML الصيغة المرجح أن يتفاعل معها ذلك الشخص لتحقيق الهدف الذي اخترته؛ لا يوجد فائز واحد. يتعلم من النتائج بمرور الوقت (استخدم Warm up للصيغ الجديدة تمامًا)، ويستخدم التحويل حدث التحويل الأساسي للحملة نفسه. الفتح والنقرات هدفان مختلفان؛ و«الفتح» إشارة أضعف لأن Apple Mail Privacy Protection تضخم معدلات الفتح.
نصائح لنتائج موثوقة
إرشادات حجم العينة
| ما تختبره | الحد الأدنى لكل صيغة |
|---|---|
| معدل الفتح (أثر كبير) | 100-500 |
| معدل النقر | 500-1,000 |
| معدل التحويل | 1,000-5,000 |
| الفروق الصغيرة (1-2%) | 5,000+ |
أخطاء شائعة
- الفحص مبكرًا جدًا: لا تفحص النتائج كل ساعة وتتوقف عندما ترى الأخضر. دع الاختبار يبلغ الحد الأدنى لحجم العينة.
- صيغ كثيرة جدًا: صيغتان أو 3 مثالية. مزيد من الصيغ = بيانات أكثر لكل صيغة.
- الاختبار خلال ظروف شاذة: تجنب العطلات أو الأعطال أو الفترات غير المعتادة الأخرى.
- تجاهل CI: نتيجة «دالة» مع CI واسع جدًا قد لا تكون ذات معنى عملي.
الخطوات التالية
- أساسيات اختبار A/B - كيفية إنشاء اختبارات A/B وتشغيلها
- إنشاء الحملات - دليل إعداد الحملة
- تحليلات الحملات - فهم نتائجك