Về công cụ này
Máy tính ý nghĩa thống kê thử nghiệm A/B là công cụ miễn phí, chạy trong trình duyệt, cho bạn biết liệu sự khác biệt giữa hai tỷ lệ chuyển đổi là có ý nghĩa thống kê hay chỉ là nhiễu. Nhập số khách truy cập và số chuyển đổi của mỗi biến thể và nó chạy một kiểm định z hai tỷ lệ cục bộ — không dữ liệu nào rời khỏi trình duyệt của bạn.
Tỷ lệ chuyển đổi là pA = cA ÷ nA và pB = cB ÷ nB, và mức tăng tương đối là (pB − pA) ÷ pA × 100. Kiểm định gộp hai nhóm, p = (cA + cB) ÷ (nA + nB), tính sai số chuẩn SE = √(p(1−p)(1/nA + 1/nB)) và điểm z z = (pB − pA) ÷ SE. Giá trị p hai phía là 2 × (1 − Φ(|z|)), trong đó Φ là CDF chuẩn được xây từ một phép xấp xỉ hàm sai số (Abramowitz-Stegun 7.1.26); độ tin cậy là (1 − p-value) × 100.
Dùng nó sau một thử nghiệm chia tách để quyết định xem biến thể B có thực sự vượt A hay không. Ô kết luận đánh dấu một kết quả là có ý nghĩa ở độ tin cậy 95% trở lên. Hãy nhớ rằng ý nghĩa không giống với một hiệu ứng lớn hoặc bền vững — luôn cân nhắc cả mức tăng và cỡ mẫu.
Câu hỏi thường gặp
Công cụ này dùng kiểm định nào?
Một kiểm định z hai tỷ lệ hai phía với sai số chuẩn gộp — phương pháp tiêu chuẩn để so sánh hai tỷ lệ chuyển đổi. Giá trị p đến từ phân phối chuẩn thông qua một phép xấp xỉ hàm sai số (công thức Abramowitz-Stegun 7.1.26), và độ tin cậy là 100% trừ giá trị p tính theo phần trăm.
Độ tin cậy 95% ở đây có nghĩa là gì?
Nó nghĩa là nếu hai biến thể thực sự hoạt động như nhau, bạn sẽ chỉ thấy một khác biệt lớn thế này hoặc lớn hơn khoảng 5% số lần do ngẫu nhiên. Kết luận ghi 'Có ý nghĩa' ở độ tin cậy 95% trở lên. Nó không cho bạn biết độ lớn của hiệu ứng — hãy xem mức tăng để biết điều đó.
Vì sao tôi nhận được một kết quả không hợp lệ?
Số chuyển đổi không thể vượt số khách truy cập, và cả hai số khách truy cập phải lớn hơn 0. Kiểm định cũng cần một chút phương sai: nếu không ai chuyển đổi ở cả hai nhóm, hoặc tất cả đều chuyển đổi, sai số chuẩn bằng 0 và không thể tạo điểm z nào, nên công cụ báo cáo đầu vào là không hợp lệ.
Ý nghĩa có đủ để tuyên bố người thắng không?
Không tự nó đủ. Một khác biệt nhỏ, không quan trọng có thể có ý nghĩa với một cỡ mẫu khổng lồ, trong khi một hiệu ứng thực có thể không đạt ý nghĩa với một cỡ mẫu nhỏ. Hãy cân nhắc mức tăng tương đối, các con số tuyệt đối và liệu thử nghiệm có chạy đủ lâu. Mọi phép tính ở đây chạy riêng tư trong trình duyệt của bạn.
Công cụ khác