1. ਕੁਝ ਡਾਟਾ ਸੈੱਟਾਂ ਵਿੱਚ, ਆਊਟਲਾਇਰ (outliers) ਨਾਮਕ ਮੁੱਲ (ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟ) ਹੁੰਦੇ ਹਨ। ਆਊਟਲਾਇਰ ਉਹ ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟ ਹੁੰਦੇ ਹਨ ਜੋ ਘੱਟੋ-ਘੱਟ ਵਰਗ ਰੇਖਾ (least-squares line) ਤੋਂ ਦੂਰ ਹੁੰਦੇ ਹਨ। ਉਨ੍ਹਾਂ ਵਿੱਚ ਵੱਡੀਆਂ ਗਲਤੀਆਂ ਹੁੰਦੀਆਂ ਹਨ, ਜਿੱਥੇ ਗਲਤੀ ਜਾਂ ਬਕਾਇਆ (residual) ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਦੇ ਬਹੁਤ ਨੇੜੇ ਨਹੀਂ ਹੁੰਦਾ।
2. ਆਊਟਲਾਇਰਾਂ ਦੀ ਨੇੜਿਓਂ ਜਾਂਚ ਕਰਨ ਦੀ ਲੋੜ ਹੈ। ਕਈ ਵਾਰ, ਉਨ੍ਹਾਂ ਨੂੰ ਡਾਟਾ ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ ਸ਼ਾਮਲ ਨਹੀਂ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ, ਜਿਵੇਂ ਕਿ ਜੇਕਰ ਇਹ ਸੰਭਵ ਹੈ ਕਿ ਇੱਕ ਆਊਟਲਾਇਰ ਗਲਤ ਡਾਟਾ ਦਾ ਨਤੀਜਾ ਹੋਵੇ। ਹੋਰ ਸਮਿਆਂ ਤੇ, ਇੱਕ ਆਊਟਲਾਇਰ ਅਧਿਐਨ ਅਧੀਨ ਆਬਾਦੀ ਬਾਰੇ ਮਹੱਤਵਪੂਰਨ ਜਾਣਕਾਰੀ ਰੱਖ ਸਕਦਾ ਹੈ ਅਤੇ ਡਾਟਾ ਵਿੱਚ ਸ਼ਾਮਲ ਰਹਿਣਾ ਚਾਹੀਦਾ ਹੈ। ਮੁੱਖ ਗੱਲ ਇਹ ਹੈ ਕਿ ਧਿਆਨ ਨਾਲ ਜਾਂਚ ਕੀਤੀ ਜਾਵੇ ਕਿ ਡਾਟਾ ਪੁਆਇੰਟ ਆਊਟਲਾਇਰ ਕਿਉਂ ਬਣਦਾ ਹੈ।
3. ਆਊਟਲਾਇਰਾਂ ਤੋਂ ਇਲਾਵਾ, ਇੱਕ ਨਮੂਨੇ ਵਿੱਚ ਇੱਕ ਜਾਂ ਕੁਝ ਅਜਿਹੇ ਪੁਆਇੰਟ ਹੋ ਸਕਦੇ ਹਨ ਜਿਨ੍ਹਾਂ ਨੂੰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ (influential points) ਕਿਹਾ ਜਾਂਦਾ ਹੈ। ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ ਉਹ ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟ ਹੁੰਦੇ ਹਨ ਜੋ ਹੋਰ ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਤੋਂ ਖਿਤਿਜੀ ਦਿਸ਼ਾ (horizontal direction) ਵਿੱਚ ਦੂਰ ਹੁੰਦੇ ਹਨ। ਇਹਨਾਂ ਪੁਆਇੰਟਾਂ ਦਾ ਰਿਗਰੈਸ਼ਨ ਰੇਖਾ (regression line) ਦੇ ਢਲਾਣ (slope) ਤੇ ਵੱਡਾ ਪ੍ਰਭਾਵ ਪੈ ਸਕਦਾ ਹੈ। ਇੱਕ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ, ਤੁਸੀਂ ਇਸਨੂੰ ਡਾਟਾ ਸੈੱਟ ਤੋਂ ਹਟਾ ਸਕਦੇ ਹੋ ਅਤੇ ਇਹ ਨਿਰਧਾਰਤ ਕਰ ਸਕਦੇ ਹੋ ਕਿ ਕੀ ਰਿਗਰੈਸ਼ਨ ਰੇਖਾ ਦੀ ਢਲਾਣ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਤਬਦੀਲੀ ਆਈ ਹੈ।
4. ਤੁਸੀਂ ਇਹ ਵੀ ਜਾਂਚ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ ਕਿ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ (correlation coefficient), r, ਕਿਵੇਂ ਬਦਲਿਆ ਹੈ। ਕਈ ਵਾਰ, ਢਲਾਣ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਤਬਦੀਲੀ ਨੂੰ ਸਮਝਣਾ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ, ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਇਹ ਦੇਖਣ ਦੀ ਲੋੜ ਹੈ ਕਿ ਰੇਖੀ ਸੰਬੰਧ ਦੀ ਮਜ਼ਬੂਤੀ ਕਿਵੇਂ ਬਦਲੀ ਹੈ। ਕੰਪਿਊਟਰਾਂ ਅਤੇ ਕਈ ਕੈਲਕੂਲੇਟਰਾਂ ਦੀ ਵਰਤੋਂ ਆਊਟਲਾਇਰਾਂ ਅਤੇ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ। ਰਿਗਰੈਸ਼ਨ ਵਿਸ਼ਲੇਸ਼ਣ ਇਹ ਨਿਰਧਾਰਤ ਕਰ ਸਕਦਾ ਹੈ ਕਿ ਕੀ ਕੋਈ ਆਊਟਲਾਇਰ, ਸੱਚਮੁੱਚ, ਇੱਕ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ ਹੈ। ਨਵਾਂ ਰਿਗਰੈਸ਼ਨ ਦਿਖਾਏਗਾ ਕਿ ਆਊਟਲਾਇਰ ਨੂੰ ਛੱਡਣ ਨਾਲ ਚਲਾਂ (variables) ਵਿਚਕਾਰ ਸਹਿ-ਸੰਬੰਧ, ਅਤੇ ਨਾਲ ਹੀ ਰੇਖਾ ਦੇ ਫਿੱਟ ਤੇ ਕੀ ਪ੍ਰਭਾਵ ਪਵੇਗਾ। ਦੋ ਰਿਗਰੈਸ਼ਨ ਰੇਖਾਵਾਂ ਨੂੰ ਦਿਖਾਉਣ ਵਾਲਾ ਇੱਕ ਗ੍ਰਾਫ ਇਹ ਨਿਰਧਾਰਤ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ ਕਿ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਉਣ ਨਾਲ ਮਾਡਲ ਦੇ ਫਿੱਟ ਤੇ ਕੀ ਪ੍ਰਭਾਵ ਪੈਂਦਾ ਹੈ।
5. ਆਊਟਲਾਇਰਾਂ ਦੀ ਪਛਾਣ
6. ਅਸੀਂ ਸਕੈਟਰ ਪਲਾਟ (scatter plot) ਅਤੇ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਦੇ ਗ੍ਰਾਫ ਨੂੰ ਦੇਖ ਕੇ ਆਊਟਲਾਇਰਾਂ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾ ਸਕਦੇ ਹਾਂ। ਹਾਲਾਂਕਿ, ਅਸੀਂ ਇਸ ਬਾਰੇ ਕੁਝ ਦਿਸ਼ਾ-ਨਿਰਦੇਸ਼ ਚਾਹੁੰਦੇ ਹਾਂ ਕਿ ਕਿਸੇ ਪੁਆਇੰਟ ਨੂੰ ਆਊਟਲਾਇਰ ਮੰਨਣ ਲਈ ਕਿੰਨੀ ਦੂਰ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ। ਇੱਕ ਮੋਟੇ ਨਿਯਮ ਦੇ ਤੌਰ ਤੇ, ਅਸੀਂ ਕਿਸੇ ਵੀ ਪੁਆਇੰਟ ਨੂੰ ਆਊਟਲਾਇਰ ਵਜੋਂ ਫਲੈਗ ਕਰ ਸਕਦੇ ਹਾਂ ਜੋ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਤੋਂ ਉੱਪਰ ਜਾਂ ਹੇਠਾਂ ਦੋ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨਾਂ (standard deviations) ਤੋਂ ਵੱਧ ਦੂਰ ਸਥਿਤ ਹੈ। ਵਰਤਿਆ ਗਿਆ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਬਕਾਇਆ ਜਾਂ ਗਲਤੀਆਂ ਦਾ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਹੈ।
7. ਅਸੀਂ ਇਸਨੂੰ ਸਕੈਟਰ ਪਲਾਟ ਵਿੱਚ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਤੋਂ ਦੋ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨਾਂ ਉੱਪਰ ਅਤੇ ਹੇਠਾਂ ਇੱਕ ਵਾਧੂ ਜੋੜੀ ਰੇਖਾਵਾਂ ਖਿੱਚ ਕੇ ਦ੍ਰਿਸ਼ਟੀਗਤ (visually) ਰੂਪ ਵਿੱਚ ਕਰ ਸਕਦੇ ਹਾਂ। ਇਸ ਵਾਧੂ ਜੋੜੀ ਰੇਖਾਵਾਂ ਦੇ ਬਾਹਰ ਕੋਈ ਵੀ ਡਾਟਾ ਪੁਆਇੰਟ ਸੰਭਾਵੀ ਆਊਟਲਾਇਰ ਵਜੋਂ ਫਲੈਗ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਜਾਂ, ਅਸੀਂ ਹਰੇਕ ਬਕਾਇਆ ਦੀ ਗਣਨਾ ਕਰਕੇ ਅਤੇ ਇਸਦੀ ਦੋ ਗੁਣਾ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਨਾਲ ਤੁਲਨਾ ਕਰਕੇ ਇਸਨੂੰ ਸੰਖਿਆਤਮਕ (numerically) ਰੂਪ ਵਿੱਚ ਕਰ ਸਕਦੇ ਹਾਂ। TI-83, 83+, ਜਾਂ 84+ ਕੈਲਕੂਲੇਟਰਾਂ ਦੇ ਸੰਬੰਧ ਵਿੱਚ, ਦ੍ਰਿਸ਼ਟੀਗਤ ਪਹੁੰਚ ਆਸਾਨ ਹੈ। ਦ੍ਰਿਸ਼ਟੀਗਤ ਪ੍ਰਕਿਰਿਆ ਪਹਿਲਾਂ ਦਿਖਾਈ ਗਈ ਹੈ, ਉਸ ਤੋਂ ਬਾਅਦ ਸੰਖਿਆਤਮਕ ਗਣਨਾਵਾਂ ਕੀਤੀਆਂ ਗਈਆਂ ਹਨ। ਤੁਹਾਨੂੰ ਆਮ ਤੌਰ 'ਤੇ ਇਹਨਾਂ ਵਿੱਚੋਂ ਸਿਰਫ ਇੱਕ ਵਿਧੀ ਦੀ ਵਰਤੋਂ ਕਰਨ ਦੀ ਲੋੜ ਹੋਵੇਗੀ।
8. ਉਦਾਹਰਨ 12.11
9. ਸਮੱਸਿਆ
10. ਤੀਜੇ ਇਮਤਿਹਾਨ/ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਦੇ ਉਦਾਹਰਨ ਵਿੱਚ, ਤੁਸੀਂ ਇਹ ਨਿਰਧਾਰਤ ਕਰ ਸਕਦੇ ਹੋ ਕਿ ਕੀ ਕੋਈ ਆਊਟਲਾਇਰ ਹੈ। ਜੇਕਰ ਕੋਈ ਆਊਟਲਾਇਰ ਹੈ, ਤਾਂ ਇੱਕ ਕਸਰਤ ਵਜੋਂ, ਇਸਨੂੰ ਹਟਾਓ ਅਤੇ ਬਾਕੀ ਡਾਟਾ ਨੂੰ ਇੱਕ ਨਵੀਂ ਰੇਖਾ 'ਤੇ ਫਿੱਟ ਕਰੋ। ਇਸ ਉਦਾਹਰਨ ਲਈ, ਨਵੀਂ ਰੇਖਾ ਨੂੰ ਬਾਕੀ ਡਾਟਾ ਨੂੰ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਫਿੱਟ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ SSE (ਗਲਤੀਆਂ ਦਾ ਵਰਗ ਜੋੜ) ਛੋਟਾ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ 1 ਜਾਂ –1 ਦੇ ਨੇੜੇ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ।
11. ਹੱਲ
12. ਆਊਟਲਾਇਰਾਂ ਦੀ ਦ੍ਰਿਸ਼ਟੀਗਤ ਪਛਾਣ
13. ਜਿਵੇਂ ਅਸੀਂ ਰਿਗਰੈਸ਼ਨ ਰੇਖਾ ਦੇ ਸਮੀਕਰਨ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਨਾਲ ਕੀਤਾ ਸੀ, ਅਸੀਂ ਇਸ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਦੀ ਗਣਨਾ ਆਪਣੇ ਲਈ ਕਰਨ ਲਈ ਤਕਨਾਲੋਜੀ ਦੀ ਵਰਤੋਂ ਕਰਾਂਗੇ। LinRegTTest ਦੀ ਵਰਤੋਂ ਇਹਨਾਂ ਡਾਟਾ ਨਾਲ ਕਰਦੇ ਹੋਏ, s = 16.412 ਲੱਭਣ ਲਈ ਆਉਟਪੁੱਟ ਸਕ੍ਰੀਨਾਂ ਰਾਹੀਂ ਸਕ੍ਰੋਲ ਕਰੋ।
14. ਲਾਈਨ Y2 = –173.5 + 4.83x – 2(16.4), ਅਤੇ ਲਾਈਨ Y3 = –173.5 + 4.83x + 2(16.4), ਜਿੱਥੇ ŷ = –173.5 + 4.83x ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਹੈ। Y2 ਅਤੇ Y3 ਦੀ ਢਲਾਣ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਦੇ ਸਮਾਨ ਹੈ।
15. ਸਕੈਟਰ ਪਲਾਟ ਨੂੰ ਸਮੀਕਰਨ Y1 ਵਿੱਚ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਨਾਲ ਗ੍ਰਾਫ ਕਰੋ, ਫਿਰ Y= ਸਮੀਕਰਨ ਸੰਪਾਦਕ ਵਿੱਚ Y2 ਅਤੇ Y3 ਨੂੰ ਦੋ ਵਾਧੂ ਰੇਖਾਵਾਂ ਵਜੋਂ ਦਾਖਲ ਕਰੋ। ਇੱਕ ਚੰਗਾ ਦ੍ਰਿਸ਼ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ZOOM-9 ਦਬਾਓ। ਤੁਸੀਂ ਦੇਖੋਗੇ ਕਿ ਇੱਕੋ ਇੱਕ ਪੁਆਇੰਟ ਜੋ Y2 ਅਤੇ Y3 ਦੇ ਵਿਚਕਾਰ ਨਹੀਂ ਹੈ, ਉਹ ਪੁਆਇੰਟ (65, 175) ਹੈ। ਕੈਲਕੂਲੇਟਰ ਸਕ੍ਰੀਨ ਤੇ, ਇਹ ਇਨ੍ਹਾਂ ਰੇਖਾਵਾਂ ਤੋਂ ਬਹੁਤ ਬਾਹਰ ਹੈ, ਪਰ ਇਸਨੂੰ ਇੱਕ ਆਊਟਲਾਇਰ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ ਕਿਉਂਕਿ ਇਹ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਤੋਂ ਦੋ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨਾਂ ਤੋਂ ਵੱਧ ਦੂਰ ਹੈ। ਆਊਟਲਾਇਰ ਉਹ ਵਿਦਿਆਰਥੀ ਹੈ ਜਿਸ ਨੇ ਤੀਜੇ ਇਮਤਿਹਾਨ ਵਿੱਚ 65 ਅਤੇ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਵਿੱਚ 175 ਗ੍ਰੇਡ ਪ੍ਰਾਪਤ ਕੀਤਾ ਸੀ।
16. ਕਈ ਵਾਰ ਇੱਕ ਪੁਆਇੰਟ ਗ੍ਰਾਫ ਤੇ ਆਊਟਲਾਇਰਾਂ ਨੂੰ ਫਲੈਗ ਕਰਨ ਲਈ ਵਰਤੀਆਂ ਜਾਂਦੀਆਂ ਰੇਖਾਵਾਂ ਦੇ ਇੰਨਾ ਨੇੜੇ ਹੁੰਦਾ ਹੈ ਕਿ ਇਹ ਦੱਸਣਾ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ ਕਿ ਪੁਆਇੰਟ ਰੇਖਾਵਾਂ ਦੇ ਵਿਚਕਾਰ ਹੈ ਜਾਂ ਬਾਹਰ। ਕੰਪਿਊਟਰ ਤੇ, ਗ੍ਰਾਫ ਨੂੰ ਵੱਡਾ ਕਰਨ ਨਾਲ ਮਦਦ ਮਿਲ ਸਕਦੀ ਹੈ; ਇੱਕ ਛੋਟੀ ਕੈਲਕੂਲੇਟਰ ਸਕ੍ਰੀਨ ਤੇ, ਜ਼ੂਮ ਇਨ ਕਰਨ ਨਾਲ ਗ੍ਰਾਫ ਸਪੱਸ਼ਟ ਹੋ ਸਕਦਾ ਹੈ। ਨੋਟ ਕਰੋ ਕਿ ਜਦੋਂ ਗ੍ਰਾਫ ਕਾਫੀ ਸਪੱਸ਼ਟ ਤਸਵੀਰ ਨਹੀਂ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਆਊਟਲਾਇਰਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ ਸੰਖਿਆਤਮਕ ਤੁਲਨਾਵਾਂ ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹੋ।
17. ਕੋਸ਼ਿਸ਼ ਕਰੋ 12.11
18. ਸਕੈਟਰ ਪਲਾਟ ਵਿੱਚ ਸੰਭਾਵੀ ਆਊਟਲਾਇਰ ਦੀ ਪਛਾਣ ਕਰੋ। ਬਕਾਇਆ, ਜਾਂ ਗਲਤੀਆਂ, ਦਾ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਲਗਭਗ 8.6 ਹੈ।
19. ਆਊਟਲਾਇਰਾਂ ਦੀ ਸੰਖਿਆਤਮਕ ਪਛਾਣ
20. ਟੇਬਲ 12.6 ਵਿੱਚ, ਪਹਿਲੇ ਦੋ ਕਾਲਮ ਤੀਜੇ ਇਮਤਿਹਾਨ ਅਤੇ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਦੇ ਡਾਟਾ ਨੂੰ ਸ਼ਾਮਲ ਕਰਦੇ ਹਨ। ਤੀਜਾ ਕਾਲਮ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਤੋਂ ਗਣਨਾ ਕੀਤੇ ਗਏ ਅਨੁਮਾਨਿਤ ŷ ਮੁੱਲਾਂ ਨੂੰ ਦਿਖਾਉਂਦਾ ਹੈ: ŷ = –173.5 + 4.83x। ਬਕਾਇਆ, ਜਾਂ ਗਲਤੀਆਂ, ਜਿਨ੍ਹਾਂ ਦਾ ਇਸ ਅਧਿਆਇ ਦੇ ਭਾਗ 3 ਵਿੱਚ ਜ਼ਿਕਰ ਕੀਤਾ ਗਿਆ ਹੈ, ਟੇਬਲ ਦੇ ਚੌਥੇ ਕਾਲਮ ਵਿੱਚ ਗਣਨਾ ਕੀਤੀ ਗਈ ਹੈ: ਦੇਖਿਆ ਗਿਆ y ਮੁੱਲ – ਅਨੁਮਾਨਿਤ y ਮੁੱਲ = y – ŷ।
1. s ਸਾਰੇ y – ŷ = ε ਮੁੱਲਾਂ ਦਾ ਮਿਆਰੀ ਵਿਗਾੜ ਹੈ, ਜਿੱਥੇ n ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਦੀ ਕੁੱਲ ਗਿਣਤੀ ਹੈ। ਜੇ ਹਰ ਇੱਕ ਬਾਕੀ ਰਹਿੰਦੇ ਮੁੱਲ ਦੀ ਗਣਨਾ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਵਰਗ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਨਤੀਜਿਆਂ ਨੂੰ ਜੋੜਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਸਾਨੂੰ SSE ਮਿਲਦਾ ਹੈ। ਬਾਕੀ ਰਹਿੰਦੇ ਮੁੱਲਾਂ ਦਾ ਮਿਆਰੀ ਵਿਗਾੜ SSE ਤੋਂ ਇਸ ਤਰ੍ਹਾਂ ਗਿਣਿਆ ਜਾਂਦਾ ਹੈ
2. ਨੋਟ
3. ਅਸੀਂ (n – 2) ਨਾਲ ਭਾਗ ਕਰਦੇ ਹਾਂ ਕਿਉਂਕਿ ਰਿਗਰੈਸ਼ਨ ਮਾਡਲ ਵਿੱਚ ਦੋ ਅਨੁਮਾਨ ਸ਼ਾਮਲ ਹੁੰਦੇ ਹਨ।
4. s ਦਾ ਮੁੱਲ ਆਪਣੇ ਆਪ ਗਿਣਨ ਦੀ ਬਜਾਏ, ਅਸੀਂ ਕੰਪਿਊਟਰ ਜਾਂ ਕੈਲਕੂਲੇਟਰ ਦੀ ਵਰਤੋਂ ਕਰਕੇ s ਲੱਭ ਸਕਦੇ ਹਾਂ। ਇਸ ਉਦਾਹਰਨ ਲਈ, ਕੈਲਕੂਲੇਟਰ ਫੰਕਸ਼ਨ LinRegTTest ਨੇ ਬਾਕੀ ਰਹਿੰਦੇ ਮੁੱਲਾਂ 35; –17; 16; –6; –19; 9; 3; –1; –10; –9; –1 ਦਾ ਮਿਆਰੀ ਵਿਗਾੜ s = 16.4 ਪਾਇਆ।
5. ਕਤਾਰ: x | y | ŷ | y – ŷ
6. ਕਤਾਰ: 65 | 175 | 140 | 175 – 140 = 35
7. ਕਤਾਰ: 67 | 133 | 150 | 133 – 150= –17
8. ਕਤਾਰ: 71 | 185 | 169 | 185 – 169 = 16
9. ਕਤਾਰ: 71 | 163 | 169 | 163 – 169 = –6
10. ਕਤਾਰ: 66 | 126 | 145 | 126 – 145 = –19
11. ਕਤਾਰ: 75 | 198 | 189 | 198 – 189 = 9
12. ਕਤਾਰ: 67 | 153 | 150 | 153 – 150 = 3
13. ਕਤਾਰ: 70 | 163 | 164 | 163 – 164 = –1
14. ਕਤਾਰ: 71 | 159 | 169 | 159 – 169 = –10
15. ਕਤਾਰ: 69 | 151 | 160 | 151 – 160 = –9
16. ਕਤਾਰ: 69 | 159 | 160 | 159 – 160 = –1
17. ਅਸੀਂ ਉਹਨਾਂ ਸਾਰੇ ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਦੀ ਭਾਲ ਕਰ ਰਹੇ ਹਾਂ ਜਿਨ੍ਹਾਂ ਲਈ ਬਾਕੀ ਰਹਿੰਦਾ ਮੁੱਲ 2s = 2(16.4) = 32.8 ਤੋਂ ਵੱਧ ਹੈ ਜਾਂ –32.8 ਤੋਂ ਘੱਟ ਹੈ। ਇਹਨਾਂ ਮੁੱਲਾਂ ਦੀ ਤੁਲਨਾ ਟੇਬਲ ਦੇ ਚੌਥੇ ਕਾਲਮ ਵਿੱਚ ਬਾਕੀ ਰਹਿੰਦੇ ਮੁੱਲਾਂ ਨਾਲ ਕਰੋ। ਅਜਿਹਾ ਇਕੋ ਡਾਟਾ ਪੁਆਇੰਟ ਉਹ ਵਿਦਿਆਰਥੀ ਹੈ ਜਿਸਨੂੰ ਤੀਜੇ ਇਮਤਿਹਾਨ ਵਿੱਚ 65 ਗ੍ਰੇਡ ਅਤੇ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਵਿੱਚ 175 ਪ੍ਰਾਪਤ ਹੋਇਆ ਸੀ; ਇਸ ਵਿਦਿਆਰਥੀ ਲਈ ਬਾਕੀ ਰਹਿੰਦਾ ਮੁੱਲ 35 ਹੈ।
18. ਆਊਟਲਾਇਰ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਲਾਈਨ ਨੂੰ ਕਿਵੇਂ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ?
19. ਸੰਖਿਆਤਮਕ ਅਤੇ ਗ੍ਰਾਫੀਕਲ ਤੌਰ 'ਤੇ, ਅਸੀਂ ਬਿੰਦੂ (65, 175) ਨੂੰ ਇੱਕ ਆਊਟਲਾਇਰ ਵਜੋਂ ਪਛਾਣਿਆ ਹੈ। ਯਾਦ ਰੱਖੋ ਕਿ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਉਣ ਤੋਂ ਬਾਅਦ, ਲੀਸਟ-ਸਕੁਏਅਰ ਰਿਗਰੈਸ਼ਨ ਲਾਈਨ ਅਤੇ ਸਾਰਾਂਕੀ ਦੇ ਮੁੜ-ਗਣਨਾ ਦੀ ਵਰਤੋਂ ਇਹ ਨਿਰਧਾਰਤ ਕਰਨ ਲਈ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ ਕਿ ਕੀ ਕੋਈ ਆਊਟਲਾਇਰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਬਿੰਦੂ ਵੀ ਹੈ। ਇਹ ਪ੍ਰਕਿਰਿਆ ਤੁਹਾਨੂੰ ਵੇਰੀਏਬਲਾਂ ਦੇ ਸਹਿ-ਸੰਬੰਧ ਦੀ ਮਜ਼ਬੂਤੀ ਅਤੇ ਕਿਸੇ ਵੀ ਆਊਟਲਾਇਰ ਨੂੰ ਛੱਡਣ ਤੋਂ ਪਹਿਲਾਂ ਅਤੇ ਬਾਅਦ ਢਲਾਣ ਵਿੱਚ ਸੰਭਾਵੀ ਬਦਲਾਵਾਂ ਦੀ ਤੁਲਨਾ ਕਰਨ ਦੀ ਵੀ ਆਗਿਆ ਦਿੰਦੀ ਹੈ।
20. 10 ਬਾਕੀ ਰਹਿੰਦੇ ਬਿੰਦੂਆਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਇੱਕ ਨਵੀਂ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਲਾਈਨ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਦੀ ਗਣਨਾ ਕਰੋ।
21. TI-83, TI-83+, ਜਾਂ TI-84+ ਕੈਲਕੂਲੇਟਰਾਂ 'ਤੇ, L1 ਅਤੇ L2 ਤੋਂ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਓ। LinRegTTest ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ਜੋ ਕਿ Stat ਅਤੇ Tests ਦੇ ਅਧੀਨ ਪਾਇਆ ਜਾਂਦਾ ਹੈ, ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਦੀ ਨਵੀਂ ਲਾਈਨ ਹੇਠ ਲਿਖੇ ਅਨੁਸਾਰ ਹਨ:
22. ŷ =−355.19+7.39x ਅਤੇ r=0.9121।
23. ਢਲਾਣ ਹੁਣ 7.39 ਹੈ, ਜਦੋਂ ਕਿ ਪਿਛਲੀ ਢਲਾਣ 4.83 ਸੀ। ਇਹ ਮਹੱਤਵਪੂਰਨ ਜਾਪਦਾ ਹੈ, ਪਰ ਸਾਨੂੰ r-ਮੁੱਲਾਂ ਵਿੱਚ ਬਦਲਾਅ ਨੂੰ ਵੀ ਦੇਖਣ ਦੀ ਲੋੜ ਹੈ। ਨਵੀਂ ਲਾਈਨ r=0.9121 ਦਿਖਾਉਂਦੀ ਹੈ, ਜੋ ਕਿ ਅਸਲ ਲਾਈਨ, r=0.6631, ਨਾਲੋਂ ਮਜ਼ਬੂਤ ਸਹਿ-ਸੰਬੰਧ ਦਰਸਾਉਂਦੀ ਹੈ, ਕਿਉਂਕਿ r=0.9121, 1 ਦੇ ਨੇੜੇ ਹੈ। ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਨਵੀਂ ਲਾਈਨ ਡਾਟਾ ਮੁੱਲਾਂ ਲਈ ਇੱਕ ਬਿਹਤਰ ਫਿੱਟ ਹੈ। ਇਹ ਲਾਈਨ ਤੀਜੇ ਇਮਤਿਹਾਨ ਦੇ ਸਕੋਰ ਨੂੰ ਦਿੱਤੇ ਗਏ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਦੇ ਸਕੋਰ ਦੀ ਬਿਹਤਰ ਭਵਿੱਖਬਾਣੀ ਕਰ ਸਕਦੀ ਹੈ। ਇਸਦਾ ਮਤਲਬ ਇਹ ਵੀ ਹੈ ਕਿ (65, 175) ਦਾ ਆਊਟਲਾਇਰ ਇੱਕ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਬਿੰਦੂ ਸੀ, ਕਿਉਂਕਿ r-ਮੁੱਲਾਂ ਵਿੱਚ ਇੱਕ ਵੱਡਾ ਅੰਤਰ ਹੈ। ਸਾਨੂੰ ਹੁਣ ਇਹ ਫੈਸਲਾ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਕੀ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਉਣਾ ਹੈ। ਜੇ ਆਊਟਲਾਇਰ ਗਲਤੀ ਨਾਲ ਦਰਜ ਕੀਤਾ ਗਿਆ ਸੀ, ਤਾਂ ਇਸਨੂੰ ਯਕੀਨਨ ਹਟਾ ਦੇਣਾ ਚਾਹੀਦਾ ਹੈ। ਕਿਉਂਕਿ ਇਹ ਸਹਿ-ਸੰਬੰਧ 'ਤੇ ਇੰਨਾ ਡੂੰਘਾ ਪ੍ਰਭਾਵ ਪੈਦਾ ਕਰਦਾ ਹੈ, ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਦੀ ਨਵੀਂ ਲਾਈਨ ਬਿਹਤਰ ਭਵਿੱਖਬਾਣੀ ਅਤੇ ਇੱਕ ਸਮੁੱਚੇ ਤੌਰ 'ਤੇ ਮਜ਼ਬੂਤ ਮਾਡਲ ਦੀ ਆਗਿਆ ਦਿੰਦੀ ਹੈ।
24. ਤੁਸੀਂ ਦੋ ਲੀਸਟ-ਸਕੁਏਅਰ ਰਿਗਰੈਸ਼ਨ ਲਾਈਨਾਂ ਨੂੰ ਗ੍ਰਾਫ ਕਰਨ ਅਤੇ ਲਾਈਨਾਂ ਦੀਆਂ ਢਲਾਣਾਂ ਅਤੇ ਡਾਟਾ ਲਈ ਫਿੱਟ ਦੀ ਤੁਲਨਾ ਕਰਨ ਲਈ Excel ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹੋ, ਜਿਵੇਂ ਕਿ ਚਿੱਤਰ 12.17 ਵਿੱਚ ਦਿਖਾਇਆ ਗਿਆ ਹੈ।
You can see that the second graph shows less deviation from the line of best fit. It is clear that omission of the influential point produced a line of best fit that more closely models the data.
Numerical Identification of Outliers: Calculating s and Finding Outliers Manually
If you do not have the function LinRegTTest on your calculator, then you must calculate the outlier in the first example by doing the following. First, square each |y – ŷ|.
The squares are 352; 172; 162; 62; 192; 92; 32; 12; 102; 92; 12.
Then, add (sum) all the |y – ŷ| squared terms using the formula
Σ i = 1 11 ( | y i − ŷ i | ) 2 = Σ i = 1 11 ε i 2 Σ i = 1 11 ( | y i − ŷ i | ) 2 = Σ i = 1 11 ε i 2 (Recall that yi – ŷi = εi).
= 352 + 172 + 162 + 62 + 192 + 92 + 32 + 12 + 102 + 92 + 12
= 2,440 = SSE.
The result, SSE, is the sum of squared errors.
Next, calculate s, the standard deviation of all the y – ŷ = ε-values where n = the total number of data points.
The calculation is s= SSE n–2 s= SSE n–2.
For the third exam/final exam example, s= 2440 11–2 =16.47. s= 2440 11–2 =16.47.
Next, multiply s by 2: (2)(16.47) = 32.94 32.94 is two standard deviations away from the mean of the y – ŷ values.
If we were to measure the vertical distance from any data point to the corresponding point on the line of best fit and that distance is at least 2s, then we would consider the data point to be too far from the line of best fit. We call that point a potential outlier.
For the example, if any of the |y – ŷ| values are at least 32.94, the corresponding (x, y) data point is a potential outlier.
For the third exam/final exam example, all the |y – ŷ| values are less than 31.29 except for the first one, which is 35:
35 > 31.29. That is, |y – ŷ| ≥ (2)(s).
The point that corresponds to |y – ŷ| = 35 is (65, 175). Therefore, the data point (65, 175) is a potential outlier. For this example, we will delete it. (Remember, we do not always delete an outlier.)
Note
When outliers are deleted, the researcher should either record that data were deleted, and why, or the researcher should provide results both with and without the deleted data. If data are erroneous and the correct values are known (e.g., student 1 actually scored a 70 instead of a 65), then this correction can be made to the data.
The next step is to compute a new best-fit line using the 10 remaining points. The new line of best fit and the correlation coefficient are
ŷ = –355.19 + 7.39x and r = .9121.
Example 12.12
Problem
1. ਇਸ ਨਵੀਂ ਬਿਹਤਰੀਨ ਫਿੱਟ ਲਾਈਨ (ਤੀਜੇ ਇਮਤਿਹਾਨ/ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਉਦਾਹਰਨ ਵਿੱਚ ਬਾਕੀ 10 ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਦੇ ਆਧਾਰ ਤੇ) ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ਤੀਜੇ ਇਮਤਿਹਾਨ ਵਿੱਚ 73 ਅੰਕ ਪ੍ਰਾਪਤ ਕਰਨ ਵਾਲਾ ਵਿਦਿਆਰਥੀ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਵਿੱਚ ਕਿੰਨੇ ਅੰਕ ਪ੍ਰਾਪਤ ਕਰਨ ਦੀ ਉਮੀਦ ਕਰੇਗਾ? ਕੀ ਇਹ ਉਸ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮਾਨ ਹੈ ਜੋ ਮੂਲ ਲਾਈਨ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤੀ ਗਈ ਸੀ?
2. ਹੱਲ
3. ਬਿਹਤਰੀਨ ਫਿੱਟ ਦੀ ਨਵੀਂ ਲਾਈਨ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ŷ = –355.19 + 7.39(73) = 184.28। ਤੀਜੇ ਇਮਤਿਹਾਨ ਵਿੱਚ 73 ਅੰਕ ਪ੍ਰਾਪਤ ਕਰਨ ਵਾਲਾ ਵਿਦਿਆਰਥੀ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਵਿੱਚ 184 ਅੰਕ ਪ੍ਰਾਪਤ ਕਰਨ ਦੀ ਉਮੀਦ ਕਰੇਗਾ। ਮੂਲ ਲਾਈਨ ਨੇ ਭਵਿੱਖਬਾਣੀ ਕੀਤੀ ਸੀ ਕਿ ŷ = –173.51 + 4.83(73) = 179.08, ਇਸ ਲਈ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾ ਕੇ ਨਵੀਂ ਲਾਈਨ ਨਾਲ ਕੀਤੀ ਗਈ ਭਵਿੱਖਬਾਣੀ ਮੂਲ ਭਵਿੱਖਬਾਣੀ ਤੋਂ ਵੱਖਰੀ ਹੈ।
4. ਇਸਨੂੰ ਅਜ਼ਮਾਓ 12.12
5. ਤੀਜੇ ਇਮਤਿਹਾਨ/ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਉਦਾਹਰਨ ਤੋਂ ਗ੍ਰਾਫ ਲਈ ਡਾਟਾ ਪੁਆਇੰਟ ਹੇਠ ਲਿਖੇ ਅਨੁਸਾਰ ਹਨ: (1, 5), (2, 7), (2, 6), (3, 9), (4, 12), (4, 13), (5, 18), (6, 19), (7, 12), ਅਤੇ (7, 21)। ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਓ ਅਤੇ ਬਿਹਤਰੀਨ ਫਿੱਟ ਲਾਈਨ ਦੀ ਮੁੜ ਗਣਨਾ ਕਰੋ। ਜਦੋਂ x = 10 ਹੋਵੇ ਤਾਂ ŷ ਦਾ ਮੁੱਲ ਪਤਾ ਕਰੋ।
6. ਉਦਾਹਰਨ 12.13
7. ਖਪਤਕਾਰ ਮੁੱਲ ਸੂਚਕਾਂਕ (CPI) ਖਪਤਕਾਰਾਂ ਦੁਆਰਾ ਖਪਤਕਾਰ ਵਸਤਾਂ ਅਤੇ ਸੇਵਾਵਾਂ ਲਈ ਅਦਾ ਕੀਤੇ ਗਏ ਮੁੱਲਾਂ ਵਿੱਚ ਸਮੇਂ ਦੇ ਨਾਲ ਔਸਤ ਤਬਦੀਲੀ ਨੂੰ ਮਾਪਦਾ ਹੈ। CPI ਲਗਭਗ ਸਾਰੇ ਅਮਰੀਕੀਆਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ ਕਿਉਂਕਿ ਇਸਦੇ ਬਹੁਤ ਸਾਰੇ ਉਪਯੋਗ ਹਨ। ਇਸਦੇ ਸਭ ਤੋਂ ਵੱਡੇ ਉਪਯੋਗਾਂ ਵਿੱਚੋਂ ਇੱਕ ਮਹਿੰਗਾਈ ਦੇ ਮਾਪ ਵਜੋਂ ਹੈ। ਦੇਸ਼ ਦੀ ਆਰਥਿਕਤਾ ਵਿੱਚ ਮੁੱਲ ਤਬਦੀਲੀਆਂ ਬਾਰੇ ਸਰਕਾਰ, ਕਾਰੋਬਾਰਾਂ ਅਤੇ ਕਿਰਤ ਬਲਾਂ ਨੂੰ ਜਾਣਕਾਰੀ ਪ੍ਰਦਾਨ ਕਰਕੇ, CPI ਉਹਨਾਂ ਨੂੰ ਆਰਥਿਕ ਫੈਸਲੇ ਲੈਣ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ। ਰਾਸ਼ਟਰਪਤੀ, ਯੂ.ਐਸ. ਕਾਂਗਰਸ, ਅਤੇ ਫੈਡਰਲ ਰਿਜ਼ਰਵ ਬੋਰਡ ਮੁਦਰਾ ਅਤੇ ਵਿੱਤੀ ਨੀਤੀਆਂ ਬਣਾਉਣ ਲਈ CPI ਰੁਝਾਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ। ਹੇਠ ਲਿਖੀ ਸਾਰਣੀ ਵਿੱਚ, x ਸਾਲ ਹੈ ਅਤੇ y CPI ਹੈ।
8. ਕਤਾਰ: x | y | x | y
9. ਕਤਾਰ: 1915 | 10.1 | 1969 | 36.7
10. ਕਤਾਰ: 1926 | 17.7 | 1975 | 49.3
11. ਕਤਾਰ: 1935 | 13.7 | 1979 | 72.6
12. ਕਤਾਰ: 1940 | 14.7 | 1980 | 82.4
13. ਕਤਾਰ: 1947 | 24.1 | 1986 | 109.6
14. ਕਤਾਰ: 1952 | 26.5 | 1991 | 130.7
15. ਕਤਾਰ: 1964 | 31.0 | 1999 | 166.6
16. ਸਮੱਸਿਆ
17. ਡਾਟਾ ਦਾ ਸਕੈਟਰ ਪਲਾਟ ਬਣਾਓ।
18. ਘੱਟੋ-ਘੱਟ-ਵਰਗ ਲਾਈਨ ਦੀ ਗਣਨਾ ਕਰੋ। ਸਮੀਕਰਨ ਨੂੰ ŷ = a + bx ਦੇ ਰੂਪ ਵਿੱਚ ਲਿਖੋ।
19. ਸਕੈਟਰ ਪਲਾਟ 'ਤੇ ਲਾਈਨ ਬਣਾਓ।
20. ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਪਤਾ ਕਰੋ। ਕੀ ਇਹ ਮਹੱਤਵਪੂਰਨ ਹੈ?
21. ਸਾਲ 1990 ਲਈ ਔਸਤ CPI ਕੀ ਹੈ?
22. ਹੱਲ
23. ਚਿੱਤਰ 12.18 ਦੇਖੋ।
24. ਸਾਡੇ ਕੈਲਕੂਲੇਟਰ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ŷ = –3204 + 1.662x ਬਿਹਤਰੀਨ ਫਿੱਟ ਲਾਈਨ ਦਾ ਸਮੀਕਰਨ ਹੈ।
1. ਚਿੱਤਰ 12.18 ਵੇਖੋ।
2. r = 0.8694। ਅੰਕੜਿਆਂ ਦੀ ਗਿਣਤੀ n = 14 ਹੈ। ਅਧਿਆਇ 12 ਦੇ ਅੰਤ ਵਿੱਚ ਨਮੂਨਾ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਦੇ 95 ਪ੍ਰਤੀਸ਼ਤ ਕ੍ਰਿਟੀਕਲ ਮੁੱਲਾਂ ਵਾਲੀ ਸਾਰਣੀ ਦੀ ਵਰਤੋਂ ਕਰੋ: ਇਸ ਮਾਮਲੇ ਵਿੱਚ, df = 12 ਹੈ। ਸਾਰਣੀ ਤੋਂ ਸੰਬੰਧਿਤ ਕ੍ਰਿਟੀਕਲ ਮੁੱਲ ±0.532 ਹਨ। ਕਿਉਂਕਿ 0.8694 > 0.532, r ਮਹੱਤਵਪੂਰਨ ਹੈ। ਅਸੀਂ ਉੱਪਰ ਲੱਭੀ ਗਈ ਅਨੁਮਾਨਿਤ ਰਿਗਰੈਸ਼ਨ ਲਾਈਨ ਦੀ ਵਰਤੋਂ x = 1990 ਲਈ ਅਨੁਮਾਨ ਲਗਾਉਣ ਲਈ ਕਰ ਸਕਦੇ ਹਾਂ।
3. ŷ = –3204 + 1.662(1990) = 103.4 CPI।
4. ਨੋਟ
5. ਉਦਾਹਰਨ ਵਿੱਚ, ਲਾਈਨ ਦੇ ਮੁਕਾਬਲੇ ਬਿੰਦੂਆਂ ਦੇ ਪੈਟਰਨ ਵੱਲ ਧਿਆਨ ਦਿਓ। ਭਾਵੇਂ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਮਹੱਤਵਪੂਰਨ ਹੈ, ਸਕੈਟਰ ਪਲਾਟ ਵਿੱਚ ਪੈਟਰਨ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਲਾਈਨ ਦੀ ਬਜਾਏ ਇੱਕ ਵਕਰ (curve) ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਵਧੇਰੇ ਢੁਕਵਾਂ ਮਾਡਲ ਹੋਵੇਗਾ। ਇਸ ਉਦਾਹਰਨ ਵਿੱਚ, ਇੱਕ ਅੰਕੜਾ ਵਿਗਿਆਨੀ ਸਾਡੇ ਦੁਆਰਾ ਲੱਭੀ ਗਈ ਲਾਈਨ ਨਾਲ ਅੰਕੜਿਆਂ ਦਾ ਮਾਡਲ ਬਣਾਉਣ ਦੀ ਬਜਾਏ, ਇਹਨਾਂ ਅੰਕੜਿਆਂ ਲਈ ਇੱਕ ਵਕਰ ਫਿੱਟ ਕਰਨ ਲਈ ਹੋਰ ਤਰੀਕਿਆਂ ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਪਸੰਦ ਕਰੇਗਾ। ਗਣਨਾਵਾਂ ਕਰਨ ਤੋਂ ਇਲਾਵਾ, ਜਦੋਂ ਇਹ ਫੈਸਲਾ ਕਰਨਾ ਹੋਵੇ ਕਿ ਕੀ ਇੱਕ ਰੇਖੀ ਮਾਡਲ ਢੁਕਵਾਂ ਹੈ, ਤਾਂ ਸਕੈਟਰ ਪਲਾਟ ਨੂੰ ਵੇਖਣਾ ਹਮੇਸ਼ਾ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ।
6. ਜੇਕਰ ਤੁਸੀਂ ਅੰਕੜਿਆਂ ਦੇ ਹੋਰ ਸਾਲਾਂ ਨੂੰ ਵੇਖਣ ਵਿੱਚ ਦਿਲਚਸਪੀ ਰੱਖਦੇ ਹੋ, ਤਾਂ ਬਿਊਰੋ ਆਫ਼ ਲੇਬਰ ਸਟੈਟਿਸਟਿਕਸ CPI ਵੈੱਬਸਾਈਟ (ftp://ftp.bls.gov/pub/special.requests/cpi/cpiai.txt) 'ਤੇ ਜਾਓ। ਸਾਡੇ ਅੰਕੜੇ ਸਾਲਾਨਾ ਔਸਤ (ਸੱਜੇ ਤੋਂ ਤੀਜਾ ਕਾਲਮ) ਕਾਲਮ ਤੋਂ ਲਏ ਗਏ ਹਨ। ਉਦਾਹਰਨ ਲਈ, ਤੁਸੀਂ ਹੋਰ ਮੌਜੂਦਾ ਸਾਲਾਂ ਦੇ ਅੰਕੜੇ ਜੋੜ ਸਕਦੇ ਹੋ। ਨਵੇਂ ਸਾਲਾਂ ਨੂੰ ਜੋੜਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੋ: 2004, CPI = 188.9; 2008, CPI = 215.3; ਅਤੇ 2011, CPI = 224.9। ਵੇਖੋ ਕਿ ਇਹ ਮਾਡਲ ਨੂੰ ਕਿਵੇਂ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ। (ਚੈੱਕ ਕਰੋ: ŷ = –4436 + 2.295x; r = 0.9018। ਕੀ r ਮਹੱਤਵਪੂਰਨ ਹੈ? ਕੀ ਨਵੇਂ ਬਿੰਦੂਆਂ ਦੇ ਜੋੜ ਨਾਲ ਫਿੱਟ ਬਿਹਤਰ ਹੈ?)
7. ਇਸਨੂੰ ਅਜ਼ਮਾਓ 12.13
8. ਹੇਠਾਂ ਦਿੱਤੀ ਸਾਰਣੀ ਪ੍ਰਤੀ ਵਿਅਕਤੀ ਆਮਦਨ (PCINC) ਵਿੱਚ ਮਾਪੀ ਗਈ ਆਰਥਿਕ ਵਿਕਾਸ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ।
9. ਕਤਾਰ: ਸਾਲ | PCINC | ਸਾਲ | PCINC
10. ਕਤਾਰ: 1870 | 340 | 1920 | 1,050
11. ਕਤਾਰ: 1880 | 499 | 1930 | 1,170
12. ਕਤਾਰ: 1890 | 592 | 1940 | 1,364
13. ਕਤਾਰ: 1900 | 757 | 1950 | 1,836
14. ਕਤਾਰ: 1910 | 927 | 1960 | 2,132
15. ਸੁਤੰਤਰ ਅਤੇ ਨਿਰਭਰ ਵੇਰੀਏਬਲ ਕੀ ਹਨ?
16. ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ ਬਣਾਓ।
17. ਵਧੀਆ ਫਿੱਟ ਦੀ ਲਾਈਨ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਲੱਭਣ ਲਈ ਰਿਗਰੈਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕਰੋ।
18. ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਦੇ ਮਹੱਤਵ ਦੀ ਵਿਆਖਿਆ ਕਰੋ।
19. ਕੀ ਵੇਰੀਏਬਲਾਂ ਵਿਚਕਾਰ ਕੋਈ ਰੇਖੀ ਸਬੰਧ ਹੈ?
20. ਨਿਰਧਾਰਨ ਦੇ ਗੁਣਾਂਕ (coefficient of determination) ਦਾ ਪਤਾ ਲਗਾਓ ਅਤੇ ਇਸਦੀ ਵਿਆਖਿਆ ਕਰੋ।
21. ਰਿਗਰੈਸ਼ਨ ਸਮੀਕਰਨ ਦਾ ਢਲਾਣ (slope) ਕੀ ਹੈ? ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ?
22. 1900 ਅਤੇ 2000 ਲਈ PCINC ਦਾ ਅਨੁਮਾਨ ਲਗਾਉਣ ਲਈ ਵਧੀਆ ਫਿੱਟ ਦੀ ਲਾਈਨ ਦੀ ਵਰਤੋਂ ਕਰੋ।
23. ਨਿਰਧਾਰਤ ਕਰੋ ਕਿ ਕੀ ਕੋਈ ਆਊਟਲਾਇਰ (outliers) ਹਨ।
24. ਸੈਂਪਲ ਕੋਰੀਲੇਸ਼ਨ ਕੋਫੀਸ਼ੀਐਂਟ ਟੇਬਲ ਦੇ 95 ਪ੍ਰਤੀਸ਼ਤ ਕ੍ਰਿਟੀਕਲ ਮੁੱਲ
1. ਕਤਾਰ: ਸੁਤੰਤਰਤਾ ਦੀਆਂ ਡਿਗਰੀਆਂ: n – 2 | ਕ੍ਰਿਟੀਕਲ ਮੁੱਲ: + ਅਤੇ –
2. ਕਤਾਰ: 1 | 0.997
3. ਕਤਾਰ: 2 | 0.950
4. ਕਤਾਰ: 3 | 0.878
5. ਕਤਾਰ: 4 | 0.811
6. ਕਤਾਰ: 5 | 0.754
7. ਕਤਾਰ: 6 | 0.707
8. ਕਤਾਰ: 7 | 0.666
9. ਕਤਾਰ: 8 | 0.632
10. ਕਤਾਰ: 9 | 0.602
11. ਕਤਾਰ: 10 | 0.576
12. ਕਤਾਰ: 11 | 0.555
13. ਕਤਾਰ: 12 | 0.532
14. ਕਤਾਰ: 13 | 0.514
15. ਕਤਾਰ: 14 | 0.497
16. ਕਤਾਰ: 15 | 0.482
17. ਕਤਾਰ: 16 | 0.468
18. ਕਤਾਰ: 17 | 0.456
19. ਕਤਾਰ: 18 | 0.444
20. ਕਤਾਰ: 19 | 0.433
21. ਕਤਾਰ: 20 | 0.423
22. ਕਤਾਰ: 21 | 0.413
23. ਕਤਾਰ: 22 | 0.404
24. ਕਤਾਰ: 23 | 0.396
ਸਤਰ: 24 | 0.388
ਸਤਰ: 25 | 0.381
ਸਤਰ: 26 | 0.374
ਸਤਰ: 27 | 0.367
ਸਤਰ: 28 | 0.361
ਸਤਰ: 29 | 0.355
ਸਤਰ: 30 | 0.349
ਸਤਰ: 40 | 0.304
ਸਤਰ: 50 | 0.273
ਸਤਰ: 60 | 0.250
ਸਤਰ: 70 | 0.232
ਸਤਰ: 80 | 0.217
ਸਤਰ: 90 | 0.205
ਸਤਰ: 100 | 0.195