1. ਕੁਝ ਡਾਟਾ ਸੈੱਟਾਂ ਵਿੱਚ, ਆਊਟਲਾਇਰ (outliers) ਨਾਮਕ ਮੁੱਲ (ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟ) ਹੁੰਦੇ ਹਨ। ਆਊਟਲਾਇਰ ਉਹ ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟ ਹੁੰਦੇ ਹਨ ਜੋ ਲੀਸਟ ਸਕੁਏਅਰ ਲਾਈਨ ਤੋਂ ਦੂਰ ਹੁੰਦੇ ਹਨ। ਉਨ੍ਹਾਂ ਦੇ ਵੱਡੇ "ਗਲਤੀ" (errors) ਹੁੰਦੇ ਹਨ, ਜਿੱਥੇ "ਗਲਤੀ" ਜਾਂ ਰੈਜ਼ੀਡਿਊਅਲ (residual) ਲਾਈਨ ਤੋਂ ਪੁਆਇੰਟ ਤੱਕ ਦੀ ਲੰਬਕਾਰੀ ਦੂਰੀ ਹੁੰਦੀ ਹੈ।
2. ਆਊਟਲਾਇਰਾਂ ਦੀ ਨੇੜਿਓਂ ਜਾਂਚ ਕਰਨ ਦੀ ਲੋੜ ਹੈ। ਕਦੇ-ਕਦੇ, ਕਿਸੇ ਕਾਰਨ ਕਰਕੇ, ਉਨ੍ਹਾਂ ਨੂੰ ਡਾਟਾ ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ ਸ਼ਾਮਲ ਨਹੀਂ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ। ਇਹ ਸੰਭਵ ਹੈ ਕਿ ਇੱਕ ਆਊਟਲਾਇਰ ਗਲਤੀ ਡਾਟਾ ਦਾ ਨਤੀਜਾ ਹੋਵੇ। ਹੋਰ ਸਮਿਆਂ 'ਤੇ, ਇੱਕ ਆਊਟਲਾਇਰ ਅਧਿਐਨ ਅਧੀਨ ਆਬਾਦੀ ਬਾਰੇ ਕੀਮਤੀ ਜਾਣਕਾਰੀ ਰੱਖ ਸਕਦਾ ਹੈ ਅਤੇ ਡਾਟਾ ਵਿੱਚ ਸ਼ਾਮਲ ਰਹਿਣਾ ਚਾਹੀਦਾ ਹੈ। ਮੁੱਖ ਗੱਲ ਇਹ ਹੈ ਕਿ ਧਿਆਨ ਨਾਲ ਜਾਂਚ ਕੀਤੀ ਜਾਵੇ ਕਿ ਡਾਟਾ ਪੁਆਇੰਟ ਆਊਟਲਾਇਰ ਕਿਉਂ ਬਣਦਾ ਹੈ।
3. ਆਊਟਲਾਇਰਾਂ ਤੋਂ ਇਲਾਵਾ, ਇੱਕ ਨਮੂਨੇ ਵਿੱਚ ਇੱਕ ਜਾਂ ਕੁਝ ਪੁਆਇੰਟ ਹੋ ਸਕਦੇ ਹਨ ਜਿਨ੍ਹਾਂ ਨੂੰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ (influential points) ਕਿਹਾ ਜਾਂਦਾ ਹੈ। ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ ਉਹ ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟ ਹੁੰਦੇ ਹਨ ਜੋ ਹੋਰ ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਤੋਂ ਖਿਤਿਜੀ ਦਿਸ਼ਾ ਵਿੱਚ ਦੂਰ ਹੁੰਦੇ ਹਨ। ਇਹਨਾਂ ਪੁਆਇੰਟਾਂ ਦਾ ਰੀਗਰੈਸ਼ਨ ਲਾਈਨ ਦੇ ਢਲਾਨ 'ਤੇ ਵੱਡਾ ਪ੍ਰਭਾਵ ਪੈ ਸਕਦਾ ਹੈ। ਇੱਕ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ, ਤੁਸੀਂ ਇਸਨੂੰ ਡਾਟਾ ਸੈੱਟ ਤੋਂ ਹਟਾ ਸਕਦੇ ਹੋ ਅਤੇ ਦੇਖ ਸਕਦੇ ਹੋ ਕਿ ਕੀ ਰੀਗਰੈਸ਼ਨ ਲਾਈਨ ਦਾ ਢਲਾਨ ਮਹੱਤਵਪੂਰਨ ਤੌਰ 'ਤੇ ਬਦਲਿਆ ਹੈ।
4. ਕੰਪਿਊਟਰਾਂ ਅਤੇ ਬਹੁਤ ਸਾਰੇ ਕੈਲਕੂਲੇਟਰਾਂ ਦੀ ਵਰਤੋਂ ਡਾਟਾ ਤੋਂ ਆਊਟਲਾਇਰਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ। ਰੀਗਰੈਸ਼ਨ ਵਿਸ਼ਲੇਸ਼ਣ ਲਈ ਕੰਪਿਊਟਰ ਆਊਟਪੁੱਟ ਅਕਸਰ ਆਊਟਲਾਇਰਾਂ ਅਤੇ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟਾਂ ਦੋਵਾਂ ਦੀ ਪਛਾਣ ਕਰਦਾ ਹੈ ਤਾਂ ਜੋ ਤੁਸੀਂ ਉਨ੍ਹਾਂ ਦੀ ਜਾਂਚ ਕਰ ਸਕੋ।
5. ਆਊਟਲਾਇਰਾਂ ਦੀ ਪਛਾਣ
6. ਅਸੀਂ ਸਕੈਟਰਪਲੌਟ (scatterplot) ਅਤੇ ਬੈਸਟ ਫਿਟ-ਲਾਈਨ (best fit-line) ਦੇ ਗ੍ਰਾਫ਼ ਨੂੰ ਦੇਖ ਕੇ ਆਊਟਲਾਇਰਾਂ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾ ਸਕਦੇ ਹਾਂ। ਹਾਲਾਂਕਿ, ਅਸੀਂ ਇਸ ਬਾਰੇ ਕੁਝ ਦਿਸ਼ਾ-ਨਿਰਦੇਸ਼ ਚਾਹੁੰਦੇ ਹਾਂ ਕਿ ਕਿਸੇ ਪੁਆਇੰਟ ਨੂੰ ਆਊਟਲਾਇਰ ਮੰਨਣ ਲਈ ਕਿੰਨੀ ਦੂਰ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ। ਇੱਕ ਮੋਟੇ ਨਿਯਮ ਦੇ ਤੌਰ 'ਤੇ, ਅਸੀਂ ਕਿਸੇ ਵੀ ਪੁਆਇੰਟ ਨੂੰ ਫਲੈਗ ਕਰ ਸਕਦੇ ਹਾਂ ਜੋ ਬੈਸਟ-ਫਿਟ ਲਾਈਨ ਤੋਂ ਉੱਪਰ ਜਾਂ ਹੇਠਾਂ ਦੋ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ (standard deviations) ਤੋਂ ਵੱਧ ਦੂਰੀ 'ਤੇ ਸਥਿਤ ਹੈ। ਵਰਤਿਆ ਗਿਆ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਰੈਜ਼ੀਡਿਊਅਲ ਜਾਂ ਗਲਤੀਆਂ ਦਾ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਹੈ।
7. ਅਸੀਂ ਇਸਨੂੰ ਸਕੈਟਰ ਪਲੌਟ ਵਿੱਚ ਦੋ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਉੱਪਰ ਅਤੇ ਹੇਠਾਂ ਬੈਸਟ-ਫਿਟ ਲਾਈਨ ਦੇ ਇੱਕ ਵਾਧੂ ਜੋੜੇ ਨੂੰ ਖਿੱਚ ਕੇ ਦੇਖ ਸਕਦੇ ਹਾਂ। ਇਸ ਵਾਧੂ ਜੋੜੀ ਲਾਈਨਾਂ ਦੇ ਬਾਹਰ ਕੋਈ ਵੀ ਡਾਟਾ ਪੁਆਇੰਟ ਸੰਭਾਵੀ ਆਊਟਲਾਇਰ ਵਜੋਂ ਫਲੈਗ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਜਾਂ ਅਸੀਂ ਹਰੇਕ ਰੈਜ਼ੀਡਿਊਅਲ ਦੀ ਗਣਨਾ ਕਰਕੇ ਅਤੇ ਇਸਦੀ ਦੁੱਗਣੀ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਨਾਲ ਤੁਲਨਾ ਕਰਕੇ ਇਸਨੂੰ ਸੰਖਿਆਤਮਕ ਤੌਰ 'ਤੇ ਕਰ ਸਕਦੇ ਹਾਂ। TI-83, 83+, ਜਾਂ 84+ 'ਤੇ, ਗ੍ਰਾਫੀਕਲ ਪਹੁੰਚ ਆਸਾਨ ਹੈ। ਗ੍ਰਾਫੀਕਲ ਪ੍ਰਕਿਰਿਆ ਪਹਿਲਾਂ ਦਿਖਾਈ ਗਈ ਹੈ, ਜਿਸ ਤੋਂ ਬਾਅਦ ਸੰਖਿਆਤਮਕ ਗਣਨਾਵਾਂ ਕੀਤੀਆਂ ਗਈਆਂ ਹਨ। ਤੁਹਾਨੂੰ ਆਮ ਤੌਰ 'ਤੇ ਇਨ੍ਹਾਂ ਵਿੱਚੋਂ ਸਿਰਫ਼ ਇੱਕ ਵਿਧੀ ਦੀ ਵਰਤੋਂ ਕਰਨ ਦੀ ਲੋੜ ਹੋਵੇਗੀ।
8. ਉਦਾਹਰਨ 12.12
9. ਸਮੱਸਿਆ
10. ਤੀਜੇ ਇਮਤਿਹਾਨ/ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਦੇ ਉਦਾਹਰਨ ਵਿੱਚ, ਤੁਸੀਂ ਨਿਰਧਾਰਤ ਕਰ ਸਕਦੇ ਹੋ ਕਿ ਆਊਟਲਾਇਰ ਹੈ ਜਾਂ ਨਹੀਂ। ਜੇਕਰ ਕੋਈ ਆਊਟਲਾਇਰ ਹੈ, ਤਾਂ ਇੱਕ ਕਸਰਤ ਵਜੋਂ, ਇਸਨੂੰ ਮਿਟਾਓ ਅਤੇ ਬਾਕੀ ਡਾਟਾ ਨੂੰ ਇੱਕ ਨਵੀਂ ਲਾਈਨ 'ਤੇ ਫਿੱਟ ਕਰੋ। ਇਸ ਉਦਾਹਰਨ ਲਈ, ਨਵੀਂ ਲਾਈਨ ਨੂੰ ਬਾਕੀ ਡਾਟਾ ਨੂੰ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਫਿੱਟ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ SSE (Sum of Squared Errors) ਛੋਟਾ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਕੋਰਲੇਸ਼ਨ ਗੁਣਾਂਕ (correlation coefficient) 1 ਜਾਂ –1 ਦੇ ਨੇੜੇ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ।
11. ਹੱਲ
12. ਆਊਟਲਾਇਰਾਂ ਦੀ ਗ੍ਰਾਫੀਕਲ ਪਛਾਣ
13. TI-83, 83+, 84+ ਗ੍ਰਾਫਿੰਗ ਕੈਲਕੂਲੇਟਰਾਂ ਨਾਲ, ਆਊਟਲਾਇਰਾਂ ਨੂੰ ਗ੍ਰਾਫੀਕਲੀ ਅਤੇ ਵਿਜ਼ੂਅਲੀ ਪਛਾਣਨਾ ਆਸਾਨ ਹੈ। ਜੇਕਰ ਅਸੀਂ ਕਿਸੇ ਵੀ ਡਾਟਾ ਪੁਆਇੰਟ ਤੋਂ ਬੈਸਟ ਫਿਟ ਲਾਈਨ ਦੇ ਸੰਬੰਧਿਤ ਪੁਆਇੰਟ ਤੱਕ ਲੰਬਕਾਰੀ ਦੂਰੀ ਨੂੰ ਮਾਪਦੇ ਹਾਂ ਅਤੇ ਉਹ ਦੂਰੀ 2s ਜਾਂ ਇਸ ਤੋਂ ਵੱਧ ਹੁੰਦੀ ਹੈ, ਤਾਂ ਅਸੀਂ ਡਾਟਾ ਪੁਆਇੰਟ ਨੂੰ ਬੈਸਟ ਫਿਟ ਲਾਈਨ ਤੋਂ "ਬਹੁਤ ਦੂਰ" ਮੰਨਾਂਗੇ। ਸਾਨੂੰ ਉਹ ਲਾਈਨਾਂ ਲੱਭਣ ਅਤੇ ਗ੍ਰਾਫ ਕਰਨ ਦੀ ਲੋੜ ਹੈ ਜੋ ਰੀਗਰੈਸ਼ਨ ਲਾਈਨ ਤੋਂ ਦੋ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਹੇਠਾਂ ਅਤੇ ਉੱਪਰ ਹਨ। ਇਹਨਾਂ ਦੋ ਲਾਈਨਾਂ ਦੇ ਬਾਹਰ ਕੋਈ ਵੀ ਪੁਆਇੰਟ ਆਊਟਲਾਇਰ ਹੁੰਦੇ ਹਨ। ਅਸੀਂ ਇਹਨਾਂ ਲਾਈਨਾਂ ਨੂੰ Y2 ਅਤੇ Y3 ਕਹਾਂਗੇ:
14. ਜਿਵੇਂ ਅਸੀਂ ਰੀਗਰੈਸ਼ਨ ਲਾਈਨ ਦੇ ਸਮੀਕਰਨ ਅਤੇ ਕੋਰਲੇਸ਼ਨ ਗੁਣਾਂਕ ਨਾਲ ਕੀਤਾ ਸੀ, ਅਸੀਂ ਇਸ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਦੀ ਗਣਨਾ ਸਾਡੇ ਲਈ ਕਰਨ ਲਈ ਤਕਨਾਲੋਜੀ ਦੀ ਵਰਤੋਂ ਕਰਾਂਗੇ। ਇਸ ਡਾਟਾ ਨਾਲ LinRegTTest ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ਆਊਟਪੁੱਟ ਸਕ੍ਰੀਨਾਂ ਰਾਹੀਂ ਸਕ੍ਰੋਲ ਕਰੋ ਤਾਂ ਜੋ s = 16.412 ਲੱਭਿਆ ਜਾ ਸਕੇ।
15. ਲਾਈਨ Y2 = –173.5 + 4.83x –2(16.4) ਅਤੇ ਲਾਈਨ Y3 = –173.5 + 4.83x + 2(16.4) ਜਿੱਥੇ ŷ = –173.5 + 4.83x ਬੈਸਟ ਫਿਟ ਲਾਈਨ ਹੈ। Y2 ਅਤੇ Y3 ਦਾ ਢਲਾਨ ਬੈਸਟ ਫਿਟ ਲਾਈਨ ਦੇ ਸਮਾਨ ਹੈ।
16. ਸਮੀਕਰਨ Y1 ਵਿੱਚ ਬੈਸਟ ਫਿਟ ਲਾਈਨ ਨਾਲ ਸਕੈਟਰਪਲੌਟ ਨੂੰ ਗ੍ਰਾਫ ਕਰੋ, ਫਿਰ "Y=" ਸਮੀਕਰਨ ਸੰਪਾਦਕ ਵਿੱਚ ਦੋ ਵਾਧੂ ਲਾਈਨਾਂ ਨੂੰ Y2 ਅਤੇ Y3 ਵਜੋਂ ਦਾਖਲ ਕਰੋ ਅਤੇ ZOOM 9 ਦਬਾਓ। ਤੁਹਾਨੂੰ ਪਤਾ ਲੱਗੇਗਾ ਕਿ Y2 ਅਤੇ Y3 ਲਾਈਨਾਂ ਦੇ ਵਿਚਕਾਰ ਨਾ ਹੋਣ ਵਾਲਾ ਇਕਲੌਤਾ ਡਾਟਾ ਪੁਆਇੰਟ x = 65, y = 175 ਹੈ। ਕੈਲਕੂਲੇਟਰ ਸਕ੍ਰੀਨ 'ਤੇ ਇਹ ਇਹਨਾਂ ਲਾਈਨਾਂ ਤੋਂ ਬਹੁਤ ਥੋੜ੍ਹਾ ਬਾਹਰ ਹੈ। ਆਊਟਲਾਇਰ ਉਹ ਵਿਦਿਆਰਥੀ ਹੈ ਜਿਸਦਾ ਤੀਜੇ ਇਮਤਿਹਾਨ ਵਿੱਚ 65 ਅਤੇ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਵਿੱਚ 175 ਗ੍ਰੇਡ ਸੀ; ਇਹ ਪੁਆਇੰਟ ਬੈਸਟ-ਫਿਟ ਲਾਈਨ ਤੋਂ ਦੋ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਤੋਂ ਵੱਧ ਦੂਰ ਹੈ।
17. ਕਦੇ-ਕਦੇ ਇੱਕ ਪੁਆਇੰਟ ਗ੍ਰਾਫ 'ਤੇ ਆਊਟਲਾਇਰਾਂ ਨੂੰ ਫਲੈਗ ਕਰਨ ਲਈ ਵਰਤੀਆਂ ਜਾਣ ਵਾਲੀਆਂ ਲਾਈਨਾਂ ਦੇ ਇੰਨਾ ਨੇੜੇ ਹੁੰਦਾ ਹੈ ਕਿ ਇਹ ਦੱਸਣਾ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ ਕਿ ਪੁਆਇੰਟ ਲਾਈਨਾਂ ਦੇ ਵਿਚਕਾਰ ਹੈ ਜਾਂ ਬਾਹਰ। ਕੰਪਿਊਟਰ 'ਤੇ, ਗ੍ਰਾਫ ਨੂੰ ਵੱਡਾ ਕਰਨ ਨਾਲ ਮਦਦ ਮਿਲ ਸਕਦੀ ਹੈ; ਇੱਕ ਛੋਟੀ ਕੈਲਕੂਲੇਟਰ ਸਕ੍ਰੀਨ 'ਤੇ, ਜ਼ੂਮ ਇਨ ਕਰਨ ਨਾਲ ਗ੍ਰਾਫ ਵਧੇਰੇ ਸਪੱਸ਼ਟ ਹੋ ਸਕਦਾ ਹੈ। ਨੋਟ ਕਰੋ ਕਿ ਜਦੋਂ ਗ੍ਰਾਫ ਕਾਫ਼ੀ ਸਪੱਸ਼ਟ ਤਸਵੀਰ ਨਹੀਂ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਆਊਟਲਾਇਰਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ ਸੰਖਿਆਤਮਕ ਤੁਲਨਾਵਾਂ ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹੋ।
18. ਇਸਨੂੰ ਅਜ਼ਮਾਓ 12.12
19. ਸਕੈਟਰ ਪਲੌਟ ਵਿੱਚ ਸੰਭਾਵੀ ਆਊਟਲਾਇਰ ਦੀ ਪਛਾਣ ਕਰੋ। ਰੈਜ਼ੀਡਿਊਅਲ ਜਾਂ ਗਲਤੀਆਂ ਦਾ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਲਗਭਗ 8.6 ਹੈ।
20. ਆਊਟਲਾਇਰਾਂ ਦੀ ਸੰਖਿਆਤਮਕ ਪਛਾਣ
1. ਟੇਬਲ 12.6 ਵਿੱਚ, ਪਹਿਲੇ ਦੋ ਕਾਲਮ ਤੀਜੇ-ਪ੍ਰੀਖਿਆ ਅਤੇ ਅੰਤਿਮ-ਪ੍ਰੀਖਿਆ ਦੇ ਅੰਕੜੇ ਹਨ। ਤੀਜਾ ਕਾਲਮ ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਰੇਖਾ ਤੋਂ ਗਣਨਾ ਕੀਤੇ ਗਏ ਅਨੁਮਾਨਿਤ ŷ ਮੁੱਲ ਦਰਸਾਉਂਦਾ ਹੈ: ŷ = –173.5 + 4.83x। ਰੈਜ਼ੀਡਿਊਅਲ, ਜਾਂ ਗਲਤੀਆਂ, ਟੇਬਲ ਦੇ ਚੌਥੇ ਕਾਲਮ ਵਿੱਚ ਗਣਨਾ ਕੀਤੀਆਂ ਗਈਆਂ ਹਨ: ਦੇਖਿਆ ਗਿਆ y ਮੁੱਲ − ਅਨੁਮਾਨਿਤ y ਮੁੱਲ = y − ŷ।
2. s ਸਾਰੇ y − ŷ = ε ਮੁੱਲਾਂ ਦਾ ਸਟੈਂਡਰਡ ਡੇਵੀਏਸ਼ਨ ਹੈ ਜਿੱਥੇ n ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਦੀ ਕੁੱਲ ਗਿਣਤੀ ਹੈ। ਜੇਕਰ ਹਰੇਕ ਰੈਜ਼ੀਡਿਊਅਲ ਦੀ ਗਣਨਾ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਵਰਗ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਨਤੀਜਿਆਂ ਨੂੰ ਜੋੜਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਸਾਨੂੰ SSE ਮਿਲਦਾ ਹੈ। ਰੈਜ਼ੀਡਿਊਅਲਾਂ ਦਾ ਸਟੈਂਡਰਡ ਡੇਵੀਏਸ਼ਨ SSE ਤੋਂ ਇਸ ਤਰ੍ਹਾਂ ਗਣਨਾ ਕੀਤਾ ਜਾਂਦਾ ਹੈ:
NOTE
3. ਅਸੀਂ (n – 2) ਨਾਲ ਭਾਗ ਕਰਦੇ ਹਾਂ ਕਿਉਂਕਿ ਰਿਗਰੈਸ਼ਨ ਮਾਡਲ ਵਿੱਚ ਦੋ ਅਨੁਮਾਨ ਸ਼ਾਮਲ ਹੁੰਦੇ ਹਨ।
4. s ਦਾ ਮੁੱਲ ਆਪਣੇ ਆਪ ਗਣਨਾ ਕਰਨ ਦੀ ਬਜਾਏ, ਅਸੀਂ ਕੰਪਿਊਟਰ ਜਾਂ ਕੈਲਕੂਲੇਟਰ ਦੀ ਵਰਤੋਂ ਕਰਕੇ s ਲੱਭ ਸਕਦੇ ਹਾਂ। ਇਸ ਉਦਾਹਰਨ ਲਈ, ਕੈਲਕੂਲੇਟਰ ਫੰਕਸ਼ਨ LinRegTTest ਨੇ ਰੈਜ਼ੀਡਿਊਅਲਾਂ 35; –17; 16; –6; –19; 9; 3; –1; –10; –9; –1 ਦੇ ਸਟੈਂਡਰਡ ਡੇਵੀਏਸ਼ਨ ਵਜੋਂ s = 16.4 ਪਾਇਆ।
5. ਕਤਾਰ: x | y | ŷ | y – ŷ
6. ਕਤਾਰ: 65 | 175 | 140 | 175 – 140 = 35
7. ਕਤਾਰ: 67 | 133 | 150 | 133 – 150= –17
8. ਕਤਾਰ: 71 | 185 | 169 | 185 – 169 = 16
9. ਕਤਾਰ: 71 | 163 | 169 | 163 – 169 = –6
10. ਕਤਾਰ: 66 | 126 | 145 | 126 – 145 = –19
11. ਕਤਾਰ: 75 | 198 | 189 | 198 – 189 = 9
12. ਕਤਾਰ: 67 | 153 | 150 | 153 – 150 = 3
13. ਕਤਾਰ: 70 | 163 | 164 | 163 – 164 = –1
14. ਕਤਾਰ: 71 | 159 | 169 | 159 – 169 = –10
15. ਕਤਾਰ: 69 | 151 | 160 | 151 – 160 = –9
16. ਕਤਾਰ: 69 | 159 | 160 | 159 – 160 = –1
17. ਅਸੀਂ ਉਨ੍ਹਾਂ ਸਾਰੇ ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਦੀ ਭਾਲ ਕਰ ਰਹੇ ਹਾਂ ਜਿਨ੍ਹਾਂ ਲਈ ਰੈਜ਼ੀਡਿਊਅਲ 2s = 2(16.4) = 32.8 ਤੋਂ ਵੱਡਾ ਜਾਂ –32.8 ਤੋਂ ਘੱਟ ਹੈ। ਇਨ੍ਹਾਂ ਮੁੱਲਾਂ ਦੀ ਤੁਲਨਾ ਟੇਬਲ ਦੇ ਚੌਥੇ ਕਾਲਮ ਵਿੱਚ ਰੈਜ਼ੀਡਿਊਅਲਾਂ ਨਾਲ ਕਰੋ। ਅਜਿਹਾ ਇਕੋ ਡਾਟਾ ਪੁਆਇੰਟ ਉਹ ਵਿਦਿਆਰਥੀ ਹੈ ਜਿਸ ਨੇ ਤੀਜੀ ਪ੍ਰੀਖਿਆ ਵਿੱਚ 65 ਗ੍ਰੇਡ ਅਤੇ ਅੰਤਿਮ ਪ੍ਰੀਖਿਆ ਵਿੱਚ 175 ਗ੍ਰੇਡ ਪ੍ਰਾਪਤ ਕੀਤਾ ਸੀ; ਇਸ ਵਿਦਿਆਰਥੀ ਲਈ ਰੈਜ਼ੀਡਿਊਅਲ 35 ਹੈ।
18. ਆਊਟਲਾਇਰ ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਲਾਈਨ ਨੂੰ ਕਿਵੇਂ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ?
19. ਸੰਖਿਆਤਮਕ ਤੌਰ 'ਤੇ ਅਤੇ ਗ੍ਰਾਫਿਕਲੀ, ਅਸੀਂ ਬਿੰਦੂ (65, 175) ਨੂੰ ਇੱਕ ਆਊਟਲਾਇਰ ਵਜੋਂ ਪਛਾਣਿਆ ਹੈ। ਸਾਨੂੰ ਇਸ ਬਿੰਦੂ ਲਈ ਡਾਟਾ ਦੀ ਮੁੜ ਜਾਂਚ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ ਤਾਂ ਜੋ ਇਹ ਦੇਖਿਆ ਜਾ ਸਕੇ ਕਿ ਡਾਟਾ ਵਿੱਚ ਕੋਈ ਸਮੱਸਿਆ ਹੈ ਜਾਂ ਨਹੀਂ। ਜੇਕਰ ਕੋਈ ਗਲਤੀ ਹੈ, ਤਾਂ ਸਾਨੂੰ ਗਲਤੀ ਨੂੰ ਠੀਕ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ ਜੇਕਰ ਸੰਭਵ ਹੋਵੇ, ਜਾਂ ਡਾਟਾ ਨੂੰ ਹਟਾ ਦੇਣਾ ਚਾਹੀਦਾ ਹੈ। ਜੇਕਰ ਡਾਟਾ ਸਹੀ ਹੈ, ਤਾਂ ਅਸੀਂ ਇਸਨੂੰ ਡਾਟਾ ਸੈੱਟ ਵਿੱਚ ਛੱਡ ਦੇਵਾਂਗੇ। ਇਸ ਸਮੱਸਿਆ ਲਈ, ਅਸੀਂ ਮੰਨਾਂਗੇ ਕਿ ਅਸੀਂ ਡਾਟਾ ਦੀ ਜਾਂਚ ਕੀਤੀ ਹੈ ਅਤੇ ਪਾਇਆ ਹੈ ਕਿ ਇਹ ਆਊਟਲਾਇਰ ਡਾਟਾ ਇੱਕ ਗਲਤੀ ਸੀ। ਇਸ ਲਈ ਅਸੀਂ ਅੱਗੇ ਵਧਾਂਗੇ ਅਤੇ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾ ਦੇਵਾਂਗੇ, ਤਾਂ ਜੋ ਅਸੀਂ ਇਸਦੇ ਪ੍ਰਭਾਵਾਂ ਦੀ ਪੜਚੋਲ ਕਰ ਸਕੀਏ, ਇੱਕ ਸਿੱਖਣ ਦੇ ਤਜਰਬੇ ਵਜੋਂ।
20. ਬਾਕੀ ਦਸ ਬਿੰਦੂਆਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਇੱਕ ਨਵੀਂ ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਲਾਈਨ ਅਤੇ ਕੋਰਲੇਸ਼ਨ ਗੁਣਾਂਕ ਦੀ ਗਣਨਾ ਕਰੋ: TI-83, TI-83+, TI-84+ ਕੈਲਕੂਲੇਟਰਾਂ 'ਤੇ, L1 ਅਤੇ L2 ਤੋਂ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਓ। LinRegTTest ਦੀ ਵਰਤੋਂ ਕਰਕੇ, ਨਵੀਂ ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਲਾਈਨ ਅਤੇ ਕੋਰਲੇਸ਼ਨ ਗੁਣਾਂਕ ਹਨ:
21. ŷ = –355.19 + 7.39x ਅਤੇ r = 0.9121
22. ਨਵੀਂ ਲਾਈਨ r = 0.9121 ਨਾਲ ਅਸਲ (r = 0.6631) ਨਾਲੋਂ ਇੱਕ ਮਜ਼ਬੂਤ ਕੋਰਲੇਸ਼ਨ ਹੈ ਕਿਉਂਕਿ r = 0.9121 ਇੱਕ ਦੇ ਨੇੜੇ ਹੈ। ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਨਵੀਂ ਲਾਈਨ ਬਾਕੀ ਦਸ ਡਾਟਾ ਮੁੱਲਾਂ ਲਈ ਇੱਕ ਬਿਹਤਰ ਫਿੱਟ ਹੈ। ਲਾਈਨ ਤੀਜੀ ਪ੍ਰੀਖਿਆ ਦੇ ਸਕੋਰ ਦਿੱਤੇ ਜਾਣ 'ਤੇ ਅੰਤਿਮ ਪ੍ਰੀਖਿਆ ਦੇ ਸਕੋਰ ਦੀ ਬਿਹਤਰ ਭਵਿੱਖਬਾਣੀ ਕਰ ਸਕਦੀ ਹੈ।
23. ਆਊਟਲਾਇਰਾਂ ਦੀ ਸੰਖਿਆਤਮਕ ਪਛਾਣ: s ਦੀ ਗਣਨਾ ਕਰਨਾ ਅਤੇ ਆਊਟਲਾਇਰਾਂ ਨੂੰ ਹੱਥੀਂ ਲੱਭਣਾ
24. ਜੇਕਰ ਤੁਹਾਡੇ ਕੋਲ LinRegTTest ਫੰਕਸ਼ਨ ਨਹੀਂ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਪਹਿਲੀ ਉਦਾਹਰਨ ਵਿੱਚ ਆਊਟਲਾਇਰ ਦੀ ਗਣਨਾ ਇਸ ਤਰ੍ਹਾਂ ਕਰ ਸਕਦੇ ਹੋ। ਪਹਿਲਾਂ, ਹਰੇਕ |y – ŷ| ਦਾ ਵਰਗ ਕਰੋ।
The squares are 352; 172; 162; 62; 192; 92; 32; 12; 102; 92; 12
Then, add (sum) all the |y – ŷ| squared terms using the formula
Σ i = 1 11 ( | y i − y ^ i | ) 2 = Σ i = 1 11 ε i 2 Σ i = 1 11 ( | y i − y ^ i | ) 2 = Σ i = 1 11 ε i 2 (Recall that yi – ŷi = εi.)
= 352 + 172 + 162 + 62 + 192 + 92 + 32 + 12 + 102 + 92 + 12
= 2440 = SSE. The result, SSE is the Sum of Squared Errors.
Next, calculate s, the standard deviation of all the y – ŷ = ε values where n = the total number of data points.
The calculation is s= SSE n–2 s= SSE n–2.
For the third exam/final exam problem, s= 2440 11–2 =16.47 s= 2440 11–2 =16.47.
Next, multiply s by 2: (2)(16.47) = 32.94 32.94 is 2 standard deviations away from the mean of the y – ŷ values.
If we were to measure the vertical distance from any data point to the corresponding point on the line of best fit and that distance is at least 2s, then we would consider the data point to be "too far" from the line of best fit. We call that point a potential outlier.
For the example, if any of the |y – ŷ| values are at least 32.94, the corresponding (x, y) data point is a potential outlier.
For the third exam/final exam problem, all the |y – ŷ|'s are less than 31.29 except for the first one which is 35.
35 > 31.29 That is, |y – ŷ| ≥ (2)(s)
The point which corresponds to |y – ŷ| = 35 is (65, 175). Therefore, the data point (65,175) is a potential outlier. For this example, we will delete it. (Remember, we do not always delete an outlier.)
NOTE
When outliers are deleted, the researcher should either record that data was deleted, and why, or the researcher should provide results both with and without the deleted data. If data is erroneous and the correct values are known (e.g., student one actually scored a 70 instead of a 65), then this correction can be made to the data.
The next step is to compute a new best-fit line using the ten remaining points. The new line of best fit and the correlation coefficient are:
ŷ = –355.19 + 7.39x and r = 0.9121
Example 12.13
Problem
Using this new line of best fit (based on the remaining ten data points in the third exam/final exam example), what would a student who receives a 73 on the third exam expect to receive on the final exam? Is this the same as the prediction made using the original line?
Solution
Using the new line of best fit, ŷ = –355.19 + 7.39(73) = 184.28. A student who scored 73 points on the third exam would expect to earn 184 points on the final exam. The original line predicted ŷ = –173.51 + 4.83(73) = 179.08 so the prediction using the new line with the outlier eliminated differs from the original prediction.
Try It 12.13
The data points for the graph from the third exam/final exam example are as follows: (1, 5), (2, 7), (2, 6), (3, 9), (4, 12), (4, 13), (5, 18), (6, 19), (7, 12), and (7, 21). Remove the outlier and recalculate the line of best fit. Find the value of ŷ when x = 10.
1. ਉਦਾਹਰਨ 12.14
2. ਖਪਤਕਾਰ ਕੀਮਤ ਸੂਚਕਾਂਕ (ਸੀ.ਪੀ.ਆਈ.) ਸ਼ਹਿਰੀ ਖਪਤਕਾਰਾਂ ਦੁਆਰਾ ਖਪਤਕਾਰ ਵਸਤਾਂ ਅਤੇ ਸੇਵਾਵਾਂ ਲਈ ਅਦਾ ਕੀਤੇ ਗਏ ਮੁੱਲਾਂ ਵਿੱਚ ਸਮੇਂ ਦੇ ਨਾਲ ਔਸਤ ਤਬਦੀਲੀ ਨੂੰ ਮਾਪਦਾ ਹੈ। ਸੀ.ਪੀ.ਆਈ. ਲਗਭਗ ਸਾਰੇ ਅਮਰੀਕੀਆਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ ਕਿਉਂਕਿ ਇਸਦੇ ਬਹੁਤ ਸਾਰੇ ਤਰੀਕੇ ਹਨ ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਇਸਦੀ ਵਰਤੋਂ ਕੀਤੀ ਜਾਂਦੀ ਹੈ। ਇਸਦੇ ਸਭ ਤੋਂ ਵੱਡੇ ਉਪਯੋਗਾਂ ਵਿੱਚੋਂ ਇੱਕ ਮਹਿੰਗਾਈ ਦੇ ਮਾਪ ਵਜੋਂ ਹੈ। ਸਰਕਾਰ, ਕਾਰੋਬਾਰ ਅਤੇ ਕਿਰਤ ਨੂੰ ਰਾਸ਼ਟਰ ਦੀ ਆਰਥਿਕਤਾ ਵਿੱਚ ਮੁੱਲ ਤਬਦੀਲੀਆਂ ਬਾਰੇ ਜਾਣਕਾਰੀ ਪ੍ਰਦਾਨ ਕਰਕੇ, ਸੀ.ਪੀ.ਆਈ. ਉਹਨਾਂ ਨੂੰ ਆਰਥਿਕ ਫੈਸਲੇ ਲੈਣ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ। ਰਾਸ਼ਟਰਪਤੀ, ਕਾਂਗਰਸ ਅਤੇ ਫੈਡਰਲ ਰਿਜ਼ਰਵ ਬੋਰਡ ਮੁਦਰਾ ਅਤੇ ਵਿੱਤੀ ਨੀਤੀਆਂ ਬਣਾਉਣ ਲਈ ਸੀ.ਪੀ.ਆਈ. ਦੇ ਰੁਝਾਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ। ਹੇਠਾਂ ਦਿੱਤੀ ਸਾਰਣੀ ਵਿੱਚ, x ਸਾਲ ਹੈ ਅਤੇ y ਸੀ.ਪੀ.ਆਈ. ਹੈ।
3. ਕਤਾਰ: x | y | x | y
4. ਕਤਾਰ: 1915 | 10.1 | 1979 | 72.6
5. ਕਤਾਰ: 1926 | 17.7 | 1980 | 82.4
6. ਕਤਾਰ: 1935 | 13.7 | 1986 | 109.6
7. ਕਤਾਰ: 1940 | 14.7 | 1991 | 130.7
8. ਕਤਾਰ: 1947 | 24.1 | 1999 | 166.6
9. ਕਤਾਰ: 1952 | 26.5 | 2010 | 219.2
10. ਕਤਾਰ: 1964 | 31.0 | 2020 | 258
11. ਕਤਾਰ: 1969 | 36.7 | 2023 | 299.2
12. ਕਤਾਰ: 1975 | 49.3
13. ਸਮੱਸਿਆ
14. ਡਾਟਾ ਦਾ ਇੱਕ ਸਕੈਟਰਪਲਾਟ ਬਣਾਓ।
15. ਘੱਟੋ-ਘੱਟ ਵਰਗ ਰੇਖਾ ਦੀ ਗਣਨਾ ਕਰੋ। ਸਮੀਕਰਨ ਨੂੰ ŷ = a + bx ਦੇ ਰੂਪ ਵਿੱਚ ਲਿਖੋ।
16. ਸਕੈਟਰਪਲਾਟ ਉੱਤੇ ਰੇਖਾ ਬਣਾਓ।
17. ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਪਤਾ ਕਰੋ। ਕੀ ਇਹ ਮਹੱਤਵਪੂਰਨ ਹੈ?
18. ਸਾਲ 1990 ਲਈ ਔਸਤ ਸੀ.ਪੀ.ਆਈ. ਕੀ ਹੈ?
19. ਹੱਲ
20. ਚਿੱਤਰ 12.22 ਦੇਖੋ।
21. ŷ = –3204 + 1.662x ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਦੀ ਰੇਖਾ ਦਾ ਸਮੀਕਰਨ ਹੈ।
22. r = 0.8694
23. ਡਾਟਾ ਬਿੰਦੂਆਂ ਦੀ ਗਿਣਤੀ n = 14 ਹੈ। ਅਧਿਆਇ 12 ਦੇ ਅੰਤ ਵਿੱਚ 95% ਕ੍ਰਿਟੀਕਲ ਵੈਲਿਊਜ਼ ਆਫ਼ ਦਾ ਸੈਂਪਲ ਕੋਰਲੇਸ਼ਨ ਕੋਫੀਸ਼ੀਐਂਟ ਟੇਬਲ ਦੀ ਵਰਤੋਂ ਕਰੋ। n – 2 = 12। ਸੰਬੰਧਿਤ ਕ੍ਰਿਟੀਕਲ ਵੈਲਿਊ 0.532 ਹੈ। ਕਿਉਂਕਿ 0.8694 > 0.532, r ਮਹੱਤਵਪੂਰਨ ਹੈ। ŷ = –3204 + 1.662(1990) = 103.4 ਸੀ.ਪੀ.ਆਈ.
24. ਕੈਲਕੁਲੇਟਰ ਲਿਨਰੇਗਟੈਸਟ (LinRegTTest) ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ਅਸੀਂ ਪਾਉਂਦੇ ਹਾਂ ਕਿ s = 25.4 ; ਰੇਖਾਵਾਂ Y2 = –3204 + 1.662X – 2(25.4) ਅਤੇ Y3 = –3204 + 1.662X + 2(25.4) ਨੂੰ ਗ੍ਰਾਫ ਕਰਕੇ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਕੋਈ ਵੀ ਡਾਟਾ ਮੁੱਲ ਉਨ੍ਹਾਂ ਰੇਖਾਵਾਂ ਤੋਂ ਬਾਹਰ ਨਹੀਂ ਹਨ, ਜਿਸ ਨਾਲ ਕੋਈ ਆਊਟਲਾਇਰ ਨਹੀਂ ਪਛਾਣੇ ਜਾਂਦੇ। (ਨੋਟ ਕਰੋ ਕਿ ਸਾਲ 1999 ਉੱਪਰੀ ਰੇਖਾ ਦੇ ਬਹੁਤ ਨੇੜੇ ਸੀ, ਪਰ ਫਿਰ ਵੀ ਇਸਦੇ ਅੰਦਰ ਸੀ।)
NOTE
1. ਇਸ ਉਦਾਹਰਨ ਵਿੱਚ, ਬਿੰਦੂਆਂ ਦੇ ਪੈਟਰਨ ਵੱਲ ਧਿਆਨ ਦਿਓ, ਜੋ ਕਿ ਲਾਈਨ ਦੇ ਮੁਕਾਬਲੇ ਹੈ। ਭਾਵੇਂ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਮਹੱਤਵਪੂਰਨ ਹੈ, ਸਕੈਟਰਪਲੌਟ ਵਿੱਚ ਪੈਟਰਨ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਲਾਈਨ ਦੀ ਬਜਾਏ ਇੱਕ ਵਕਰ (curve) ਵਧੇਰੇ ਢੁਕਵਾਂ ਮਾਡਲ ਹੋਵੇਗਾ। ਇਸ ਉਦਾਹਰਨ ਵਿੱਚ, ਇੱਕ ਅੰਕੜਾ-ਵਿਗਿਆਨੀ ਨੂੰ ਇਸ ਡਾਟੇ ਲਈ ਇੱਕ ਵਕਰ ਫਿੱਟ ਕਰਨ ਲਈ ਹੋਰ ਵਿਧੀਆਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ਨੂੰ ਤਰਜੀਹ ਦੇਣੀ ਚਾਹੀਦੀ ਹੈ, ਨਾ ਕਿ ਸਾਡੇ ਦੁਆਰਾ ਲੱਭੀ ਗਈ ਲਾਈਨ ਨਾਲ ਡਾਟੇ ਦਾ ਮਾਡਲ ਬਣਾਉਣਾ। ਗਣਨਾਵਾਂ ਕਰਨ ਤੋਂ ਇਲਾਵਾ, ਜਦੋਂ ਇਹ ਫੈਸਲਾ ਕਰਨਾ ਹੋਵੇ ਕਿ ਰੇਖੀ ਮਾਡਲ ਢੁਕਵਾਂ ਹੈ ਜਾਂ ਨਹੀਂ, ਤਾਂ ਸਕੈਟਰਪਲੌਟ ਨੂੰ ਦੇਖਣਾ ਹਮੇਸ਼ਾ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ।
2. ਜੇਕਰ ਤੁਸੀਂ ਹੋਰ ਸਾਲਾਂ ਦੇ ਡਾਟੇ ਨੂੰ ਦੇਖਣ ਵਿੱਚ ਦਿਲਚਸਪੀ ਰੱਖਦੇ ਹੋ, ਤਾਂ ਬਿਊਰੋ ਆਫ਼ ਲੇਬਰ ਸਟੈਟਿਸਟਿਕਸ CPI ਵੈੱਬਸਾਈਟ ftp://ftp.bls.gov/pub/special.requests/cpi/cpiai.txt 'ਤੇ ਜਾਓ; ਸਾਡਾ ਡਾਟਾ "Annual Avg." (ਸੱਜੇ ਤੋਂ ਤੀਜਾ ਕਾਲਮ) ਨਾਮਕ ਕਾਲਮ ਤੋਂ ਲਿਆ ਗਿਆ ਹੈ। ਉਦਾਹਰਨ ਲਈ, ਤੁਸੀਂ ਹੋਰ ਮੌਜੂਦਾ ਸਾਲਾਂ ਦਾ ਡਾਟਾ ਜੋੜ ਸਕਦੇ ਹੋ। ਵਧੇਰੇ ਹਾਲੀਆ ਸਾਲਾਂ ਨੂੰ ਜੋੜਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੋ: 2010: CPI = 219.2; 2020: CPI = 258.0; 2023: CPI = 299.2। ਦੇਖੋ ਕਿ ਇਹ ਮਾਡਲ ਨੂੰ ਕਿਵੇਂ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ। (ਚੈੱਕ ਕਰੋ: y⏜ =-5030+2.598x; r = 0.9067। ਕੀ r ਮਹੱਤਵਪੂਰਨ ਹੈ? ਕੀ ਨਵੇਂ ਬਿੰਦੂਆਂ ਦੇ ਜੋੜ ਨਾਲ ਫਿੱਟ ਬਿਹਤਰ ਹੈ?)
3. ਕੋਸ਼ਿਸ਼ ਕਰੋ 12.14
4. ਹੇਠਾਂ ਦਿੱਤੀ ਸਾਰਣੀ ਪ੍ਰਤੀ ਵਿਅਕਤੀ ਆਮਦਨ PCINC ਵਿੱਚ ਮਾਪੀ ਗਈ ਆਰਥਿਕ ਵਿਕਾਸ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ।
5. ਕਤਾਰ: ਸਾਲ | PCINC | ਸਾਲ | PCINC
6. ਕਤਾਰ: 1870 | 340 | 1920 | 1050
7. ਕਤਾਰ: 1880 | 499 | 1930 | 1170
8. ਕਤਾਰ: 1890 | 592 | 1940 | 1364
9. ਕਤਾਰ: 1900 | 757 | 1950 | 1836
10. ਕਤਾਰ: 1910 | 927 | 1960 | 2132
11. ਸੁਤੰਤਰ ਅਤੇ ਨਿਰਭਰ ਚੱਲ (variables) ਕਿਹੜੇ ਹਨ?
12. ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ ਬਣਾਓ।
13. ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਦੀ ਲਾਈਨ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ (correlation coefficient) ਲੱਭਣ ਲਈ ਰਿਗਰੈਸ਼ਨ (regression) ਦੀ ਵਰਤੋਂ ਕਰੋ।
14. ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਦੇ ਮਹੱਤਵ ਦੀ ਵਿਆਖਿਆ ਕਰੋ।
15. ਕੀ ਚੱਲਾਂ (variables) ਵਿਚਕਾਰ ਕੋਈ ਰੇਖੀ ਸਬੰਧ ਹੈ?
16. ਨਿਰਧਾਰਨ ਦੇ ਗੁਣਾਂਕ (coefficient of determination) ਦਾ ਪਤਾ ਲਗਾਓ ਅਤੇ ਇਸਦੀ ਵਿਆਖਿਆ ਕਰੋ।
17. ਰਿਗਰੈਸ਼ਨ ਸਮੀਕਰਨ (regression equation) ਦਾ ਢਲਾਣ (slope) ਕੀ ਹੈ? ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ?
18. 1900, 2000 ਲਈ PCINC ਦਾ ਅਨੁਮਾਨ ਲਗਾਉਣ ਲਈ ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਦੀ ਲਾਈਨ ਦੀ ਵਰਤੋਂ ਕਰੋ।
19. ਨਿਰਧਾਰਤ ਕਰੋ ਕਿ ਕੀ ਕੋਈ ਆਊਟਲਾਇਰ (outliers) ਹਨ।
20. ਨਮੂਨਾ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਸਾਰਣੀ ਦੇ 95% ਕ੍ਰਿਟੀਕਲ ਮੁੱਲ (Critical Values)
21. ਕਤਾਰ: ਡਿਗਰੀ ਆਫ਼ ਫਰੀਡਮ (Degrees of Freedom): n – 2 | ਕ੍ਰਿਟੀਕਲ ਮੁੱਲ: (+ ਅਤੇ –)
22. ਕਤਾਰ: 1 | 0.997
23. ਕਤਾਰ: 2 | 0.950
24. ਕਤਾਰ: 3 | 0.878
4 | 0.811
5 | 0.754
6 | 0.707
7 | 0.666
8 | 0.632
9 | 0.602
10 | 0.576
11 | 0.555
12 | 0.532
13 | 0.514
14 | 0.497
15 | 0.482
16 | 0.468
17 | 0.456
18 | 0.444
19 | 0.433
20 | 0.423
21 | 0.413
22 | 0.404
23 | 0.396
24 | 0.388
25 | 0.381
26 | 0.374
27 | 0.367
ਪੰਕਤੀ: 28 | 0.361
ਪੰਕਤੀ: 29 | 0.355
ਪੰਕਤੀ: 30 | 0.349
ਪੰਕਤੀ: 40 | 0.304
ਪੰਕਤੀ: 50 | 0.273
ਪੰਕਤੀ: 60 | 0.250
ਪੰਕਤੀ: 70 | 0.232
ਪੰਕਤੀ: 80 | 0.217
ਪੰਕਤੀ: 90 | 0.205
ਪੰਕਤੀ: 100 | 0.195