ਪੰਜਾਬੀਯੂਨੀpunjabiuni
Statistics

Outliers

੧੫੪ ਪੈਰੇ · 154 paragraphs

ਮਸ਼ੀਨੀ ਅਨੁਵਾਦ · ਬਿਨਾਂ ਜਾਂਚਇਹ ਮਸ਼ੀਨੀ ਅਨੁਵਾਦ ਹੈ ਅਤੇ ਅਜੇ ਮਨੁੱਖੀ ਸਮੀਖਿਆ ਨਹੀਂ ਹੋਈ। ਇਸਨੂੰ ਅੰਤਿਮ, ਪ੍ਰਮਾਣਿਤ ਅਨੁਵਾਦ ਦੀ ਬਜਾਏ ਕੰਮ ਅਧੀਨ ਖਰੜਾ ਸਮਝ ਕੇ ਪੜ੍ਹੋ।Machine-translated, not yet reviewed by a human. Read it as a working draft, not a settled translation — Sikhi.io (Punjabi Classics Pipeline) · google/gemini-2.5-flash-lite.

1. ਕੁਝ ਡਾਟਾ ਸੈੱਟਾਂ ਵਿੱਚ, ਆਊਟਲਾਇਰ (outliers) ਨਾਮਕ ਮੁੱਲ (ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟ) ਹੁੰਦੇ ਹਨ। ਆਊਟਲਾਇਰ ਉਹ ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟ ਹੁੰਦੇ ਹਨ ਜੋ ਘੱਟੋ-ਘੱਟ ਵਰਗ ਰੇਖਾ (least-squares line) ਤੋਂ ਦੂਰ ਹੁੰਦੇ ਹਨ। ਉਨ੍ਹਾਂ ਵਿੱਚ ਵੱਡੀਆਂ ਗਲਤੀਆਂ ਹੁੰਦੀਆਂ ਹਨ, ਜਿੱਥੇ ਗਲਤੀ ਜਾਂ ਬਕਾਇਆ (residual) ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਦੇ ਬਹੁਤ ਨੇੜੇ ਨਹੀਂ ਹੁੰਦਾ।

2. ਆਊਟਲਾਇਰਾਂ ਦੀ ਨੇੜਿਓਂ ਜਾਂਚ ਕਰਨ ਦੀ ਲੋੜ ਹੈ। ਕਈ ਵਾਰ, ਉਨ੍ਹਾਂ ਨੂੰ ਡਾਟਾ ਦੇ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ ਸ਼ਾਮਲ ਨਹੀਂ ਕੀਤਾ ਜਾਣਾ ਚਾਹੀਦਾ, ਜਿਵੇਂ ਕਿ ਜੇਕਰ ਇਹ ਸੰਭਵ ਹੈ ਕਿ ਇੱਕ ਆਊਟਲਾਇਰ ਗਲਤ ਡਾਟਾ ਦਾ ਨਤੀਜਾ ਹੋਵੇ। ਹੋਰ ਸਮਿਆਂ ਤੇ, ਇੱਕ ਆਊਟਲਾਇਰ ਅਧਿਐਨ ਅਧੀਨ ਆਬਾਦੀ ਬਾਰੇ ਮਹੱਤਵਪੂਰਨ ਜਾਣਕਾਰੀ ਰੱਖ ਸਕਦਾ ਹੈ ਅਤੇ ਡਾਟਾ ਵਿੱਚ ਸ਼ਾਮਲ ਰਹਿਣਾ ਚਾਹੀਦਾ ਹੈ। ਮੁੱਖ ਗੱਲ ਇਹ ਹੈ ਕਿ ਧਿਆਨ ਨਾਲ ਜਾਂਚ ਕੀਤੀ ਜਾਵੇ ਕਿ ਡਾਟਾ ਪੁਆਇੰਟ ਆਊਟਲਾਇਰ ਕਿਉਂ ਬਣਦਾ ਹੈ।

3. ਆਊਟਲਾਇਰਾਂ ਤੋਂ ਇਲਾਵਾ, ਇੱਕ ਨਮੂਨੇ ਵਿੱਚ ਇੱਕ ਜਾਂ ਕੁਝ ਅਜਿਹੇ ਪੁਆਇੰਟ ਹੋ ਸਕਦੇ ਹਨ ਜਿਨ੍ਹਾਂ ਨੂੰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ (influential points) ਕਿਹਾ ਜਾਂਦਾ ਹੈ। ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ ਉਹ ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟ ਹੁੰਦੇ ਹਨ ਜੋ ਹੋਰ ਦੇਖੇ ਗਏ ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਤੋਂ ਖਿਤਿਜੀ ਦਿਸ਼ਾ (horizontal direction) ਵਿੱਚ ਦੂਰ ਹੁੰਦੇ ਹਨ। ਇਹਨਾਂ ਪੁਆਇੰਟਾਂ ਦਾ ਰਿਗਰੈਸ਼ਨ ਰੇਖਾ (regression line) ਦੇ ਢਲਾਣ (slope) ਤੇ ਵੱਡਾ ਪ੍ਰਭਾਵ ਪੈ ਸਕਦਾ ਹੈ। ਇੱਕ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ, ਤੁਸੀਂ ਇਸਨੂੰ ਡਾਟਾ ਸੈੱਟ ਤੋਂ ਹਟਾ ਸਕਦੇ ਹੋ ਅਤੇ ਇਹ ਨਿਰਧਾਰਤ ਕਰ ਸਕਦੇ ਹੋ ਕਿ ਕੀ ਰਿਗਰੈਸ਼ਨ ਰੇਖਾ ਦੀ ਢਲਾਣ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਤਬਦੀਲੀ ਆਈ ਹੈ।

4. ਤੁਸੀਂ ਇਹ ਵੀ ਜਾਂਚ ਕਰਨਾ ਚਾਹੁੰਦੇ ਹੋ ਕਿ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ (correlation coefficient), r, ਕਿਵੇਂ ਬਦਲਿਆ ਹੈ। ਕਈ ਵਾਰ, ਢਲਾਣ ਵਿੱਚ ਮਹੱਤਵਪੂਰਨ ਤਬਦੀਲੀ ਨੂੰ ਸਮਝਣਾ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ, ਇਸ ਲਈ ਤੁਹਾਨੂੰ ਇਹ ਦੇਖਣ ਦੀ ਲੋੜ ਹੈ ਕਿ ਰੇਖੀ ਸੰਬੰਧ ਦੀ ਮਜ਼ਬੂਤੀ ਕਿਵੇਂ ਬਦਲੀ ਹੈ। ਕੰਪਿਊਟਰਾਂ ਅਤੇ ਕਈ ਕੈਲਕੂਲੇਟਰਾਂ ਦੀ ਵਰਤੋਂ ਆਊਟਲਾਇਰਾਂ ਅਤੇ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ। ਰਿਗਰੈਸ਼ਨ ਵਿਸ਼ਲੇਸ਼ਣ ਇਹ ਨਿਰਧਾਰਤ ਕਰ ਸਕਦਾ ਹੈ ਕਿ ਕੀ ਕੋਈ ਆਊਟਲਾਇਰ, ਸੱਚਮੁੱਚ, ਇੱਕ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਪੁਆਇੰਟ ਹੈ। ਨਵਾਂ ਰਿਗਰੈਸ਼ਨ ਦਿਖਾਏਗਾ ਕਿ ਆਊਟਲਾਇਰ ਨੂੰ ਛੱਡਣ ਨਾਲ ਚਲਾਂ (variables) ਵਿਚਕਾਰ ਸਹਿ-ਸੰਬੰਧ, ਅਤੇ ਨਾਲ ਹੀ ਰੇਖਾ ਦੇ ਫਿੱਟ ਤੇ ਕੀ ਪ੍ਰਭਾਵ ਪਵੇਗਾ। ਦੋ ਰਿਗਰੈਸ਼ਨ ਰੇਖਾਵਾਂ ਨੂੰ ਦਿਖਾਉਣ ਵਾਲਾ ਇੱਕ ਗ੍ਰਾਫ ਇਹ ਨਿਰਧਾਰਤ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ ਕਿ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਉਣ ਨਾਲ ਮਾਡਲ ਦੇ ਫਿੱਟ ਤੇ ਕੀ ਪ੍ਰਭਾਵ ਪੈਂਦਾ ਹੈ।

5. ਆਊਟਲਾਇਰਾਂ ਦੀ ਪਛਾਣ

6. ਅਸੀਂ ਸਕੈਟਰ ਪਲਾਟ (scatter plot) ਅਤੇ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਦੇ ਗ੍ਰਾਫ ਨੂੰ ਦੇਖ ਕੇ ਆਊਟਲਾਇਰਾਂ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾ ਸਕਦੇ ਹਾਂ। ਹਾਲਾਂਕਿ, ਅਸੀਂ ਇਸ ਬਾਰੇ ਕੁਝ ਦਿਸ਼ਾ-ਨਿਰਦੇਸ਼ ਚਾਹੁੰਦੇ ਹਾਂ ਕਿ ਕਿਸੇ ਪੁਆਇੰਟ ਨੂੰ ਆਊਟਲਾਇਰ ਮੰਨਣ ਲਈ ਕਿੰਨੀ ਦੂਰ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ। ਇੱਕ ਮੋਟੇ ਨਿਯਮ ਦੇ ਤੌਰ ਤੇ, ਅਸੀਂ ਕਿਸੇ ਵੀ ਪੁਆਇੰਟ ਨੂੰ ਆਊਟਲਾਇਰ ਵਜੋਂ ਫਲੈਗ ਕਰ ਸਕਦੇ ਹਾਂ ਜੋ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਤੋਂ ਉੱਪਰ ਜਾਂ ਹੇਠਾਂ ਦੋ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨਾਂ (standard deviations) ਤੋਂ ਵੱਧ ਦੂਰ ਸਥਿਤ ਹੈ। ਵਰਤਿਆ ਗਿਆ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਬਕਾਇਆ ਜਾਂ ਗਲਤੀਆਂ ਦਾ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਹੈ।

7. ਅਸੀਂ ਇਸਨੂੰ ਸਕੈਟਰ ਪਲਾਟ ਵਿੱਚ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਤੋਂ ਦੋ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨਾਂ ਉੱਪਰ ਅਤੇ ਹੇਠਾਂ ਇੱਕ ਵਾਧੂ ਜੋੜੀ ਰੇਖਾਵਾਂ ਖਿੱਚ ਕੇ ਦ੍ਰਿਸ਼ਟੀਗਤ (visually) ਰੂਪ ਵਿੱਚ ਕਰ ਸਕਦੇ ਹਾਂ। ਇਸ ਵਾਧੂ ਜੋੜੀ ਰੇਖਾਵਾਂ ਦੇ ਬਾਹਰ ਕੋਈ ਵੀ ਡਾਟਾ ਪੁਆਇੰਟ ਸੰਭਾਵੀ ਆਊਟਲਾਇਰ ਵਜੋਂ ਫਲੈਗ ਕੀਤੇ ਜਾਂਦੇ ਹਨ। ਜਾਂ, ਅਸੀਂ ਹਰੇਕ ਬਕਾਇਆ ਦੀ ਗਣਨਾ ਕਰਕੇ ਅਤੇ ਇਸਦੀ ਦੋ ਗੁਣਾ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਨਾਲ ਤੁਲਨਾ ਕਰਕੇ ਇਸਨੂੰ ਸੰਖਿਆਤਮਕ (numerically) ਰੂਪ ਵਿੱਚ ਕਰ ਸਕਦੇ ਹਾਂ। TI-83, 83+, ਜਾਂ 84+ ਕੈਲਕੂਲੇਟਰਾਂ ਦੇ ਸੰਬੰਧ ਵਿੱਚ, ਦ੍ਰਿਸ਼ਟੀਗਤ ਪਹੁੰਚ ਆਸਾਨ ਹੈ। ਦ੍ਰਿਸ਼ਟੀਗਤ ਪ੍ਰਕਿਰਿਆ ਪਹਿਲਾਂ ਦਿਖਾਈ ਗਈ ਹੈ, ਉਸ ਤੋਂ ਬਾਅਦ ਸੰਖਿਆਤਮਕ ਗਣਨਾਵਾਂ ਕੀਤੀਆਂ ਗਈਆਂ ਹਨ। ਤੁਹਾਨੂੰ ਆਮ ਤੌਰ 'ਤੇ ਇਹਨਾਂ ਵਿੱਚੋਂ ਸਿਰਫ ਇੱਕ ਵਿਧੀ ਦੀ ਵਰਤੋਂ ਕਰਨ ਦੀ ਲੋੜ ਹੋਵੇਗੀ।

8. ਉਦਾਹਰਨ 12.11

9. ਸਮੱਸਿਆ

10. ਤੀਜੇ ਇਮਤਿਹਾਨ/ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਦੇ ਉਦਾਹਰਨ ਵਿੱਚ, ਤੁਸੀਂ ਇਹ ਨਿਰਧਾਰਤ ਕਰ ਸਕਦੇ ਹੋ ਕਿ ਕੀ ਕੋਈ ਆਊਟਲਾਇਰ ਹੈ। ਜੇਕਰ ਕੋਈ ਆਊਟਲਾਇਰ ਹੈ, ਤਾਂ ਇੱਕ ਕਸਰਤ ਵਜੋਂ, ਇਸਨੂੰ ਹਟਾਓ ਅਤੇ ਬਾਕੀ ਡਾਟਾ ਨੂੰ ਇੱਕ ਨਵੀਂ ਰੇਖਾ 'ਤੇ ਫਿੱਟ ਕਰੋ। ਇਸ ਉਦਾਹਰਨ ਲਈ, ਨਵੀਂ ਰੇਖਾ ਨੂੰ ਬਾਕੀ ਡਾਟਾ ਨੂੰ ਬਿਹਤਰ ਢੰਗ ਨਾਲ ਫਿੱਟ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ SSE (ਗਲਤੀਆਂ ਦਾ ਵਰਗ ਜੋੜ) ਛੋਟਾ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ 1 ਜਾਂ –1 ਦੇ ਨੇੜੇ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ।

11. ਹੱਲ

12. ਆਊਟਲਾਇਰਾਂ ਦੀ ਦ੍ਰਿਸ਼ਟੀਗਤ ਪਛਾਣ

13. ਜਿਵੇਂ ਅਸੀਂ ਰਿਗਰੈਸ਼ਨ ਰੇਖਾ ਦੇ ਸਮੀਕਰਨ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਨਾਲ ਕੀਤਾ ਸੀ, ਅਸੀਂ ਇਸ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਦੀ ਗਣਨਾ ਆਪਣੇ ਲਈ ਕਰਨ ਲਈ ਤਕਨਾਲੋਜੀ ਦੀ ਵਰਤੋਂ ਕਰਾਂਗੇ। LinRegTTest ਦੀ ਵਰਤੋਂ ਇਹਨਾਂ ਡਾਟਾ ਨਾਲ ਕਰਦੇ ਹੋਏ, s = 16.412 ਲੱਭਣ ਲਈ ਆਉਟਪੁੱਟ ਸਕ੍ਰੀਨਾਂ ਰਾਹੀਂ ਸਕ੍ਰੋਲ ਕਰੋ।

14. ਲਾਈਨ Y2 = –173.5 + 4.83x – 2(16.4), ਅਤੇ ਲਾਈਨ Y3 = –173.5 + 4.83x + 2(16.4), ਜਿੱਥੇ ŷ = –173.5 + 4.83x ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਹੈ। Y2 ਅਤੇ Y3 ਦੀ ਢਲਾਣ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਦੇ ਸਮਾਨ ਹੈ।

15. ਸਕੈਟਰ ਪਲਾਟ ਨੂੰ ਸਮੀਕਰਨ Y1 ਵਿੱਚ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਨਾਲ ਗ੍ਰਾਫ ਕਰੋ, ਫਿਰ Y= ਸਮੀਕਰਨ ਸੰਪਾਦਕ ਵਿੱਚ Y2 ਅਤੇ Y3 ਨੂੰ ਦੋ ਵਾਧੂ ਰੇਖਾਵਾਂ ਵਜੋਂ ਦਾਖਲ ਕਰੋ। ਇੱਕ ਚੰਗਾ ਦ੍ਰਿਸ਼ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ZOOM-9 ਦਬਾਓ। ਤੁਸੀਂ ਦੇਖੋਗੇ ਕਿ ਇੱਕੋ ਇੱਕ ਪੁਆਇੰਟ ਜੋ Y2 ਅਤੇ Y3 ਦੇ ਵਿਚਕਾਰ ਨਹੀਂ ਹੈ, ਉਹ ਪੁਆਇੰਟ (65, 175) ਹੈ। ਕੈਲਕੂਲੇਟਰ ਸਕ੍ਰੀਨ ਤੇ, ਇਹ ਇਨ੍ਹਾਂ ਰੇਖਾਵਾਂ ਤੋਂ ਬਹੁਤ ਬਾਹਰ ਹੈ, ਪਰ ਇਸਨੂੰ ਇੱਕ ਆਊਟਲਾਇਰ ਮੰਨਿਆ ਜਾਂਦਾ ਹੈ ਕਿਉਂਕਿ ਇਹ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਤੋਂ ਦੋ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨਾਂ ਤੋਂ ਵੱਧ ਦੂਰ ਹੈ। ਆਊਟਲਾਇਰ ਉਹ ਵਿਦਿਆਰਥੀ ਹੈ ਜਿਸ ਨੇ ਤੀਜੇ ਇਮਤਿਹਾਨ ਵਿੱਚ 65 ਅਤੇ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਵਿੱਚ 175 ਗ੍ਰੇਡ ਪ੍ਰਾਪਤ ਕੀਤਾ ਸੀ।

16. ਕਈ ਵਾਰ ਇੱਕ ਪੁਆਇੰਟ ਗ੍ਰਾਫ ਤੇ ਆਊਟਲਾਇਰਾਂ ਨੂੰ ਫਲੈਗ ਕਰਨ ਲਈ ਵਰਤੀਆਂ ਜਾਂਦੀਆਂ ਰੇਖਾਵਾਂ ਦੇ ਇੰਨਾ ਨੇੜੇ ਹੁੰਦਾ ਹੈ ਕਿ ਇਹ ਦੱਸਣਾ ਮੁਸ਼ਕਲ ਹੁੰਦਾ ਹੈ ਕਿ ਪੁਆਇੰਟ ਰੇਖਾਵਾਂ ਦੇ ਵਿਚਕਾਰ ਹੈ ਜਾਂ ਬਾਹਰ। ਕੰਪਿਊਟਰ ਤੇ, ਗ੍ਰਾਫ ਨੂੰ ਵੱਡਾ ਕਰਨ ਨਾਲ ਮਦਦ ਮਿਲ ਸਕਦੀ ਹੈ; ਇੱਕ ਛੋਟੀ ਕੈਲਕੂਲੇਟਰ ਸਕ੍ਰੀਨ ਤੇ, ਜ਼ੂਮ ਇਨ ਕਰਨ ਨਾਲ ਗ੍ਰਾਫ ਸਪੱਸ਼ਟ ਹੋ ਸਕਦਾ ਹੈ। ਨੋਟ ਕਰੋ ਕਿ ਜਦੋਂ ਗ੍ਰਾਫ ਕਾਫੀ ਸਪੱਸ਼ਟ ਤਸਵੀਰ ਨਹੀਂ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਆਊਟਲਾਇਰਾਂ ਦੀ ਪਛਾਣ ਕਰਨ ਲਈ ਸੰਖਿਆਤਮਕ ਤੁਲਨਾਵਾਂ ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹੋ।

17. ਕੋਸ਼ਿਸ਼ ਕਰੋ 12.11

18. ਸਕੈਟਰ ਪਲਾਟ ਵਿੱਚ ਸੰਭਾਵੀ ਆਊਟਲਾਇਰ ਦੀ ਪਛਾਣ ਕਰੋ। ਬਕਾਇਆ, ਜਾਂ ਗਲਤੀਆਂ, ਦਾ ਸਟੈਂਡਰਡ ਡਿਵੀਏਸ਼ਨ ਲਗਭਗ 8.6 ਹੈ।

19. ਆਊਟਲਾਇਰਾਂ ਦੀ ਸੰਖਿਆਤਮਕ ਪਛਾਣ

20. ਟੇਬਲ 12.6 ਵਿੱਚ, ਪਹਿਲੇ ਦੋ ਕਾਲਮ ਤੀਜੇ ਇਮਤਿਹਾਨ ਅਤੇ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਦੇ ਡਾਟਾ ਨੂੰ ਸ਼ਾਮਲ ਕਰਦੇ ਹਨ। ਤੀਜਾ ਕਾਲਮ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਰੇਖਾ ਤੋਂ ਗਣਨਾ ਕੀਤੇ ਗਏ ਅਨੁਮਾਨਿਤ ŷ ਮੁੱਲਾਂ ਨੂੰ ਦਿਖਾਉਂਦਾ ਹੈ: ŷ = –173.5 + 4.83x। ਬਕਾਇਆ, ਜਾਂ ਗਲਤੀਆਂ, ਜਿਨ੍ਹਾਂ ਦਾ ਇਸ ਅਧਿਆਇ ਦੇ ਭਾਗ 3 ਵਿੱਚ ਜ਼ਿਕਰ ਕੀਤਾ ਗਿਆ ਹੈ, ਟੇਬਲ ਦੇ ਚੌਥੇ ਕਾਲਮ ਵਿੱਚ ਗਣਨਾ ਕੀਤੀ ਗਈ ਹੈ: ਦੇਖਿਆ ਗਿਆ y ਮੁੱਲ – ਅਨੁਮਾਨਿਤ y ਮੁੱਲ = y – ŷ।

1. s ਸਾਰੇ y – ŷ = ε ਮੁੱਲਾਂ ਦਾ ਮਿਆਰੀ ਵਿਗਾੜ ਹੈ, ਜਿੱਥੇ n ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਦੀ ਕੁੱਲ ਗਿਣਤੀ ਹੈ। ਜੇ ਹਰ ਇੱਕ ਬਾਕੀ ਰਹਿੰਦੇ ਮੁੱਲ ਦੀ ਗਣਨਾ ਕੀਤੀ ਜਾਂਦੀ ਹੈ ਅਤੇ ਵਰਗ ਕੀਤਾ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਨਤੀਜਿਆਂ ਨੂੰ ਜੋੜਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਸਾਨੂੰ SSE ਮਿਲਦਾ ਹੈ। ਬਾਕੀ ਰਹਿੰਦੇ ਮੁੱਲਾਂ ਦਾ ਮਿਆਰੀ ਵਿਗਾੜ SSE ਤੋਂ ਇਸ ਤਰ੍ਹਾਂ ਗਿਣਿਆ ਜਾਂਦਾ ਹੈ

2. ਨੋਟ

3. ਅਸੀਂ (n – 2) ਨਾਲ ਭਾਗ ਕਰਦੇ ਹਾਂ ਕਿਉਂਕਿ ਰਿਗਰੈਸ਼ਨ ਮਾਡਲ ਵਿੱਚ ਦੋ ਅਨੁਮਾਨ ਸ਼ਾਮਲ ਹੁੰਦੇ ਹਨ।

4. s ਦਾ ਮੁੱਲ ਆਪਣੇ ਆਪ ਗਿਣਨ ਦੀ ਬਜਾਏ, ਅਸੀਂ ਕੰਪਿਊਟਰ ਜਾਂ ਕੈਲਕੂਲੇਟਰ ਦੀ ਵਰਤੋਂ ਕਰਕੇ s ਲੱਭ ਸਕਦੇ ਹਾਂ। ਇਸ ਉਦਾਹਰਨ ਲਈ, ਕੈਲਕੂਲੇਟਰ ਫੰਕਸ਼ਨ LinRegTTest ਨੇ ਬਾਕੀ ਰਹਿੰਦੇ ਮੁੱਲਾਂ 35; –17; 16; –6; –19; 9; 3; –1; –10; –9; –1 ਦਾ ਮਿਆਰੀ ਵਿਗਾੜ s = 16.4 ਪਾਇਆ।

5. ਕਤਾਰ: x | y | ŷ | y – ŷ

6. ਕਤਾਰ: 65 | 175 | 140 | 175 – 140 = 35

7. ਕਤਾਰ: 67 | 133 | 150 | 133 – 150= –17

8. ਕਤਾਰ: 71 | 185 | 169 | 185 – 169 = 16

9. ਕਤਾਰ: 71 | 163 | 169 | 163 – 169 = –6

10. ਕਤਾਰ: 66 | 126 | 145 | 126 – 145 = –19

11. ਕਤਾਰ: 75 | 198 | 189 | 198 – 189 = 9

12. ਕਤਾਰ: 67 | 153 | 150 | 153 – 150 = 3

13. ਕਤਾਰ: 70 | 163 | 164 | 163 – 164 = –1

14. ਕਤਾਰ: 71 | 159 | 169 | 159 – 169 = –10

15. ਕਤਾਰ: 69 | 151 | 160 | 151 – 160 = –9

16. ਕਤਾਰ: 69 | 159 | 160 | 159 – 160 = –1

17. ਅਸੀਂ ਉਹਨਾਂ ਸਾਰੇ ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਦੀ ਭਾਲ ਕਰ ਰਹੇ ਹਾਂ ਜਿਨ੍ਹਾਂ ਲਈ ਬਾਕੀ ਰਹਿੰਦਾ ਮੁੱਲ 2s = 2(16.4) = 32.8 ਤੋਂ ਵੱਧ ਹੈ ਜਾਂ –32.8 ਤੋਂ ਘੱਟ ਹੈ। ਇਹਨਾਂ ਮੁੱਲਾਂ ਦੀ ਤੁਲਨਾ ਟੇਬਲ ਦੇ ਚੌਥੇ ਕਾਲਮ ਵਿੱਚ ਬਾਕੀ ਰਹਿੰਦੇ ਮੁੱਲਾਂ ਨਾਲ ਕਰੋ। ਅਜਿਹਾ ਇਕੋ ਡਾਟਾ ਪੁਆਇੰਟ ਉਹ ਵਿਦਿਆਰਥੀ ਹੈ ਜਿਸਨੂੰ ਤੀਜੇ ਇਮਤਿਹਾਨ ਵਿੱਚ 65 ਗ੍ਰੇਡ ਅਤੇ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਵਿੱਚ 175 ਪ੍ਰਾਪਤ ਹੋਇਆ ਸੀ; ਇਸ ਵਿਦਿਆਰਥੀ ਲਈ ਬਾਕੀ ਰਹਿੰਦਾ ਮੁੱਲ 35 ਹੈ।

18. ਆਊਟਲਾਇਰ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਲਾਈਨ ਨੂੰ ਕਿਵੇਂ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ?

19. ਸੰਖਿਆਤਮਕ ਅਤੇ ਗ੍ਰਾਫੀਕਲ ਤੌਰ 'ਤੇ, ਅਸੀਂ ਬਿੰਦੂ (65, 175) ਨੂੰ ਇੱਕ ਆਊਟਲਾਇਰ ਵਜੋਂ ਪਛਾਣਿਆ ਹੈ। ਯਾਦ ਰੱਖੋ ਕਿ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਉਣ ਤੋਂ ਬਾਅਦ, ਲੀਸਟ-ਸਕੁਏਅਰ ਰਿਗਰੈਸ਼ਨ ਲਾਈਨ ਅਤੇ ਸਾਰਾਂਕੀ ਦੇ ਮੁੜ-ਗਣਨਾ ਦੀ ਵਰਤੋਂ ਇਹ ਨਿਰਧਾਰਤ ਕਰਨ ਲਈ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ ਕਿ ਕੀ ਕੋਈ ਆਊਟਲਾਇਰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਬਿੰਦੂ ਵੀ ਹੈ। ਇਹ ਪ੍ਰਕਿਰਿਆ ਤੁਹਾਨੂੰ ਵੇਰੀਏਬਲਾਂ ਦੇ ਸਹਿ-ਸੰਬੰਧ ਦੀ ਮਜ਼ਬੂਤੀ ਅਤੇ ਕਿਸੇ ਵੀ ਆਊਟਲਾਇਰ ਨੂੰ ਛੱਡਣ ਤੋਂ ਪਹਿਲਾਂ ਅਤੇ ਬਾਅਦ ਢਲਾਣ ਵਿੱਚ ਸੰਭਾਵੀ ਬਦਲਾਵਾਂ ਦੀ ਤੁਲਨਾ ਕਰਨ ਦੀ ਵੀ ਆਗਿਆ ਦਿੰਦੀ ਹੈ।

20. 10 ਬਾਕੀ ਰਹਿੰਦੇ ਬਿੰਦੂਆਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਇੱਕ ਨਵੀਂ ਸਭ ਤੋਂ ਵਧੀਆ-ਫਿੱਟ ਲਾਈਨ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਦੀ ਗਣਨਾ ਕਰੋ।

21. TI-83, TI-83+, ਜਾਂ TI-84+ ਕੈਲਕੂਲੇਟਰਾਂ 'ਤੇ, L1 ਅਤੇ L2 ਤੋਂ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਓ। LinRegTTest ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ਜੋ ਕਿ Stat ਅਤੇ Tests ਦੇ ਅਧੀਨ ਪਾਇਆ ਜਾਂਦਾ ਹੈ, ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਦੀ ਨਵੀਂ ਲਾਈਨ ਹੇਠ ਲਿਖੇ ਅਨੁਸਾਰ ਹਨ:

22. ŷ =−355.19+7.39x ਅਤੇ r=0.9121।

23. ਢਲਾਣ ਹੁਣ 7.39 ਹੈ, ਜਦੋਂ ਕਿ ਪਿਛਲੀ ਢਲਾਣ 4.83 ਸੀ। ਇਹ ਮਹੱਤਵਪੂਰਨ ਜਾਪਦਾ ਹੈ, ਪਰ ਸਾਨੂੰ r-ਮੁੱਲਾਂ ਵਿੱਚ ਬਦਲਾਅ ਨੂੰ ਵੀ ਦੇਖਣ ਦੀ ਲੋੜ ਹੈ। ਨਵੀਂ ਲਾਈਨ r=0.9121 ਦਿਖਾਉਂਦੀ ਹੈ, ਜੋ ਕਿ ਅਸਲ ਲਾਈਨ, r=0.6631, ਨਾਲੋਂ ਮਜ਼ਬੂਤ ਸਹਿ-ਸੰਬੰਧ ਦਰਸਾਉਂਦੀ ਹੈ, ਕਿਉਂਕਿ r=0.9121, 1 ਦੇ ਨੇੜੇ ਹੈ। ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਨਵੀਂ ਲਾਈਨ ਡਾਟਾ ਮੁੱਲਾਂ ਲਈ ਇੱਕ ਬਿਹਤਰ ਫਿੱਟ ਹੈ। ਇਹ ਲਾਈਨ ਤੀਜੇ ਇਮਤਿਹਾਨ ਦੇ ਸਕੋਰ ਨੂੰ ਦਿੱਤੇ ਗਏ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਦੇ ਸਕੋਰ ਦੀ ਬਿਹਤਰ ਭਵਿੱਖਬਾਣੀ ਕਰ ਸਕਦੀ ਹੈ। ਇਸਦਾ ਮਤਲਬ ਇਹ ਵੀ ਹੈ ਕਿ (65, 175) ਦਾ ਆਊਟਲਾਇਰ ਇੱਕ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਬਿੰਦੂ ਸੀ, ਕਿਉਂਕਿ r-ਮੁੱਲਾਂ ਵਿੱਚ ਇੱਕ ਵੱਡਾ ਅੰਤਰ ਹੈ। ਸਾਨੂੰ ਹੁਣ ਇਹ ਫੈਸਲਾ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ ਕਿ ਕੀ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਉਣਾ ਹੈ। ਜੇ ਆਊਟਲਾਇਰ ਗਲਤੀ ਨਾਲ ਦਰਜ ਕੀਤਾ ਗਿਆ ਸੀ, ਤਾਂ ਇਸਨੂੰ ਯਕੀਨਨ ਹਟਾ ਦੇਣਾ ਚਾਹੀਦਾ ਹੈ। ਕਿਉਂਕਿ ਇਹ ਸਹਿ-ਸੰਬੰਧ 'ਤੇ ਇੰਨਾ ਡੂੰਘਾ ਪ੍ਰਭਾਵ ਪੈਦਾ ਕਰਦਾ ਹੈ, ਸਭ ਤੋਂ ਵਧੀਆ ਫਿੱਟ ਦੀ ਨਵੀਂ ਲਾਈਨ ਬਿਹਤਰ ਭਵਿੱਖਬਾਣੀ ਅਤੇ ਇੱਕ ਸਮੁੱਚੇ ਤੌਰ 'ਤੇ ਮਜ਼ਬੂਤ ਮਾਡਲ ਦੀ ਆਗਿਆ ਦਿੰਦੀ ਹੈ।

24. ਤੁਸੀਂ ਦੋ ਲੀਸਟ-ਸਕੁਏਅਰ ਰਿਗਰੈਸ਼ਨ ਲਾਈਨਾਂ ਨੂੰ ਗ੍ਰਾਫ ਕਰਨ ਅਤੇ ਲਾਈਨਾਂ ਦੀਆਂ ਢਲਾਣਾਂ ਅਤੇ ਡਾਟਾ ਲਈ ਫਿੱਟ ਦੀ ਤੁਲਨਾ ਕਰਨ ਲਈ Excel ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹੋ, ਜਿਵੇਂ ਕਿ ਚਿੱਤਰ 12.17 ਵਿੱਚ ਦਿਖਾਇਆ ਗਿਆ ਹੈ।

You can see that the second graph shows less deviation from the line of best fit. It is clear that omission of the influential point produced a line of best fit that more closely models the data.

Numerical Identification of Outliers: Calculating s and Finding Outliers Manually

If you do not have the function LinRegTTest on your calculator, then you must calculate the outlier in the first example by doing the following. First, square each |y – ŷ|.

The squares are 352; 172; 162; 62; 192; 92; 32; 12; 102; 92; 12.

Then, add (sum) all the |y – ŷ| squared terms using the formula

Σ i = 1 11 ( | y i − ŷ i | ) 2 = Σ i = 1 11 ε i 2 Σ i = 1 11 ( | y i − ŷ i | ) 2 = Σ i = 1 11 ε i 2 (Recall that yi – ŷi = εi).

= 352 + 172 + 162 + 62 + 192 + 92 + 32 + 12 + 102 + 92 + 12

= 2,440 = SSE.

The result, SSE, is the sum of squared errors.

Next, calculate s, the standard deviation of all the y – ŷ = ε-values where n = the total number of data points.

The calculation is s= SSE n–2 s= SSE n–2.

For the third exam/final exam example, s= 2440 11–2 =16.47. s= 2440 11–2 =16.47.

Next, multiply s by 2: (2)(16.47) = 32.94 32.94 is two standard deviations away from the mean of the y – ŷ values.

If we were to measure the vertical distance from any data point to the corresponding point on the line of best fit and that distance is at least 2s, then we would consider the data point to be too far from the line of best fit. We call that point a potential outlier.

For the example, if any of the |y – ŷ| values are at least 32.94, the corresponding (x, y) data point is a potential outlier.

For the third exam/final exam example, all the |y – ŷ| values are less than 31.29 except for the first one, which is 35:

35 > 31.29. That is, |y – ŷ| ≥ (2)(s).

The point that corresponds to |y – ŷ| = 35 is (65, 175). Therefore, the data point (65, 175) is a potential outlier. For this example, we will delete it. (Remember, we do not always delete an outlier.)

Note

When outliers are deleted, the researcher should either record that data were deleted, and why, or the researcher should provide results both with and without the deleted data. If data are erroneous and the correct values are known (e.g., student 1 actually scored a 70 instead of a 65), then this correction can be made to the data.

The next step is to compute a new best-fit line using the 10 remaining points. The new line of best fit and the correlation coefficient are

ŷ = –355.19 + 7.39x and r = .9121.

Example 12.12

Problem

1. ਇਸ ਨਵੀਂ ਬਿਹਤਰੀਨ ਫਿੱਟ ਲਾਈਨ (ਤੀਜੇ ਇਮਤਿਹਾਨ/ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਉਦਾਹਰਨ ਵਿੱਚ ਬਾਕੀ 10 ਡਾਟਾ ਪੁਆਇੰਟਾਂ ਦੇ ਆਧਾਰ ਤੇ) ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ਤੀਜੇ ਇਮਤਿਹਾਨ ਵਿੱਚ 73 ਅੰਕ ਪ੍ਰਾਪਤ ਕਰਨ ਵਾਲਾ ਵਿਦਿਆਰਥੀ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਵਿੱਚ ਕਿੰਨੇ ਅੰਕ ਪ੍ਰਾਪਤ ਕਰਨ ਦੀ ਉਮੀਦ ਕਰੇਗਾ? ਕੀ ਇਹ ਉਸ ਭਵਿੱਖਬਾਣੀ ਦੇ ਸਮਾਨ ਹੈ ਜੋ ਮੂਲ ਲਾਈਨ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਕੀਤੀ ਗਈ ਸੀ?

2. ਹੱਲ

3. ਬਿਹਤਰੀਨ ਫਿੱਟ ਦੀ ਨਵੀਂ ਲਾਈਨ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ŷ = –355.19 + 7.39(73) = 184.28। ਤੀਜੇ ਇਮਤਿਹਾਨ ਵਿੱਚ 73 ਅੰਕ ਪ੍ਰਾਪਤ ਕਰਨ ਵਾਲਾ ਵਿਦਿਆਰਥੀ ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਵਿੱਚ 184 ਅੰਕ ਪ੍ਰਾਪਤ ਕਰਨ ਦੀ ਉਮੀਦ ਕਰੇਗਾ। ਮੂਲ ਲਾਈਨ ਨੇ ਭਵਿੱਖਬਾਣੀ ਕੀਤੀ ਸੀ ਕਿ ŷ = –173.51 + 4.83(73) = 179.08, ਇਸ ਲਈ ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾ ਕੇ ਨਵੀਂ ਲਾਈਨ ਨਾਲ ਕੀਤੀ ਗਈ ਭਵਿੱਖਬਾਣੀ ਮੂਲ ਭਵਿੱਖਬਾਣੀ ਤੋਂ ਵੱਖਰੀ ਹੈ।

4. ਇਸਨੂੰ ਅਜ਼ਮਾਓ 12.12

5. ਤੀਜੇ ਇਮਤਿਹਾਨ/ਅੰਤਿਮ ਇਮਤਿਹਾਨ ਉਦਾਹਰਨ ਤੋਂ ਗ੍ਰਾਫ ਲਈ ਡਾਟਾ ਪੁਆਇੰਟ ਹੇਠ ਲਿਖੇ ਅਨੁਸਾਰ ਹਨ: (1, 5), (2, 7), (2, 6), (3, 9), (4, 12), (4, 13), (5, 18), (6, 19), (7, 12), ਅਤੇ (7, 21)। ਆਊਟਲਾਇਰ ਨੂੰ ਹਟਾਓ ਅਤੇ ਬਿਹਤਰੀਨ ਫਿੱਟ ਲਾਈਨ ਦੀ ਮੁੜ ਗਣਨਾ ਕਰੋ। ਜਦੋਂ x = 10 ਹੋਵੇ ਤਾਂ ŷ ਦਾ ਮੁੱਲ ਪਤਾ ਕਰੋ।

6. ਉਦਾਹਰਨ 12.13

7. ਖਪਤਕਾਰ ਮੁੱਲ ਸੂਚਕਾਂਕ (CPI) ਖਪਤਕਾਰਾਂ ਦੁਆਰਾ ਖਪਤਕਾਰ ਵਸਤਾਂ ਅਤੇ ਸੇਵਾਵਾਂ ਲਈ ਅਦਾ ਕੀਤੇ ਗਏ ਮੁੱਲਾਂ ਵਿੱਚ ਸਮੇਂ ਦੇ ਨਾਲ ਔਸਤ ਤਬਦੀਲੀ ਨੂੰ ਮਾਪਦਾ ਹੈ। CPI ਲਗਭਗ ਸਾਰੇ ਅਮਰੀਕੀਆਂ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ ਕਿਉਂਕਿ ਇਸਦੇ ਬਹੁਤ ਸਾਰੇ ਉਪਯੋਗ ਹਨ। ਇਸਦੇ ਸਭ ਤੋਂ ਵੱਡੇ ਉਪਯੋਗਾਂ ਵਿੱਚੋਂ ਇੱਕ ਮਹਿੰਗਾਈ ਦੇ ਮਾਪ ਵਜੋਂ ਹੈ। ਦੇਸ਼ ਦੀ ਆਰਥਿਕਤਾ ਵਿੱਚ ਮੁੱਲ ਤਬਦੀਲੀਆਂ ਬਾਰੇ ਸਰਕਾਰ, ਕਾਰੋਬਾਰਾਂ ਅਤੇ ਕਿਰਤ ਬਲਾਂ ਨੂੰ ਜਾਣਕਾਰੀ ਪ੍ਰਦਾਨ ਕਰਕੇ, CPI ਉਹਨਾਂ ਨੂੰ ਆਰਥਿਕ ਫੈਸਲੇ ਲੈਣ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ। ਰਾਸ਼ਟਰਪਤੀ, ਯੂ.ਐਸ. ਕਾਂਗਰਸ, ਅਤੇ ਫੈਡਰਲ ਰਿਜ਼ਰਵ ਬੋਰਡ ਮੁਦਰਾ ਅਤੇ ਵਿੱਤੀ ਨੀਤੀਆਂ ਬਣਾਉਣ ਲਈ CPI ਰੁਝਾਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ। ਹੇਠ ਲਿਖੀ ਸਾਰਣੀ ਵਿੱਚ, x ਸਾਲ ਹੈ ਅਤੇ y CPI ਹੈ।

8. ਕਤਾਰ: x | y | x | y

9. ਕਤਾਰ: 1915 | 10.1 | 1969 | 36.7

10. ਕਤਾਰ: 1926 | 17.7 | 1975 | 49.3

11. ਕਤਾਰ: 1935 | 13.7 | 1979 | 72.6

12. ਕਤਾਰ: 1940 | 14.7 | 1980 | 82.4

13. ਕਤਾਰ: 1947 | 24.1 | 1986 | 109.6

14. ਕਤਾਰ: 1952 | 26.5 | 1991 | 130.7

15. ਕਤਾਰ: 1964 | 31.0 | 1999 | 166.6

16. ਸਮੱਸਿਆ

17. ਡਾਟਾ ਦਾ ਸਕੈਟਰ ਪਲਾਟ ਬਣਾਓ।

18. ਘੱਟੋ-ਘੱਟ-ਵਰਗ ਲਾਈਨ ਦੀ ਗਣਨਾ ਕਰੋ। ਸਮੀਕਰਨ ਨੂੰ ŷ = a + bx ਦੇ ਰੂਪ ਵਿੱਚ ਲਿਖੋ।

19. ਸਕੈਟਰ ਪਲਾਟ 'ਤੇ ਲਾਈਨ ਬਣਾਓ।

20. ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਪਤਾ ਕਰੋ। ਕੀ ਇਹ ਮਹੱਤਵਪੂਰਨ ਹੈ?

21. ਸਾਲ 1990 ਲਈ ਔਸਤ CPI ਕੀ ਹੈ?

22. ਹੱਲ

23. ਚਿੱਤਰ 12.18 ਦੇਖੋ।

24. ਸਾਡੇ ਕੈਲਕੂਲੇਟਰ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹੋਏ, ŷ = –3204 + 1.662x ਬਿਹਤਰੀਨ ਫਿੱਟ ਲਾਈਨ ਦਾ ਸਮੀਕਰਨ ਹੈ।

1. ਚਿੱਤਰ 12.18 ਵੇਖੋ।

2. r = 0.8694। ਅੰਕੜਿਆਂ ਦੀ ਗਿਣਤੀ n = 14 ਹੈ। ਅਧਿਆਇ 12 ਦੇ ਅੰਤ ਵਿੱਚ ਨਮੂਨਾ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਦੇ 95 ਪ੍ਰਤੀਸ਼ਤ ਕ੍ਰਿਟੀਕਲ ਮੁੱਲਾਂ ਵਾਲੀ ਸਾਰਣੀ ਦੀ ਵਰਤੋਂ ਕਰੋ: ਇਸ ਮਾਮਲੇ ਵਿੱਚ, df = 12 ਹੈ। ਸਾਰਣੀ ਤੋਂ ਸੰਬੰਧਿਤ ਕ੍ਰਿਟੀਕਲ ਮੁੱਲ ±0.532 ਹਨ। ਕਿਉਂਕਿ 0.8694 > 0.532, r ਮਹੱਤਵਪੂਰਨ ਹੈ। ਅਸੀਂ ਉੱਪਰ ਲੱਭੀ ਗਈ ਅਨੁਮਾਨਿਤ ਰਿਗਰੈਸ਼ਨ ਲਾਈਨ ਦੀ ਵਰਤੋਂ x = 1990 ਲਈ ਅਨੁਮਾਨ ਲਗਾਉਣ ਲਈ ਕਰ ਸਕਦੇ ਹਾਂ।

3. ŷ = –3204 + 1.662(1990) = 103.4 CPI।

4. ਨੋਟ

5. ਉਦਾਹਰਨ ਵਿੱਚ, ਲਾਈਨ ਦੇ ਮੁਕਾਬਲੇ ਬਿੰਦੂਆਂ ਦੇ ਪੈਟਰਨ ਵੱਲ ਧਿਆਨ ਦਿਓ। ਭਾਵੇਂ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਮਹੱਤਵਪੂਰਨ ਹੈ, ਸਕੈਟਰ ਪਲਾਟ ਵਿੱਚ ਪੈਟਰਨ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਲਾਈਨ ਦੀ ਬਜਾਏ ਇੱਕ ਵਕਰ (curve) ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਵਧੇਰੇ ਢੁਕਵਾਂ ਮਾਡਲ ਹੋਵੇਗਾ। ਇਸ ਉਦਾਹਰਨ ਵਿੱਚ, ਇੱਕ ਅੰਕੜਾ ਵਿਗਿਆਨੀ ਸਾਡੇ ਦੁਆਰਾ ਲੱਭੀ ਗਈ ਲਾਈਨ ਨਾਲ ਅੰਕੜਿਆਂ ਦਾ ਮਾਡਲ ਬਣਾਉਣ ਦੀ ਬਜਾਏ, ਇਹਨਾਂ ਅੰਕੜਿਆਂ ਲਈ ਇੱਕ ਵਕਰ ਫਿੱਟ ਕਰਨ ਲਈ ਹੋਰ ਤਰੀਕਿਆਂ ਦੀ ਵਰਤੋਂ ਕਰਨਾ ਪਸੰਦ ਕਰੇਗਾ। ਗਣਨਾਵਾਂ ਕਰਨ ਤੋਂ ਇਲਾਵਾ, ਜਦੋਂ ਇਹ ਫੈਸਲਾ ਕਰਨਾ ਹੋਵੇ ਕਿ ਕੀ ਇੱਕ ਰੇਖੀ ਮਾਡਲ ਢੁਕਵਾਂ ਹੈ, ਤਾਂ ਸਕੈਟਰ ਪਲਾਟ ਨੂੰ ਵੇਖਣਾ ਹਮੇਸ਼ਾ ਮਹੱਤਵਪੂਰਨ ਹੁੰਦਾ ਹੈ।

6. ਜੇਕਰ ਤੁਸੀਂ ਅੰਕੜਿਆਂ ਦੇ ਹੋਰ ਸਾਲਾਂ ਨੂੰ ਵੇਖਣ ਵਿੱਚ ਦਿਲਚਸਪੀ ਰੱਖਦੇ ਹੋ, ਤਾਂ ਬਿਊਰੋ ਆਫ਼ ਲੇਬਰ ਸਟੈਟਿਸਟਿਕਸ CPI ਵੈੱਬਸਾਈਟ (ftp://ftp.bls.gov/pub/special.requests/cpi/cpiai.txt) 'ਤੇ ਜਾਓ। ਸਾਡੇ ਅੰਕੜੇ ਸਾਲਾਨਾ ਔਸਤ (ਸੱਜੇ ਤੋਂ ਤੀਜਾ ਕਾਲਮ) ਕਾਲਮ ਤੋਂ ਲਏ ਗਏ ਹਨ। ਉਦਾਹਰਨ ਲਈ, ਤੁਸੀਂ ਹੋਰ ਮੌਜੂਦਾ ਸਾਲਾਂ ਦੇ ਅੰਕੜੇ ਜੋੜ ਸਕਦੇ ਹੋ। ਨਵੇਂ ਸਾਲਾਂ ਨੂੰ ਜੋੜਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰੋ: 2004, CPI = 188.9; 2008, CPI = 215.3; ਅਤੇ 2011, CPI = 224.9। ਵੇਖੋ ਕਿ ਇਹ ਮਾਡਲ ਨੂੰ ਕਿਵੇਂ ਪ੍ਰਭਾਵਿਤ ਕਰਦਾ ਹੈ। (ਚੈੱਕ ਕਰੋ: ŷ = –4436 + 2.295x; r = 0.9018। ਕੀ r ਮਹੱਤਵਪੂਰਨ ਹੈ? ਕੀ ਨਵੇਂ ਬਿੰਦੂਆਂ ਦੇ ਜੋੜ ਨਾਲ ਫਿੱਟ ਬਿਹਤਰ ਹੈ?)

7. ਇਸਨੂੰ ਅਜ਼ਮਾਓ 12.13

8. ਹੇਠਾਂ ਦਿੱਤੀ ਸਾਰਣੀ ਪ੍ਰਤੀ ਵਿਅਕਤੀ ਆਮਦਨ (PCINC) ਵਿੱਚ ਮਾਪੀ ਗਈ ਆਰਥਿਕ ਵਿਕਾਸ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ।

9. ਕਤਾਰ: ਸਾਲ | PCINC | ਸਾਲ | PCINC

10. ਕਤਾਰ: 1870 | 340 | 1920 | 1,050

11. ਕਤਾਰ: 1880 | 499 | 1930 | 1,170

12. ਕਤਾਰ: 1890 | 592 | 1940 | 1,364

13. ਕਤਾਰ: 1900 | 757 | 1950 | 1,836

14. ਕਤਾਰ: 1910 | 927 | 1960 | 2,132

15. ਸੁਤੰਤਰ ਅਤੇ ਨਿਰਭਰ ਵੇਰੀਏਬਲ ਕੀ ਹਨ?

16. ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ ਬਣਾਓ।

17. ਵਧੀਆ ਫਿੱਟ ਦੀ ਲਾਈਨ ਅਤੇ ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਲੱਭਣ ਲਈ ਰਿਗਰੈਸ਼ਨ ਦੀ ਵਰਤੋਂ ਕਰੋ।

18. ਸਹਿ-ਸੰਬੰਧ ਗੁਣਾਂਕ ਦੇ ਮਹੱਤਵ ਦੀ ਵਿਆਖਿਆ ਕਰੋ।

19. ਕੀ ਵੇਰੀਏਬਲਾਂ ਵਿਚਕਾਰ ਕੋਈ ਰੇਖੀ ਸਬੰਧ ਹੈ?

20. ਨਿਰਧਾਰਨ ਦੇ ਗੁਣਾਂਕ (coefficient of determination) ਦਾ ਪਤਾ ਲਗਾਓ ਅਤੇ ਇਸਦੀ ਵਿਆਖਿਆ ਕਰੋ।

21. ਰਿਗਰੈਸ਼ਨ ਸਮੀਕਰਨ ਦਾ ਢਲਾਣ (slope) ਕੀ ਹੈ? ਇਸਦਾ ਕੀ ਮਤਲਬ ਹੈ?

22. 1900 ਅਤੇ 2000 ਲਈ PCINC ਦਾ ਅਨੁਮਾਨ ਲਗਾਉਣ ਲਈ ਵਧੀਆ ਫਿੱਟ ਦੀ ਲਾਈਨ ਦੀ ਵਰਤੋਂ ਕਰੋ।

23. ਨਿਰਧਾਰਤ ਕਰੋ ਕਿ ਕੀ ਕੋਈ ਆਊਟਲਾਇਰ (outliers) ਹਨ।

24. ਸੈਂਪਲ ਕੋਰੀਲੇਸ਼ਨ ਕੋਫੀਸ਼ੀਐਂਟ ਟੇਬਲ ਦੇ 95 ਪ੍ਰਤੀਸ਼ਤ ਕ੍ਰਿਟੀਕਲ ਮੁੱਲ

1. ਕਤਾਰ: ਸੁਤੰਤਰਤਾ ਦੀਆਂ ਡਿਗਰੀਆਂ: n – 2 | ਕ੍ਰਿਟੀਕਲ ਮੁੱਲ: + ਅਤੇ –

2. ਕਤਾਰ: 1 | 0.997

3. ਕਤਾਰ: 2 | 0.950

4. ਕਤਾਰ: 3 | 0.878

5. ਕਤਾਰ: 4 | 0.811

6. ਕਤਾਰ: 5 | 0.754

7. ਕਤਾਰ: 6 | 0.707

8. ਕਤਾਰ: 7 | 0.666

9. ਕਤਾਰ: 8 | 0.632

10. ਕਤਾਰ: 9 | 0.602

11. ਕਤਾਰ: 10 | 0.576

12. ਕਤਾਰ: 11 | 0.555

13. ਕਤਾਰ: 12 | 0.532

14. ਕਤਾਰ: 13 | 0.514

15. ਕਤਾਰ: 14 | 0.497

16. ਕਤਾਰ: 15 | 0.482

17. ਕਤਾਰ: 16 | 0.468

18. ਕਤਾਰ: 17 | 0.456

19. ਕਤਾਰ: 18 | 0.444

20. ਕਤਾਰ: 19 | 0.433

21. ਕਤਾਰ: 20 | 0.423

22. ਕਤਾਰ: 21 | 0.413

23. ਕਤਾਰ: 22 | 0.404

24. ਕਤਾਰ: 23 | 0.396

ਸਤਰ: 24 | 0.388

ਸਤਰ: 25 | 0.381

ਸਤਰ: 26 | 0.374

ਸਤਰ: 27 | 0.367

ਸਤਰ: 28 | 0.361

ਸਤਰ: 29 | 0.355

ਸਤਰ: 30 | 0.349

ਸਤਰ: 40 | 0.304

ਸਤਰ: 50 | 0.273

ਸਤਰ: 60 | 0.250

ਸਤਰ: 70 | 0.232

ਸਤਰ: 80 | 0.217

ਸਤਰ: 90 | 0.205

ਸਤਰ: 100 | 0.195