אשד ליןבריאות הציבור, אפידמיולוגיה וכושר גופני
סקירת ענק מבוססת מחקר

ממתיקים וסוכרת: איך קוראים מטא-אנליזה בלי ליפול בכותרת?

שישה מחקרי מעקב, מאות אלפי משתתפים ושאלות על השוואה, סיבתיות הפוכה והטיות שהממוצע לא מעלים.

15מקורות מקושרים
נכתב ונבדק על ידי אשד ליןעודכן: 3 בספטמבר 2026

נניח שהחלפתם את המשקה המסוכר הקבוע במשקה דיאט. ואז מופיעה כותרת: אנשים שצרכו יותר ממתיקים היו בסיכון גבוה ב-31% לפתח סוכרת. האם הניסיון להפחית סוכר דווקא הזיק?

זאת שאלה מובנת, אבל היא אינה השאלה שהמספר הזה בהכרח עונה עליה. הוא מגיע ממטא-אנליזה של שישה מחקרי מעקב, עם 721,003 משתתפים לפי הספירה המדווחת. המספר גדול, והתווית "מטא-אנליזה" נשמעת מרגיעה. אלא שמטא-אנליזה היא דרך לשקלל מחקרים, לא מסנן שמוציא מהם את ההטיות.

גם את ה-31% צריך לקרוא בזהירות: מדובר בקשר יחסי, לא בתוספת של 31 נקודות אחוז לסיכון של כל אדם. כדי להבין כמה אנשים נוספים מדובר, נדרש גם הסיכון המוחלט בקבוצת ההשוואה. וכדי לדעת אם הממתיקים גרמו להבדל, נדרש הרבה יותר ממספר המשתתפים.

הסקירה של Lu ועמיתיו היא לכן לא רק דיון בממתיקים. היא הזדמנות לשאול איך עוברים מכמה מחקרים שונים למספר אחד, ואילו פרטים הולכים לאיבוד בדרך.

לפני שסופרים אנשים, מה הם בעצם צרכו?

הכותרת מתייחסת ל"ממתיקים מלאכותיים" כאילו מדובר בחשיפה אחת. בפועל, חמישה מששת המחקרים עסקו בעיקר במשקאות דיאט או במשקאות ממותקים בממתיקים, ורק אחד העריך צריכה כוללת יותר של ממתיקים.

משקה דיאט אינו מולקולה. הוא מוצר והרגל צריכה, ולעיתים גם סמן להתנהגויות אחרות. הוא יכול להכיל אספרטיים, סוכרלוז, אצסולפאם-K או שילוב, והרכב המוצר יכול להשתנות לאורך שנות המעקב. קשר שנמצא לגבי שתיית המשקה אינו בהכרח קשר זהה לגבי כל אחד מהחומרים שבתוכו.

גם "צריכה גבוהה" לא הייתה אחידה. במחקר אחד הושוותה מנה ביום לפחות ממנה בחודש; באחר שתייה יומית לאפס; ובאחר שתי מנות ביום לפחות ממנה בחודש. מחקרים נוספים השתמשו בקטגוריות גבוהות ונמוכות שהוגדרו אחרת. האומדן המסכם אינו השפעה של מינון אחד ברור.

חשוב מכך, פחית דיאט במקום פחית קולה אינה אותה התערבות כמו פחית דיאט במקום מים. בראשונה הוצאנו מהתזונה סוכר ואנרגיה; בשנייה לא. השוואת אנשים ששותים הרבה דיאט לאנשים ששותים מעט אינה בהכרח אומרת מה יקרה לאותו אדם שיחליף משקה מסוכר בדיאט. לפני ששואלים מה נמצא, צריך להגדיר מה נכנס במקום מה.

האבחנה הגיעה אחר כך. האם גם הסיבה התחילה אחר כך?

כל המחקרים היו מחקרי מעקב קדימה בזמן: הצריכה נמדדה לפני אבחון הסוכרת. זה יתרון על פני צילום של החשיפה והמחלה באותו רגע, אבל הוא אינו הופך את המעקב לניסוי.

אדם עם השמנה, עלייה במשקל, טרום-סוכרת, היסטוריה משפחתית או המלצה רפואית עשוי לעבור לדיאט עוד לפני האבחנה. אותם גורמים יכולים גם להגדיל את הסיכוי שיאובחן בעתיד. כך בחירת המשקה יכולה להיות תגובה לסיכון שכבר היה קיים, ולא הסיבה שיצרה אותו.

המחברים מכירים באפשרות הזאת, אך טוענים גם שהוצאת אנשים עם סוכרת בתחילת המעקב מונעת סיבתיות הפוכה ישירה. ההוצאה הזאת אינה מספיקה: היא מסלקת מי שכבר אובחנו, לא בהכרח מי שכבר היו בדרך לאבחנה או שינו תזונה בעקבות סיכון קיים. החשיפה קדמה לאבחנה, אבל לא בהכרח לכל התהליך שקדם לשתיהן.

זאת גם הסיבה שחשוב להגדיר מראש את השאלה הסיבתית ואת תחילת המעקב, במקום להניח שסדר תאריכים לבדו יוצר השוואה נכונה.

מקור: Hernán et al., 2016

למה "התאמנו למשקל" לא סוגר את הבעיה?

בטבלת הסקירה מצוין שכל המחקרים ביצעו התאמה למשקל או למדד מסת הגוף, מדד המשלב משקל וגובה. אבל התפקיד של המשקל תלוי במועד שבו נמדד ובשאלה שרוצים לשאול.

משקל לפני החשיפה יכול להשפיע גם על הבחירה בדיאט וגם על הסיכון לסוכרת. במקרה כזה הוא גורם מערבל, גורם אחר שעלול ליצור או לשנות את הקשר שאנחנו מייחסים למשקה. משקל מאוחר יותר יכול להיות חלק מהמסלול שאנחנו מנסים למדוד: אולי המשקה משפיע על המשקל, והמשקל על הסוכרת. התאמה אליו עלולה להסיר חלק מההשפעה המבוקשת.

וכאשר גם המשקל וגם השתייה משתנים לאורך זמן ומשפיעים זה על זה, התאמה רגילה בניתוח של הזמן עד לאבחנה עלולה בעצמה ליצור הטיה. לכן המשפט "בוצעה התאמה למדד מסת הגוף" אינו מספיק. צריך לדעת איזה מדד, מתי נמדד ואילו הנחות הובילו לבחירה בו.

מקור: Schisterman et al., 2009

מאות אלפי משתתפים, אבל רק שישה אומדנים

721,003 אנשים אינם 721,003 "קולות" עצמאיים במטא-אנליזה. החישוב מאחד שישה אומדנים מחקריים. גם המשקל שניתן לכל מחקר אינו בהכרח יחסי למספר האנשים שבו.

כאן המחקר עם 6,814 משתתפים קיבל בערך 14% מהמשקל, והמחקר הגדול ביותר, שבו דווח על 340,234 משתתפים, קיבל בערך 19%. כשההבדלים בין המחקרים גדולים, מודל שמאפשר השפעות שונות ביניהם נותן למחקרים קטנים משקל יחסי גדול יותר מכפי שספירת האנשים לבדה מרמזת.

אבל יש גם שאלה בסיסית יותר: האם אלה באמת שישה מקורות מידע עצמאיים? מחקר de Koning מ-2011 התבסס על קבוצת המעקב HPFS. מחקר Pacheco מ-2025 כלל שוב את HPFS לצד NHS ו-NHS II. אף שהמחברים כתבו שישאירו פרסום אחד מאותה אוכלוסייה, שני האומדנים נכללו.

לפי המידע המדווח יש חפיפה ברורה במקור קבוצת המעקב. בלי פירוק נוסף אי אפשר לקבוע כמה משתתפים ואירועים חופפים באומדנים עצמם. לכן גם אי אפשר להתייחס אליהם בביטחון כעצמאיים לחלוטין. החפיפה עלולה לנפח את ספירת המשתתפים, ובתלות באופן בניית האומדנים גם להציג דיוק רב מדי.

מדגם גדול מצמצם טעות מקרית. הוא אינו מתקן ערבול, מדידה גרועה, תלות בין מחקרים או שאלה שאינה מוגדרת היטב.

ממוצע מדויק יכול להסתיר מחקרים שונים מאוד

התוצאות השתנו בין המחקרים מעבר למה שאפשר לצפות מטעות דגימה בלבד. המחברים השתמשו במודל אפקטים אקראיים, מודל שמאפשר להניח שההשפעה אינה זהה בכל מחקר. זאת בחירה אפשרית בתנאים האלה, אבל היא אינה הופכת משקאות, מינונים, אוכלוסיות ומשווים שונים לאותו דבר.

השאלה היא לא רק אם המודל מסוגל לחשב ממוצע, אלא אם לממוצע יש משמעות מדעית. הפרדה לפי הגדרות חשיפה יכולה לעזור לחפש הסבר, אך עם שישה מחקרים בלבד, וכשניתוח משתנה בעקבות הסרת אחד מהם, קשה לדעת מה באמת עומד מאחורי ההבדלים.

הפער מופיע גם בשני הטווחים שהמאמר מציג. רווח הסמך סביב הממוצע היה 1.16 עד 1.49. הוא מתאר את אי-הוודאות סביב האומדן המשוקלל, בתנאי שהנתונים והמודל מתאימים. רווח הניבוי היה רחב יותר: 0.97 עד 1.78. הוא מתייחס לטווח שבו עשויה ליפול השפעה במחקר חדש ודומה, בהתחשב בשונות בין המחקרים.

הטווח השני כולל 1, הערך שמבטא היעדר קשר יחסי. לפי המודל עצמו, לכן, תוצאת מחקר עתידי דומה יכולה להתאים גם להיעדר קשר. אין סתירה בין ממוצע שקשה להסביר באקראיות בלבד לבין שונות גדולה בהשפעות שמסביבו.

מקור: IntHout et al., 2016

יציב מול איזו בעיה?

המחברים הסירו בכל פעם מחקר אחד וחישבו מחדש. האומדן נשאר בין 1.23 ל-1.37, ולכן תואר כיציב. הבדיקה הזאת מועילה לשאלה אם מחקר יחיד מחזיק לבדו את התוצאה, אבל אינה בודקת את כל הסיבות לטעות.

אם כל המחקרים חולקים סיבתיות הפוכה, הסרת אחד לא תפתור אותה. אותה בדיקה גם אינה מחליפה ניתוח שמסיר קבוצות חופפות, מתעלם מאבחנות שמופיעות סמוך לתחילת המעקב, משווה מודלים עם התאמה למשקל ובלעדיה, מפריד לפי המשקה שהוחלף או בוחן שיטת חישוב אחרת. בדיקת רגישות מועילה כשהיא מכוונת להטיה החשובה באמת.

גם בדיקה שלא מצאה הטיית פרסום אינה הוכחה להיעדרה. תרשים משפך ומבחן סטטיסטי יכולים לחפש אם דווקא מחקרים קטנים מציגים תוצאות חיוביות במיוחד, אבל כשיש רק שישה מחקרים קשה לזהות דפוס אמין. בדרך כלל הנחיות Cochrane אינן ממליצות על מבחני אסימטריה בפחות מעשרה מחקרים. בלי יכולת מספקת לזהות בעיה, תשובה שלילית אינה מרגיעה במיוחד.

מקור: Egger et al., 1997

מקור: Cochrane Handbook, פרק 13

מה אפשר לדעת על ההחלטות שנעשו בדרך?

הסקירה אינה מדווחת על רישום מוקדם ואין לה פרוטוקול זמין. אין פירוש הדבר שאפשר להוכיח שלא הייתה תוכנית מוקדמת, ובוודאי לא שנעשתה מניפולציה. אבל בלי התיעוד אי אפשר לבדוק אם שאלת המחקר, קריטריוני ההכללה, בחירת האומדנים, המודל, תתי-הקבוצות ודירוג ודאות הראיות נקבעו לפני שהחוקרים ראו את התוצאות.

המחברים מציינים שימוש ב-PRISMA, תקן שמסייע לדיווח שקוף של סקירות. הוא אינו תעודת איכות לתכנון, לשלמות החיפוש או לתוקף הסיבתי של המסקנה. דיווח ברור מאפשר לבקר את העבודה; הוא אינו מחליף את הביקורת הזאת.

מקור: Page et al., 2021

בחיפוש עצמו מוצגים מונחים ושאילתה כללית, לא אסטרטגיה מלאה המותאמת לכל מאגר. לכאורה חסרים מונחים נפוצים כמו diet soda ו-artificially sweetened beverage, וגם שמות ממתיקים ספציפיים. רק 96 רשומות אותרו בארבעה מאגרים. זה אינו מוכיח שמחקרים הוחמצו, אבל בלי חיפוש שניתן לשחזור קשה לברר זאת.

מקור: Rethlefsen et al., 2021

החיפוש הסתיים במרץ 2025, והמאמר הוגש במאי 2026 בלי עדכון חיפוש מדווח. לכן גם ביום הפרסום לא מובטח שהוא ייצג את כל הספרות שהייתה זמינה אז.

ציון איכות אינו תחליף לשאלה על ההטיה

המחקרים קיבלו 7 עד 8 נקודות מתוך 9 בסולם Newcastle-Ottawa והוגדרו איכותיים. אבל ציון כולל יכול להסתיר את השאלות המכריעות כאן: למה אנשים עברו לדיאט, האם השתייה השתנתה בעקבות עלייה במשקל, איך נמדדה החשיפה, האם הוצאו אבחנות מוקדמות ואיזה מודל מתוקנן נבחר מכל מאמר.

כלי הערכה מסייע לארגן את הבדיקה, אך אינו פוטר מבדיקת תחומי ההטיה הספציפיים. גם מחקר עם ציון גבוה יכול להיות מוגבל לגבי השאלה הסיבתית שאנחנו רוצים לשאול.

מקור: Stang, 2010

מקור: Hartling et al., 2013

אי-בהירות נוספת נוגעת לחישוב עצמו: בפרק השיטות ובכיתוב התרשים מופיעים שמות של שתי שיטות שונות. הקורא צריך לדעת איך התקבל המספר. כשיש מעט מחקרים שונים מאוד, בחירת השיטה משפיעה גם על טווח אי-הוודאות. זאת אינה בקשה "להעלים" תוצאה לא נוחה, אלא להראות עד כמה היא תלויה בהחלטות החישוב.

מקור: IntHout et al., 2014

המחברים עצמם דירגו את ודאות הראיות כנמוכה. זה מתאים למגבלות שתוארו. ובכל זאת הדיון עובר מהקשר שנמצא להשפעות מטבוליות שליליות אפשריות ולשיקולים במדיניות ובהמלצות קליניות. חשוב לשמור כאן על המרחק: בשש אנליזות עוקבה, צריכה גבוהה יותר שנמדדה בדרכים שונות נקשרה ליותר אבחנות סוכרת. אין בכך הוכחה שהממתיקים גרמו לתוספת, ואין זו תשובה ישירה לשאלה אם להחליף משקה מסוכר בדיאט.

מקור: Lu et al., 2026

עכשיו אפשר לשאול מה אומרת שאר הספרות

אין צורך לבחור בסיפור של "מחקרים תצפיתיים רעים וניסויים טובים". מחקרי עוקבה יכולים לעקוב שנים אחר סוכרת קלינית, אבל מתקשים להפריד את המוצר מהסיבות לבחירה בו. ניסויים אקראיים מגינים טוב יותר מפני ערבול, אך בדרך כלל קצרים יותר ואינם נועדו למדוד הופעת סוכרת לאורך עשורים. את ההבחנה הזאת אפשר להעמיק בסקירה על מחקר תצפיתי מול ניסוי אקראי.

בסקירה של ניסויים, החלפת משקאות מסוכרים במשקאות דלי קלוריות או נטולי קלוריות נקשרה לשיפורים קטנים במשקל ובחלק מגורמי הסיכון, בכיוון דומה להחלפה במים, במיוחד באנשים עם עודף משקל או סיכון מטבולי. ההשוואה למים או לאי-צריכה אינה אותה השוואה, ולעיתים אין בה יתרון ברור. שוב, החלופה משנה את התוצאה.

מקור: McGlynn et al., 2022

סקירה אחרת בחנה שינוי בצריכה והחלפת משקאות במחקרי עוקבה. זאת ראיה תצפיתית, לא ניסוי אקראי, והיא מדגימה ניסיון לשאול מה קורה כשצריכה משתנה או כשמשקה מחליף משקה אחר. גם בניתוח כזה נשארות שאלות על ערבול וסיבתיות הפוכה; היתרון הוא שההשוואה קרובה יותר להחלטה התזונתית המעשית מאשר "הרבה מול מעט" בלבד.

מקור: Lee et al., 2022

ניסוי קצר על המיקרוביום, אוכלוסיית המיקרואורגניזמים במעי, הראה תגובות שונות בין ממתיקים ובין אנשים. זה ממצא מעניין שיכול להציע מנגנון ביולוגי, אבל שינוי קצר בסבילות לגלוקוז אינו אבחנת סוכרת כעבור עשור. האפשרות להסביר תהליך אינה הוכחה לגודל ההשפעה הקלינית שלו.

מקור: Suez et al., 2022

גם ההמלצה המותנית של WHO מ-2023 שלא להשתמש בממתיקים כאסטרטגיה ארוכת טווח לשליטה במשקל או למניעת מחלות כרוניות אינה קביעה שהם גורמים לסוכרת. הארגון הדגיש שהקשרים התצפיתיים עלולים להיות מושפעים מערבול ומסיבתיות הפוכה. ההנחיה אינה הערכת בטיחות טוקסיקולוגית, כלומר בדיקת הרעילות של החומרים, ואינה מחליפה את גבולות הצריכה הבטוחה.

מקור: WHO, 2023

אז מה לעשות עם הפחית?

מים ומשקאות לא ממותקים הם ברירת מחדל טובה. למי ששותה הרבה משקאות מסוכרים, החלפה בדיאט יכולה להיות כלי להפחתת סוכר ואנרגיה ולעיתים שלב ביניים שימושי. המטא-אנליזה הזאת אינה סיבה להסיק שעדיף להמשיך לשתות סוכר.

מצד שני, אין סיבה להתחיל לצרוך ממתיקים כדי למנוע סוכרת, ואין ראיות חזקות שהם אסטרטגיית בריאות ארוכת טווח בפני עצמה. יש קשר תצפיתי שראוי לחקור טוב יותר, אבל הוא אינו מספיק לקביעה סיבתית שצריכה רגילה גורמת לסוכרת. גם אין הצדקה להתייחס לכל החומרים, המוצרים והמינונים כקטגוריה אחידה שאין לגביה אי-ודאות.

בפעם הבאה שמטא-אנליזה תופיע בכותרת, כדאי להתחיל בשאלה ובפרוטוקול, לבדוק אם החיפוש מלא ועדכני ואם המחקרים באמת עצמאיים, ואז לראות מה הושווה למה. חשוב לבחון את ההבדלים הקליניים והמתודולוגיים, את הסיכון להטיה ואת בדיקות הרגישות, לא רק את המודל הסטטיסטי. רווח הניבוי והסיכון המוחלט יכולים לספר סיפור שהמספר היחסי לבדו מסתיר.

מטא-אנליזה יכולה להיות כלי מצוין לסיכום ראיות. אבל היא אינה נעשית חזקה רק מפני שהיא נמצאת בראש תרשים. היא נשענת על המחקרים שנכנסו, על ההתאמה ביניהם ועל ההנחות שבחישוב. השאלה האחרונה נשארת פשוטה: האם ההמלצה שניתנה לנו באמת מתאימה להשוואה שנבדקה?

להמשיך מכאן

מחקרים חדשים והקשר שלא תמיד נכנס לפוסט

אפשר להצטרף למייל השבועי או לעבור לתוכן הרלוונטי באינסטגרם

להצטרפות למייללעוד תוכן באינסטגרם