סימני מים של בינה מלאכותית מטקסט: תווים מוסתרים לעומת סימני בחירת טוקנים
סימני מים של בינה מלאכותית מטקסט מגיעים בשתי צורות, ורק אחת מהן מורכבת מתווים שניתן למחוק.
| סוג סימן המים | היכן הוא נמצא | גלוי לכלי זה | ניתן להסרה באמצעות כלי זה |
|---|---|---|---|
| סימני תווים מוסתרים | בבייטים של הטקסט, כנקודות קוד בלתי נראות או חריגות | כן | כן |
| סימני בחירת טוקנים | בבחירות המילים עצמן | לא | לא |
סימני תווים מוסתרים הם נקודות קוד שעורך הטקסט שלכם שומר והמסך שלכם לעולם אינו מצייר.
סימני בחירת טוקנים נישאים באמצעות המילה שהמודל בחר בכל שלב, ולכן הם אינם משאירים תו לאיתור ואינם משאירים תו להסרה. כל כלי בינה מלאכותית המסמן פלט טקסט כיום משתמש בסוג זה.
מה הופך תו יוניקוד לבלתי נראה?
תו הוא בלתי נראה כאשר אינו תופס רוחב על גבי המסך. יוניקוד מתעד התנהגות זו באמצעות המאפיין Default_Ignorable_Code_Point ובאמצעות הקטגוריה הכללית Cf, שמשמעותה עיצוב.
המאפיין Default_Ignorable_Code_Point הוא מאפיין נגזר, המפורסם כרשימת טקסט רגיל בקובץ DerivedCoreProperties.txt עבור כל גרסה של התקן. כלי ניקוי זה מקובע ל-Unicode 17.0, שפורסם ב-9 בספטמבר 2025, אשר הוסיף 4,803 תווים חדשים והביא את סך התווים המקודדים ל-159,801.
שלפתי את נתוני המאפיינים של Unicode 17.0 וספרתי אותם בעצמי. 4,174 נקודות קוד נושאות את המאפיין Default_Ignorable_Code_Point, אך רק 405 מהן הן תווים מוקצים. 3,769 האחרות הן משבצות שמורות ששום דבר אינו משתמש בהן עדיין. מתוך 405 אלו, 256 הם בוררי וריאציות ו-97 יושבים בבלוק Tags, מה שמשאיר 52 המופיעים בכתיבה רגילה.
קטגוריה Cf כוללת 170 תווים באותה גרסה. זו הסיבה שמספר שיווקי עגול כמו ״104 תווים מוסתרים״ אינו אומר דבר בפני עצמו. ללא גרסת Unicode המודפסת לצידו, לא ניתן לאמת את המספר מול שום דבר.
מדוע סימני מים של בחירת טוקנים שורדים ניקוי תווים
סימן מים של בחירת טוקנים, המכונה גם סימן מים סטטיסטי, מאוחסן בבחירת המילים של המודל, ולכן מחיקת תווים בלתי נראים אינה מנקה את הסימנים הסטטיסטיים.
שום כלי ניקוי סימני מים מטקסט באינטרנט אינו יכול להסיר סימן מים של בחירת טוקנים או בחירה סטטיסטית, מכיוון שהאלגוריתם שבו משתמשים כלי הבינה המלאכותית הוא קנייני.
האם ChatGPT שם סימן מים בטקסט שלו?
ב-OpenAI אומרים שלא. ב-20 באפריל 2025 דיווח Rumidocs כי תשובות מ-GPT o3 ומ-o4 mini הכילו את U+202F, ה-NARROW NO-BREAK SPACE. ב-OpenAI השיבו כעבור יומיים. התווים היו ״מוזרות של למידת חיזוק בקנה מידה גדול״ ולא סימן מים. ב-23 באפריל 2025 עדכן Rumidocs את המאמר וציין כי התווים המיוחדים הפסיקו להופיע.
ב-OpenAI אכן פיתחו שיטה לסימון מים בטקסט בשנת 2024 ולעולם לא השיקו אותה. מאמר העזרה הנוכחי שלהם בנושא נתוני מקור מפרט מה נושא אות כיום: תמונות מקבלות C2PA Content Credentials ו-SynthID, אודיו מקבל SynthID, וטקסט אינו מקבל אף אחד מהם. באותו דף נכתב כי ״מטרתנו היא להרחיב את אותות נתוני המקור לכל המודלויות, כולל טקסט״, שזו תוכנית ולא מוצר.
התשובה הכנה היא קצרה. ChatGPT אינו מוסיף סימן מים לטקסט שלו, והתווים שאנשים מצאו בשנת 2025 היו באג שתוקן.
סוגי תווים בלתי נראים הנמצאים בפלט של ChatGPT ו-Claude
התווים שכלי ניקוי זה מוצא מתחלקים לחמש קבוצות: תווים ברוחב אפס, רווחים חריגים, תווי בקרה, סימני פיסוק דומים, ותווי תגית או שימוש פרטי.
| קבוצה | דוגמאות | מה זה עושה | הגדרה קבועה מראש ״רגיל״ |
|---|---|---|---|
| תווים ברוחב אפס | U+200B, U+200C, U+200D, U+2060, U+FEFF | אינו תופס רוחב, עדיין נשמר בקובץ | מסיר את U+200B, U+2060, U+FEFF ומשאיר את שני המחברים |
| רווחים חריגים | U+00A0, U+2009, U+202F, U+3000 | נראה כמו רווח, ממוין ונמצא בחיפוש כתו שונה | ממיר לרווח רגיל |
| תווי בקרה | טווחי C0 ו-C1, בקרי כיווניות (Bidi) | מכוון רינדור או משבש מנתחים, לעולם אינו מודפס | מסיר הכל מלבד טאב ומעבר שורה |
| סימני פיסוק דומים | מרכאות מסולסלות, קווי הפרדה en ו-em, U+00AD | מודפס, אך לא כתו שהקלדתם | משאיר ללא שינוי |
| תגית ושימוש פרטי | U+E0000 עד U+E007F, אזור לשימוש פרטי | נושא טקסט קריא שאף אדם אינו רואה | מסיר |
להלן הדוגמה המתמשכת שבה השתמשתי עבור כל מדידה בדף זה. המשפט ״The meeting starts at 9:30 am on 12 May.״ הוא בן 40 תווים ו-40 בייטים כאשר הוא מוקלד ישירות לתוך עורך טקסט רגיל. לאחר מעבר אחד במעבד תמלילים ובחזרה הוא יצא עם 42 תווים ו-49 בייטים. בפנים ישבו סמן סדר בייטים (BOM) בהתחלה, רווח ברוחב אפס אחרי ״am״, ושני רווחים רגילים שהוחלפו בחשאי ב-U+202F וב-U+00A0. תשעה בייטים נוספים. שום דבר גלוי לא השתנה.
The meeting starts at 9:30 am on 12 May.תווים ברוחב אפס: U+200B, U+200C, U+200D, U+2060 ו-U+FEFF
תווים ברוחב אפס אינם תופסים מקום על המסך אך עדיין קיימים בקובץ, ולכן טקסט שהודבק יכול לשאת סימנים שאף אחד אינו יכול לראות.
| נקודת קוד | שם Unicode רשמי | תפקיד בפועל |
|---|---|---|
| U+200B | ZERO WIDTH SPACE | מסמן אפשרות לשבירת שורה, מוכנס בעיקר על ידי עורכי רשת |
| U+200C | ZERO WIDTH NON-JOINER | שומר על הפרדה בין אותיות במילים בפרסית ובערבית |
| U+200D | ZERO WIDTH JOINER | מחבר אימוג׳ים לתמונה אחת ויוצר אותיות מחוברות במערכות כתב הודיות |
| U+2060 | WORD JOINER | מונע שבירת שורה בנקודה זו |
| U+FEFF | ZERO WIDTH NO-BREAK SPACE | סמן סדר בייטים (BOM), מושאר בדרך כלל על ידי עורך טקסט ולא על ידי בינה מלאכותית |
שניים מחמשת אלה הם תווים פעילים, לא פסולת. U+200C ו-U+200D נושאים משמעות בשפות אמיתיות, וזו הסיבה שההגדרה הקבועה מראש ״רגיל״ משאירה אותם במקומם.
רווחים חריגים: U+00A0, U+2009, U+202F ו-U+3000
רווחים חריגים נראים כמו רווח רגיל אך נושאים נקודת קוד שונה, מה שמשבש חיפוש, מיון וקוד.
תקן Unicode 17.0 מגדיר 17 תווים בקטגוריה Zs, מפריד רווח (space separator), ורק אחד מהם הוא הרווח במקלדת שלכם. פירטתי את כל 17 התווים מתוך מסד נתוני התווים עם רוחב הבייטים שלהם ב-UTF-8, מכיוון שרוחב הבייטים הוא מה שהופך אותם ליקרים.
| נקודת קוד | שם Unicode רשמי | בייטים של UTF-8 |
|---|---|---|
| U+0020 | SPACE | 1 |
| U+00A0 | NO-BREAK SPACE | 2 |
| U+1680 | OGHAM SPACE MARK | 3 |
| U+2000 to U+200A | EN QUAD עד HAIR SPACE, 11 תווים | 3 כל אחד |
| U+202F | NARROW NO-BREAK SPACE | 3 |
| U+205F | MEDIUM MATHEMATICAL SPACE | 3 |
| U+3000 | IDEOGRAPHIC SPACE | 3 |
תו U+202F בודד עולה שלושה בייטים במקום שבו רווח עולה אחד, וחיפוש אחר ״9:30 am״ לא יתאים ל-״9:30 am״ כאשר המרווח הוא U+202F. אי-התאמה זו היא הסיבה לכך שרווחים מנורמלים אפילו בהגדרה הקבועה מראש ״רגיל״.
9:30 am
9:30 amניתן להעתיק ולהדביק את הטקסט לדוגמה בתיבת הקלט של הכלי שלמעלה כדי לראות את התוצאה.
קווים מפרידים, מרכאות חכמות ומקפים רכים שעורכים מוסיפים
מרכאות מסולסלות, קווים מפרידים ארוכים והמקף הרך U+00AD מגיעים בדרך כלל מהגדרת תיקון שגיאות אוטומטי במעבד תמלילים, ולא ממודל שפה.
תקן Unicode 17.0 מעניק את המאפיין Dash ל-31 תווים, מ-U+002D הפשוט במקלדת שלכם ועד U+2014 EM DASH ו-U+2E3A TWO-EM DASH. רק אחד מהם הוא לחיצה על המקלדת. השאר מגיעים כאשר תוכנה מחליטה למה התכוונתם. U+00AD הוא היוצא דופן, מכיוון שהוא מודפס כמקף רק כאשר שורה נשברת שם ונשאר בלתי נראה בכל מקום אחר.
קווים מפרידים הם השאלה שמביאה את רוב האנשים לדף כזה, והתשובה הקצרה היא שהם אינם מוכיחים דבר. הטיעון המלא מופיע בהמשך תחת הסעיף על קווי הפרדה ארוכים (em dashes).
תווי תגית ושימוש פרטי המסתירים הוראות בתוך טקסט
תווים בבלוק Tags של Unicode, מ-U+E0000 עד U+E007F, יכולים לשאת משפט שלם שאף קורא אנושי לא יראה לעולם. כך תוקפים מבריחים הוראות מוסתרות לתוך טקסט שעוזר בינה מלאכותית יקרא בהמשך.
בלוג האבטחה של AWS סקר הברחת תווי Unicode ב-30 בספטמבר 2025. הוא מתאר תווי תגית אשר ״תוכננו במקור כסמנים בלתי נראים לציון שפה בתוך טקסט״ וכן ״התפתחו לווקטור פוטנציאלי להזרקת הנחיות (prompt injection)״. מזכר מחקר של Cloud Security Alliance מ-10 במרץ 2026 איתר את אותו תכסיס במיומנויות של סוכני בינה מלאכותית, בתיאורי כלים ובשרתי MCP. עבודה זו מציינת את הבלוק Tags לצד U+200B, U+200C, U+200D ו-U+FEFF.
בניתי דוגמה כזו כדי לבדוק את הגודל שלה. המשפט הגלוי ״Great work on the report.״ הוא בן 25 תווים ו-25 בייטים. הוספתי בסוף הוראה בת 42 תווים שקודדה בתווי תגית. הקובץ גדל ל-67 תווים ו-193 בייטים. על המסך הוא עדיין נקרא כחמש מילים ונקודה, ותסריט שלף את ההוראה בחזרה מתוך העותק כשהיא שלמה. כל תו תגית עולה ארבעה בייטים ואפס פיקסלים.
Great work on the report.זוהי הסיבה החזקה ביותר לניקוי טקסט שאינה קשורה כלל לזיהוי בינה מלאכותית. הדבקת קטע טקסט מדף אינטרנט לתוך עוזר צ׳אט עלולה להעביר לו הוראות שמעולם לא הקלדתם.
הסרת תווים בלתי נראים בדפדפן שלכם: תהליך הסריקה והניקוי
כלי ניקוי זה סורק את הטקסט שלכם ברגע הדבקתו, מפרט כל ממצא עם שמו הרשמי ב-Unicode ומיקומו, ואינו משנה דבר עד ללחיצה על ״ניקוי טקסט״.
התהליך כולל ארבעה שלבים:
- יש להדביק את הטקסט או לגרור קובץ .txt או .md.
- יש לסקור את רשימת הממצאים, המציינת כל תו והיכן הוא נמצא.
- יש לבחור הגדרה קבועה מראש, או להשאיר ממצאים בודדים שברצונכם להגן עליהם.
- יש לנקות, ולאחר מכן להעתיק את התוצאה או להוריד אותה.
כלי ניקוי זה אינו משכתב, מנסח מחדש או ״מאניש״ אף מילה מהטקסט שלכם.
השוואת ההגדרות הקבועות מראש: רגיל, מתקדם ומחמיר
״רגיל״ מסיר את התווים שגורמים לבעיות בכתיבה רגילה, ״מתקדם״ מרחיב את הרשת, ו״מחמיר״ מסיר את מרב התווים.
| קבוצת תווים | רגיל | מתקדם | מחמיר |
|---|---|---|---|
| רווח ברוחב אפס, מחבר מילים, סמן סדר בייטים | מוסר | מוסר | מוסר |
| בקרי כיווניות ובקרי C0/C1 | מוסר | מוסר | מוסר |
| בלוק תגיות ותווים לשימוש פרטי | מוסר | מוסר | מוסר |
| מקף רך U+00AD | מוסר | מוסר | מוסר |
| רווחים חריגים בקטגוריה Zs | מומר ל-U+0020 | מומר ל-U+0020 | מומר ל-U+0020 |
| המחברים U+200C ו-U+200D | נשמר | מוסר מחוץ לרצפי אימוג׳י | מוסר בכל מקום |
| בוררי וריאציות | נשמר | מוסר מחוץ לרצפי אימוג׳י | מוסר בכל מקום |
| מרכאות מסולסלות וקווים מפרידים ארוכים | נשמר | נשמר | מומר למרכאות ישרות ולקו מפריד פשוט |
לצד ההגדרות הקבועות מראש מוצעים שלושה מסננים בלחיצה אחת: מחיקת תווים בלתי נראים, הסרת מקפים וקווים מפרידים, והסרת אימוג׳י. פרסום כללים אלה נעשה מתוך כוונה תחילה. כל כלי מתחרה מסתיר את מערך הכללים שלו מאחורי כפתור בודד, כך שלא ניתן לדעת מה הוסר מהטקסט שלכם עד שמשהו משתבש.
כיצד הגנה על קוד Markdown שומרת על שלמותם של בלוקי קוד
כאשר מצב Markdown וההגנה מופעלים, כלי הניקוי מדלג על קוד תחום וקוד בתוך השורה, כך שקטע קוד הזקוק לתו מדויק שומר עליו.
קוד הוא המקום היחיד שבו תו שבטקסט רגיל ייחשב לפסולת הוא חיוני לתפקוד. ביטוי רגולרי או מחרוזת בדיקה יכולים להיות תלויים בכך שסמן סדר בייטים יימצא בדיוק במקומו.
האם הטקסט שלכם עוזב את המכשיר?
לא. הסריקה והניקוי מתבצעים שניהם בדפדפן שלכם, והדף לעולם אינו מעלה או שומר את הטקסט שלכם.
החצי השני והכן נאמר באותה נשימה. דף זה הוא חינמי, ולכן הוא עדיין עשוי להציג מודעות ולהשתמש בניתוח נתוני אתר. דוח ה-JSON האופציונלי מתעד מה השתנה. הוא אינו מכיל שום חלק מהטקסט שלכם.
מגבלות טקסט וקבצים: 20,000 מילים ו-1 MB
כלי הניקוי מקבל עד 20,000 מילים של טקסט מודבק, או קובץ UTF-8 יחיד של עד 1 MB בפורמט .txt או .md.
כל דבר אחר אינו נתמך: לא HTML, DOCX, PDF, JSON או CSV, והדבקה נקלטת כטקסט רגיל בלבד. נדרש JavaScript. אין צורך בחשבון ואין תשלום. הממשק זמין ב-26 שפות. שמות Unicode רשמיים נשארים באנגלית בכולן, מכיוון ששם תו מתורגם כבר אינו שם שניתן לצטט.
עבור תמונות במקום טקסט, ניתן להסיר מידע בינה מלאכותית מתמונה או לערוך מטא-דאטה של תמונה.
סימון טקסט של בינה מלאכותית לפי ספק: השוואה בין ChatGPT, Claude, Gemini ו-Grok
רק חלק מספקי הבינה המלאכותית מסמנים את פלט הטקסט שלהם, וכל ספק שעושה זאת משתמש בבחירת מילים ולא בתווים מוסתרים.
| ספק | מסמן טקסט | שיטה | נמצא על ידי כלי ניקוי זה | מקור ותאריך |
|---|---|---|---|---|
| Anthropic, Claude | כן | סימן מים של בחירת טוקנים, גרסה של SynthID Text | לא | Anthropic, הודעה מ-11 באוגוסט 2026, הערה טכנית מ-14 באוגוסט 2026, עודכן ב-1 בספטמבר 2026 |
| Google, Gemini | כן | SynthID Text, אפנון הסתברות טוקנים | לא | Google DeepMind, 14 במאי 2024, שוחרר כקוד פתוח בהמשך אותה שנה |
| OpenAI, ChatGPT | אין סימן מים מאושר בטקסט | אין שימוש פעיל עבור טקסט. תמונות נושאות C2PA ו-SynthID, אודיו נושא SynthID | לא רלוונטי | מאמר עזרה בנושא נתוני מקור מאת OpenAI, מעודכן ל-2 בספטמבר 2026 |
| xAI, Grok | אין התחייבות מפורסמת | לא צוינה | לא רלוונטי | חברת xAI לא חתמה על קוד ההתנהלות לשקיפות של הנציבות, דווח ב-12 באוגוסט 2026 |
ב-Anthropic אומרים כי מודלים שהושקו ב-2 באוגוסט 2026 או לאחריו נושאים את הסימן בעת ההשקה. החברה פועלת להוספת סימון למודלים ששוחררו לפני תאריך זה. זיהוי סימני מים בטקסט אינו בודק ציבורי. ב-Anthropic מציינים כי הזיהוי ״נמצא כעת בתצוגה מקדימה פרטית, וזמין לארגונים זכאים כנדרש על פי חוקי האיחוד האירופי״. רשימת הזכאים כוללת רגולטורים, גורמי אכיפת חוק, כלי תקשורת, בודקי עובדות, חוקרים, גופים חינוכיים וקבוצות חברה אזרחית באיחוד האירופי. הכלי החינמי Claude Content Checker ש-Anthropic מציעה גם כן קורא C2PA Content Credentials בקבצים שנוצרו, וזהו דבר שונה לחלוטין מסימן מים בטקסט.
העובדה ש-xAI לא חתמה על קוד ההתנהלות אינה פוטרת את Grok מחוק הבינה המלאכותית (AI Act) עצמו. קוד התנהלות וולונטרי הוא דרך לעמידה בדרישות, ולא תחליף לחוק.
כיצד פועל סימון מים בטקסט ב-Claude
Claude בוחר בין מילים טובות באותה מידה, ומפתח סודי קובע באיזו מהן הוא בוחר. הסימן הוא רצף הבחירות, ולא תו כלשהו בטקסט.
ב-Anthropic מתארים את המנגנון בפשטות. ״במקום להשתמש במחולל מספרים אקראיים שרירותי כדי לבחור את המילה הבאה, סימון המים משתמש במפתח ובמספר מילים שקדמו לה כדי להכריע באיזו מילה על המודל לבחור״. החברה מציינת גם כי סימן המים בטקסט של Claude ״הוא גרסה של גישת SynthID-Text שפורסמה על ידי Google DeepMind במאמר ב-Nature בשנת 2024״.
לגבי עמידות, ב-Anthropic מביעים עמדה מפורשת. ״עריכה קלה ככל הנראה לא תסיר את סימן המים לחלוטין״, ושכתוב מלא שבו מוחלפת כל מילה אכן יסיר אותו.
מה מסמן SynthID Text בפלט של Gemini
SynthID Text מטמיע את התבנית שלו בהסתברויות הטוקנים בזמן ש-Gemini כותב. Google DeepMind הכריזה על סימון מים בטקסט באמצעות SynthID עבור אפליקציית Gemini וממשק האינטרנט שלה ב-14 במאי 2024. השיטה פועלת ״באמצעות החדרת מידע נוסף להתפלגות הטוקנים בנקודת היצירה על ידי אפנון הסבירות ליצירת טוקנים״. DeepMind שחררה את השיטה כקוד פתוח בהמשך אותה שנה באמצעות Responsible Generative AI Toolkit שלה.
המגבלות שפורסמו חשובות לא פחות מהשיטה עצמה. SynthID Text פועל בצורה הטובה ביותר על תשובות ארוכות ומגוונות יותר. ביצועיו חלשים בתשובות עובדתיות קצרות, שבהן למודל כמעט ואין חופש בניסוח. רמת הוודאות יורדת שוב כאשר הטקסט משוכתב ביסודיות או מתורגם.
ממצאי תווים מוסתרים וחיבור בידי בינה מלאכותית: מדוע האחד לעולם אינו מוכיח את האחר
תו מוסתר הוא ראיה לכך שמשהו עיבד את הטקסט שלכם, ולא ראיה לכך שבינה מלאכותית כתבה אותו.
לכל תו בלתי נראה יש הסבר שגרתי שהיה קיים הרבה לפני שכתיבה באמצעות בינה מלאכותית נוצרה. מעבדי תמלילים, מערכות ניהול תוכן (CMS) ומייצאי PDF מכניסים אותם כבר עשרות שנים. ממצא מצביע על כך שהטקסט עבר דרך תוכנה, וזה נכון לגבי כמעט כל משפט שמישהו מפרסם.
מהיכן מגיעים תווים בלתי נראים מלבד בינה מלאכותית
מעבדי תמלילים, עורכי רשת, ייצוא ל-PDF, כלי תרגום, אפליקציות צ׳אט, ופעולות העתקה והדבקה רגילות מכניסים כולם תווים בלתי נראים בפני עצמם.
| מקור | תווים שהוא מוסיף בדרך כלל | מדוע |
|---|---|---|
| מעבדי תמלילים | U+00A0, U+2019, U+2014, U+00AD | תיקון שגיאות אוטומטי ומיקוף אוטומטי |
| עורכי רשת ו-CMS | U+200B, U+FEFF | רמזים לשבירת שורה וסמני קידוד קבצים |
| ייצוא ל-PDF | U+2009, U+202F, U+00A0 | שמירה על ריווח העימוד בעת העתקת הטקסט בחזרה החוצה |
| כלי תרגום ולוקליזציה | U+200C, U+200D, U+061C | רינדור נכון של מערכות כתב בערבית, פרסית והודית |
| אפליקציות צ׳אט והודעות | U+200D, U+FE0F | רצפי אימוג׳י והצגה כטקסט או כאימוג׳י |
| העתקה והדבקה בין אפליקציות | U+FEFF, רווחי Zs מעורבים | המרת קידוד בלוח ההעתקה |
משפט הבדיקה שלי בן 40 הבייטים צבר ארבעה ממצאים מבלי שפגש מעולם מודל שפה. זהו כל הטיעון במדידה אחת.
מדוע קווי הפרדה ארוכים (em dashes) אינם סימן מים
קו מפריד ארוך (em dash) הוא סימן פיסוק רגיל שסופרים, עורכים ותיקון שגיאות אוטומטי השתמשו בו במשך מאות שנים, ולכן הוא אינו נושא כל אינדיקציה לגבי מי שכתב את המשפט.
התיקון של שנת 2025 סוגר את הנושא. ב-OpenAI הודיעו ב-14 בנובמבר 2025 כי ChatGPT יציית סוף סוף להנחיה מותאמת אישית המורה לו להפסיק להשתמש בקווי הפרדה ארוכים (em dashes). סם אלטמן ניסח זאת בפשטות באותו יום: ״אם תאמרו ל-ChatGPT לא להשתמש ב-em-dashes בהנחיות המותאמות אישית שלכם, הוא סוף סוף עושה את מה שהוא אמור לעשות״. הרגל שמשתמש יכול לכבות בהגדרת התאמה אישית מעולם לא היה סימן מים. זה היה דפוס סגנוני שנלמד במהלך האימון, והתיקון היה עניין של העדפה.
כלי ניקוי זה עדיין מציע הסרת קווים מפרידים, והסיבה לכך כנה. זהו מסנן סגנון עבור מי שרוצים מרכאות ישרות וקווים מפרידים פשוטים בטקסט שלהם. זה אינו מסנן סימני מים, והוא לא ישנה את מה שכלי זיהוי כלשהו יאמר על הטקסט שלכם.
כאשר ניקוי משבש טקסט: פרסית, ערבית, מערכות כתב הודיות ואימוג׳י
הסרת תווים ברוחב אפס עלולה לשבש טקסט תקין, מכיוון שמערכות כתב מסוימות זקוקות להם כדי לאיית מילים כהלכה.
הרצתי את ארבעת המקרים שמשתבשים בתדירות הגבוהה ביותר ותיעדתי בדיוק מה קרה. המילה בפרסית میخواهم היא בת שמונה תווים, וה-U+200C שבאמצעה מונע משני החלקים להתחבר. מחיקה שלו תניב میخواهم, שבעה תווים וצורה כתובה שונה. בדוונאגרי, क्ष מכיל U+200D שיוצר את האות המחוברת התקינה, והסרתו משנה את הצורה שעל גבי המסך. אימוג׳י המשפחה 👨👩👧👦 מורכב משבע נקודות קוד, ארבע תמונות המחוברות באמצעות שלושה מחברי U+200D. הסרת המחברים מפרקת אותו ל-👨👩👧👦, ארבעה אנשים נפרדים. לב אדום ❤️ נושא את U+FE0F כדי להופיע כאימוג׳י, ובלעדיו אותה נקודת קוד חוזרת לסמל טקסט, ❤.
זו הסיבה שהכלי מציג ממצאים לפני שהוא מנקה דבר כלשהו, מדוע ניתן להשאיר תוצאות בודדות, ומדוע ״מחמיר״ אינו ברירת המחדל. עורך שעובד בשפה אחת רואה תוצאה נקייה. עורך שעובד בשש שפות רואה דוח שגיאות.
פסק דין סופי בנושא ניקוי סימני מים של בינה מלאכותית מטקסט
ניקוי תווים בלתי נראים הוא פעולה כדאית למען טקסט נקי, נייד ובטוח.
שתי סיבות מצדיקות את השימוש בכלי זה. הראשונה היא שתווים מוסתרים משבשים דברים, בשקט, בתוצאות חיפוש, בפונקציות חיפוש בגיליונות אלקטרוניים, בקוד ובכתובות URL. השנייה היא שתווי תגיות עלולים להעביר לעוזר בינה מלאכותית הוראות שאף אדם לא הקליד ואף אדם אינו רואה. הדבר הופך את הניקוי להרגל אבטחתי ולא להרגל קוסמטי בלבד.
מי שמקווה לעקוף סימן מים של ספק מנקה את השכבה הלא נכונה. Claude ו-Gemini מסמנים טקסט בבחירת המילים, ב-OpenAI מסמנים תמונות ואודיו אך לא טקסט, ושום מידה של הסרת תווים אינה מגיעה לאף אחד מהם. דרך אחת להתגבר על סימני מים סטטיסטיים אלה היא תרגום הטקסט למספר שפות שונות ולאחר מכן תרגומו בחזרה למקור.
ניתן להדביק עמוד אחד מהטקסט שלכם בתיבת הקלט שלמעלה ולקרוא את הממצאים כדי להבין את הטקסט טוב יותר, או פשוט להעתיק את הפלט.
זה הכל לעת עתה. תודה על הקריאה עד כאן.