واترمارکهای متنی هوش مصنوعی: نویسههای پنهان در برابر نشانههای انتخاب توکن
واترمارکهای متنی هوش مصنوعی به دو شکل ارائه میشوند و تنها یکی از آنها از نویسههایی تشکیل شده است که میتوانید حذف کنید.
| نوع واترمارک | محل قرارگیری | قابل مشاهده برای این ابزار | قابل حذف توسط این ابزار |
|---|---|---|---|
| نشانههای نویسهای پنهان | در بایتهای متن، بهصورت کدپوینتهای نامرئی یا نامتعارف | بله | بله |
| نشانههای انتخاب توکن | در گزینش خود کلمات | خیر | خیر |
نشانههای نویسهای پنهان، کدپوینتهایی هستند که ویرایشگر متن شما آنها را ذخیره میکند اما صفحه نمایش هرگز آنها را ترسیم نمیکند.
نشانههای انتخاب توکن از طریق کلمهای که مدل در هر مرحله برمیگزیند منتقل میشوند؛ بنابراین هیچ نویسهای برای یافتن یا پاکسازی باقی نمیگذارند. امروزه همه ابزارهای هوش مصنوعی که خروجی متن را علامتگذاری میکنند از این نوع بهره میبرند.
چه چیزی یک نویسه یونیکد را نامرئی میکند؟
یک نویسه زمانی نامرئی است که هیچ عرضی روی صفحه نمایش اشغال نکند. یونیکد این رفتار را با ویژگی Default_Ignorable_Code_Point و دستهبندی عمومی Cf به معنای قالببندی (format) ثبت میکند.
ویژگی Default_Ignorable_Code_Point یک ویژگی اشتقاقی است که برای هر نسخه از استاندارد، بهصورت فهرستی با فرمت متن ساده در DerivedCoreProperties.txt منتشر میشود. این ابزار پاککننده بر پایه یونیکد 17.0 عمل میکند که در 9 سپتامبر 2025 منتشر شد؛ نسخهای که 4,803 نویسه جدید افزود و مجموع نویسههای کدگذاریشده را به 159,801 رساند.
من دادههای ویژگی یونیکد 17.0 را استخراج کردم و خودم آنها را شمردم. 4,174 کدپوینت دارای ویژگی Default_Ignorable_Code_Point هستند، اما تنها 405 مورد از آنها نویسههای اختصاصیافته میباشند. 3,769 مورد دیگر جایگاههای رزروشدهای هستند که هنوز هیچ چیزی از آنها استفاده نمیکند. از میان این 405 مورد، 256 مورد انتخابگر حالت (variation selector) هستند و 97 مورد در بلوک برچسبها (Tags) قرار دارند، که در نهایت 52 نویسه باقی میماند که در نوشتههای عادی ظاهر میشوند.
دستهبندی Cf در همین نسخه شامل 170 نویسه است. به همین دلیل یک عدد تبلیغاتی رُند مانند «104 نویسه پنهان» بهخودیخود هیچ اطلاعاتی به شما نمیدهد. بدون درج نسخه یونیکد در کنار آن، این عدد در برابر هیچ معیاری قابل راستیآزمایی نیست.
چرا واترمارکهای انتخاب توکن در برابر پاکسازی نویسهها دوام میآورند؟
انتخاب توکن که با عنوان واترمارک آماری نیز شناخته میشود، در نوع کلماتی که مدل برگزیده است ذخیره میشود؛ بنابراین حذف نویسههای نامرئی، این نشانههای آماری را پاک نمیکند.
هیچ ابزار پاککننده واترمارک متنی در اینترنت نمیتواند واترمارک انتخاب توکن یا آماری را حذف کند، زیرا الگوریتم مورداستفاده ابزارهای هوش مصنوعی اختصاصی است.
آیا ChatGPT در متن خود واترمارک قرار میدهد؟
شرکت OpenAI میگوید خیر. در 20 آوریل 2025، پایگاه Rumidocs گزارش داد که پاسخهای GPT o3 و o4 mini حاوی نویسه U+202F یعنی NARROW NO-BREAK SPACE بودهاند. OpenAI دو روز بعد پاسخ داد که این نویسهها «یک ویژگی غیرمنتظره ناشی از یادگیری تقویتی در مقیاس بزرگ» بوده و واترمارک نیستند. Rumidocs در 23 آوریل 2025 این گزارش را بهروزرسانی کرد و اعلام نمود که نمایش این نویسههای ویژه متوقف شده است.
شرکت OpenAI در سال 2024 روشی برای واترمارکگذاری متن ایجاد کرد اما هرگز آن را عرضه ننمود. مقاله راهنمای فعلی این شرکت درباره اصالتسنجی نشان میدهد چه مواردی امروزه سیگنال دارند: تصاویر دارای C2PA Content Credentials و SynthID هستند، صداها SynthID دریافت میکنند و متنها هیچکدام را ندارند. در همان صفحه بیان شده است که «هدف ما گسترش سیگنالهای اصالت به همه قالبها از جمله متن است»، که بیشتر یک برنامه کاری به نظر میرسد تا یک محصول آماده.
پاسخ صادقانه کوتاه است: ChatGPT متن خود را واترمارکگذاری نمیکند، و نویسههایی که کاربران در سال 2025 مشاهده کردند، یک باگ بود که برطرف شد.
انواع نویسههای نامرئی موجود در خروجیهای ChatGPT و Claude
نویسههایی که این ابزار پاککننده شناسایی میکند به پنج گروه تقسیم میشوند: نویسههای با عرض صفر، فاصلههای نامتعارف، نویسههای کنترلی، علائم نگارشی مشابه، و نویسههای برچسب یا کاربرد اختصاصی.
| گروه | نمونهها | عملکرد | پیشتنظیم استاندارد |
|---|---|---|---|
| نویسههای با عرض صفر | U+200B, U+200C, U+200D, U+2060, U+FEFF | هیچ عرضی اشغال نمیکند، اما همچنان در فایل ذخیره میشود | نویسههای U+200B، U+2060 و U+FEFF را حذف کرده و دو نویسه پیونددهنده را نگه میدارد |
| فاصلههای نامتعارف | U+00A0, U+2009, U+202F, U+3000 | مشابه فاصله به نظر میرسد، اما در مرتبسازی و جستجو بهعنوان نویسهای متفاوت عمل میکند | به یک فاصله معمولی تبدیل میکند |
| نویسههای کنترلی | محدودههای C0 و C1، کنترلهای دوطرفه | رندر را هدایت میکند یا پردازشگرها را دچار خطا میسازد، هرگز چاپ نمیشود | همهچیز به جز تب و خط جدید را حذف میکند |
| علائم نگارشی مشابه | گیومههای خمیده، خطهای تیره en و em، و U+00AD | چاپ میشود، اما نه بهعنوان همان نویسهای که تایپ کردهاید | دستنخورده باقی میگذارد |
| برچسب و کاربرد اختصاصی | محدوده U+E0000 تا U+E007F، ناحیه کاربرد اختصاصی | حاوی متنی خواندنی است که هیچ انسانی آن را نمیبیند | حذف میکند |
در اینجا نمونهای عملی ارائه شده که برای تمامی اندازهگیریهای این صفحه از آن استفاده کردهام. جمله «The meeting starts at 9:30 am on 12 May.» هنگامی که مستقیماً در یک ویرایشگر متن ساده تایپ شود، 40 نویسه و 40 بایت است. پس از یک بار انتقال به یک واژهپرداز و بازگشت، به 42 نویسه و 49 بایت تبدیل شد. درون آن یک علامت ترتیب بایت در ابتدا، یک فاصله با عرض صفر بعد از «am»، و دو فاصله معمولی که پنهانی با U+202F و U+00A0 جایگزین شده بودند قرار داشت. نه بایت اضافی؛ بدون آنکه چیزی در ظاهر تغییر کرده باشد.
The meeting starts at 9:30 am on 12 May.نویسههای با عرض صفر: U+200B، U+200C، U+200D، U+2060 و U+FEFF
نویسههای با عرض صفر فضایی روی صفحه اشغال نمیکنند اما همچنان در فایل وجود دارند؛ به همین دلیل متن جایگذاریشده میتواند حامل نشانههایی باشد که هیچکس قادر به دیدن آنها نیست.
| کدپوینت | نام رسمی در یونیکد | کاربرد واقعی |
|---|---|---|
| U+200B | ZERO WIDTH SPACE | موقعیت شکستن خط را مشخص میکند؛ اغلب توسط ویرایشگرهای وب درج میشود |
| U+200C | ZERO WIDTH NON-JOINER | حروف را در کلمات فارسی و عربی از یکدیگر جدا نگه میدارد |
| U+200D | ZERO WIDTH JOINER | ایموجیها را به یک تصویر متصل میکند و در خطوط هندی پیوند میسازد |
| U+2060 | WORD JOINER | مانع از شکستن خط در آن نقطه میشود |
| U+FEFF | ZERO WIDTH NO-BREAK SPACE | علامت ترتیب بایت؛ معمولاً توسط یک ویرایشگر متن برجا میماند و نه توسط هوش مصنوعی |
دو مورد از این پنج نویسه، نویسههای کاربردی هستند و نه زاید. U+200C و U+200D در زبانهای واقعی معنا دارند؛ به همین دلیل پیشتنظیم استاندارد آنها را دستنخورده در جای خود باقی میگذارد.
فاصلههای نامتعارف: U+00A0، U+2009، U+202F و U+3000
فاصلههای نامتعارف شبیه به یک فاصله معمولی به نظر میرسند اما کدپوینت متفاوتی دارند که باعث ایجاد اختلال در جستجو، مرتبسازی و کدها میشود.
یونیکد 17.0 تعداد 17 نویسه را در دستهبندی Zs (جداکننده فاصله) تعریف میکند و تنها یکی از آنها کلید فاصله روی صفحهکلید شما است. من تمامی این 17 نویسه را به همراه عرض بایتی آنها در UTF-8 از پایگاه داده نویسهها استخراج کردهام، زیرا عرض بایتی همان چیزی است که آنها را حجیم میسازد.
| کدپوینت | نام رسمی در یونیکد | بایتهای UTF-8 |
|---|---|---|
| U+0020 | SPACE | 1 |
| U+00A0 | NO-BREAK SPACE | 2 |
| U+1680 | OGHAM SPACE MARK | 3 |
| U+2000 to U+200A | از EN QUAD تا HAIR SPACE، تعداد 11 نویسه | هرکدام 3 بایت |
| U+202F | NARROW NO-BREAK SPACE | 3 |
| U+205F | MEDIUM MATHEMATICAL SPACE | 3 |
| U+3000 | IDEOGRAPHIC SPACE | 3 |
یک نویسه U+202F سه بایت حجم اشغال میکند در حالی که یک فاصله معمولی یک بایت است، و جستجو برای عبارت «9:30 am» در صورتی که فاصله از نوع U+202F باشد با «9:30 am» مطابقت نخواهد داشت. این عدم انطباق دلیلی است که باعث میشود فاصلهها حتی در پیشتنظیم استاندارد نیز یکسانسازی شوند.
9:30 am
9:30 amمیتوانید متن نمونه را کپی کرده و در کادر ورودی ابزار بالا جایگذاری کنید تا نتیجه را مشاهده نمایید.
خطهای تیره، گیومههای هوشمند و خطهای پیوند نرم که ویرایشگرها درج میکنند
گیومههای خمیده، خطهای تیره بلند، و خط پیوند نرم U+00AD معمولاً از تنظیمات تصحیح خودکار یک واژهپرداز ناشی میشوند، نه از یک مدل زبانی.
یونیکد 17.0 ویژگی Dash را به 31 نویسه اختصاص میدهد؛ از U+002D معمولی روی صفحهکلید گرفته تا U+2014 EM DASH و U+2E3A TWO-EM DASH. تنها یکی از آنها با فشردن یک کلید صفحهکلید تایپ میشود. مابقی زمانی وارد میشوند که نرمافزار تصمیم میگیرد منظور شما چه بوده است. در این میان، U+00AD موردی استثنایی است، زیرا تنها زمانی بهعنوان خط پیوند چاپ میشود که خط در آن نقطه شکسته شود، و در سایر جاها نامرئی باقی میماند.
خطهای تیره همان سؤالی هستند که اغلب افراد را به صفحهای مانند این میکشاند، و پاسخ کوتاه این است که آنها هیچ چیز را اثبات نمیکنند. استدلال کامل در ادامه و در بخش مربوط به خط تیره بلند (em dash) آورده شده است.
نویسههای برچسب و کاربرد اختصاصی که دستورالعملها را درون متن پنهان میکنند
نویسههای موجود در بلوک برچسبهای یونیکد، از U+E0000 تا U+E007F، میتوانند حامل یک جمله کامل باشند که هیچ خواننده انسانی هرگز آن را نخواهد دید. این روشی است که مهاجمان برای قاچاق دستورالعملهای پنهان به درون متنی که یک دستیار هوش مصنوعی بعداً خواهد خواند، استفاده میکنند.
وبلاگ امنیتی AWS در 30 سپتامبر 2025 موضوع قاچاق نویسههای یونیکد را پوشش داد. این مقاله نویسههای برچسب را تشریح میکند که «در ابتدا بهعنوان نشانههایی نامرئی برای مشخص کردن زبان در متن طراحی شده بودند» و اکنون «بهعنوان یک بردار بالقوه برای تزریق پرامپت پدیدار شدهاند». یک گزارش پژوهشی از اتحادیه امنیت ابری (Cloud Security Alliance) به تاریخ 10 مارس 2026 همین ترفند را در مهارتهای عاملهای هوش مصنوعی، توصیف ابزارها و سرورهای MCP ردگیری کرد. در آن پژوهش، از بلوک برچسبها در کنار U+200B، U+200C، U+200D و U+FEFF نام برده شده است.
من نمونهای از آن را ساختم تا حجمش را بررسی کنم. جمله مرئی «Great work on the report.» دارای 25 نویسه و 25 بایت است. سپس دستورالعملی 42 نویسهای را که با نویسههای برچسب کدگذاری شده بود به آن اضافه کردم. اندازه فایل به 67 نویسه و 193 بایت افزایش یافت. روی صفحه نمایش، متن همچنان پنج کلمه و یک نقطه خوانده میشد، در حالی که یک اسکریپت توانست دستورالعمل را کاملاً دستنخورده از متن استخراج کند. هر نویسه برچسب چهار بایت حجم دارد و صفر پیکسل فضا اشغال میکند.
Great work on the report.این قویترین دلیل برای پاکسازی متن است که هیچ ارتباطی با شناسایی هوش مصنوعی ندارد. با جایگذاری بخشی از متن یک صفحه وب در یک دستیار گفتگو، ممکن است دستورالعملهایی را به آن تحویل دهید که خودتان هرگز تایپ نکردهاید.
حذف نویسههای نامرئی در مرورگر شما: فرآیند اسکن و پاکسازی
این ابزار پاککننده به محض جایگذاری متن، آن را اسکن کرده و تمام موارد یافتهشده را با نام رسمی در یونیکد و موقعیت آنها فهرست میکند، و تا زمانی که دکمه پاکسازی متن را فشار ندهید، هیچ تغییری ایجاد نمیکند.
این فرآیند شامل چهار مرحله است:
- متن خود را جایگذاری کنید یا یک فایل .txt یا .md را بکشید و رها نمایید.
- فهرست موارد یافتهشده را که نام هر نویسه و محل قرارگیری آن را مشخص میکند بررسی کنید.
- یک پیشتنظیم را انتخاب کنید، یا مواردی را که میخواهید حفظ شوند بهصورت مجزا نگه دارید.
- پاکسازی کنید، سپس نتیجه را کپی کرده یا دانلود نمایید.
این ابزار پاککننده حتی یک کلمه از متن شما را بازنویسی، بازگویی یا انسانیسازی نمیکند.
مقایسه پیشتنظیمهای استاندارد، پیشرفته و سختگیرانه
حالت استاندارد نویسههایی را که در نگارش عادی مشکل ایجاد میکنند حذف میکند، حالت پیشرفته دامنه پاکسازی را گسترش میدهد، و حالت سختگیرانه بیشترین مقدار را حذف میکند.
| گروه نویسهها | استاندارد | پیشرفته | سختگیرانه |
|---|---|---|---|
| فاصله با عرض صفر، پیونددهنده کلمات، علامت ترتیب بایتها | حذف میشود | حذف میشود | حذف میشود |
| کنترلهای دوجهته و کنترلهای C0/C1 | حذف میشود | حذف میشود | حذف میشود |
| بلوک برچسب و نویسههای استفاده اختصاصی | حذف میشود | حذف میشود | حذف میشود |
| خط پیوند اختیاری U+00AD | حذف میشود | حذف میشود | حذف میشود |
| فاصلههای غیرمعمول در دسته Zs | تبدیل به U+0020 میشود | تبدیل به U+0020 میشود | تبدیل به U+0020 میشود |
| پیونددهندههای U+200C و U+200D | حفظ میشود | خارج از توالیهای ایموجی حذف میشود | در همهجا حذف میشود |
| انتخابگرهای تنوع | حفظ میشود | خارج از توالیهای ایموجی حذف میشود | در همهجا حذف میشود |
| گیومههای خمیده و خطهای تیره بلند | حفظ میشود | حفظ میشود | تبدیل به نقلقولهای مستقیم و خط پیوند ساده میشود |
سه فیلتر تکلمسی در کنار پیشتنظیمها قرار دارند: حذف نامرئیها، حذف خطوط تیره و خطهای پیوند، و حذف ایموجیها. انتشار این قوانین کاملاً آگاهانه است. همه ابزارهای رقیب مجموعه قوانین خود را پشت یک دکمه واحد پنهان میکنند، بنابراین تا زمانی که چیزی خراب نشود، نمیتوانید متوجه شوید چه مواردی را از متن شما حذف کردهاند.
محافظت از کد در Markdown چگونه بلوکهای کد را دستنخورده نگه میدارد؟
با روشن بودن حالت Markdown و محافظت کد، پاککننده از کدهای درونخطی و بلوکهای کد محصور صرفنظر میکند، بنابراین قطعهکدی که به یک نویسه دقیق نیاز دارد آن را حفظ میکند.
کد تنها جایی است که نویسهای که در نثر عادی زائد تلقی میشود، نقشی اساسی ایفا میکند. یک عبارت باقاعده یا یک رشته آزمایشی ممکن است دقیقاً به قرار داشتن علامت ترتیب بایتها در جایگاه خودش وابسته باشد.
آیا متن شما از دستگاهتان خارج میشود؟
خیر. اسکن و پاکسازی هر دو در مرورگر شما اجرا میشوند و این صفحه هرگز متن شما را بارگذاری یا ذخیره نمیکند.
بخش صادقانه دوم را هم باید در ادامه همین مطلب گفت. این صفحه رایگان است، بنابراین ممکن است همچنان تبلیغات نمایش دهد و از ابزارهای تحلیلی سایت استفاده کند. گزارش اختیاری JSON آنچه را تغییر کرده ثبت میکند، اما شامل هیچ بخشی از متن شما نمیشود.
محدودیتهای متن و فایل: 20,000 کلمه و 1 مگابایت
این پاککننده تا 20,000 کلمه متن الصاقشده، یا یک فایل UTF-8 تا حداکثر 1 مگابایت با فرمت .txt یا .md را میپذیرد.
هر چیز دیگری خارج از محدوده است: نه HTML، DOCX، PDF، JSON یا CSV، و متن الصاقشده فقط به صورت متن ساده وارد میشود. فعال بودن JavaScript الزامی است. هیچ حساب کاربری و هیچ پرداختی وجود ندارد. رابط کاربری به 25 زبان ارائه میشود. نامهای رسمی یونیکد در همه آنها به زبان انگلیسی باقی میمانند، زیرا نام ترجمهشده یک نویسه دیگر نامی نخواهد بود که بتوان به آن استناد کرد.
برای عکسها به جای متن، میتوانید اطلاعات هوش مصنوعی را از تصویر حذف کنید یا متاداده تصویر را ویرایش کنید.
نشانهگذاری متن هوش مصنوعی توسط ارائهدهندگان: مقایسه ChatGPT، Claude، Gemini و Grok
تنها برخی از ارائهدهندگان هوش مصنوعی خروجی متنی خود را نشانهگذاری میکنند، و همه ارائهدهندگانی که این کار را انجام میدهند از انتخاب کلمات استفاده میکنند نه نویسههای پنهان.
| ارائهدهنده | متن را نشانهگذاری میکند | روش | شناسایی توسط این پاککننده | منبع و تاریخ |
|---|---|---|---|---|
| Anthropic, Claude | بله | واترمارک انتخاب توکن، نسخهای از SynthID Text | خیر | شرکت Anthropic، اطلاعیه 11 اوت 2026، یادداشت فنی 14 اوت 2026، بهروزرسانیشده در 1 سپتامبر 2026 |
| Google, Gemini | بله | فناوری SynthID Text، تعدیل احتمال توکنها | خیر | شرکت Google DeepMind، 14 مه 2024، در ادامه همان سال به صورت متنباز منتشر شد |
| OpenAI, ChatGPT | بدون واترمارک متنی تأییدشده | هیچ روشی در محیط عملیاتی برای متن وجود ندارد. تصاویر دارای C2PA و SynthID هستند، صوت دارای SynthID است | نامربوط | مقاله راهنمای اصالت محتوای OpenAI، معتبر تا 2 سپتامبر 2026 |
| xAI, Grok | بدون تعهد منتشرشده | ذکر نشده است | نامربوط | شرکت xAI منشور رفتاری شفافیت کمیسیون را امضا نکرد، گزارششده در 12 اوت 2026 |
شرکت Anthropic میگوید مدلهایی که در 2 اوت 2026 یا پس از آن عرضه شدهاند، هنگام عرضه دارای این نشان هستند. این شرکت در تلاش است تا نشانهگذاری را به مدلهای منتشرشده قبل از آن تاریخ نیز اضافه کند. ابزار تشخیص واترمارک متنی یک بررسیکننده عمومی نیست. Anthropic بیان میکند که تشخیص «در حال حاضر در مرحله پیشنمایش خصوصی است و همانطور که قانون اتحادیه اروپا الزام میکند، در دسترس سازمانهای واجد شرایط قرار دارد». این فهرست واجدین شرایط شامل نهادهای نظارتی، مجریان قانون، رسانهها، بررسیکنندگان صحت اطلاعات، پژوهشگران، مراکز آموزشی و گروههای جامعه مدنی اتحادیه اروپا میشود. ابزار رایگان Claude Content Checker که Anthropic نیز ارائه میدهد، اعتبارنامههای محتوای C2PA (یا C2PA Content Credentials) را روی فایلهای تولیدشده میخواند که با واترمارک متنی کاملاً متفاوت است.
امضا نکردن منشور رفتاری توسط xAI، مدل Grok را از خود قانون هوش مصنوعی (AI Act) معاف نمیکند. یک منشور داوطلبانه مسیری برای انطباق با مقررات است، نه جایگزینی برای قانون.
واترمارک متنی Claude چگونه کار میکند؟
مدل Claude از میان کلماتی که به یک اندازه خوب هستند انتخاب میکند و یک کلید مخفی تعیین میکند کدامیک انتخاب شود. نشان واترمارک، همان توالی انتخابهاست، نه یک نویسه خاص در متن.
شرکت Anthropic این سازوکار را به روشنی توضیح میدهد: «به جای استفاده از یک تولیدکننده اعداد تصادفی اختیاری برای انتخاب کلمه بعدی، واترمارکگذاری از این کلید و چند کلمه قبلی استفاده میکند تا مشخص شود مدل باید چه کلمهای را برگزیند.» این شرکت همچنین عنوان میکند که واترمارک متنی Claude «نسخهای از رویکرد SynthID-Text است که توسط Google DeepMind در مقالهای در نشریه Nature در سال 2024 منتشر شد».
در مورد میزان پایداری، Anthropic شفاف است: «ویرایش جزئی احتمالاً واترمارک را بهطور کامل حذف نخواهد کرد»، اما یک بازنویسی کامل که در آن همه کلمات جایگزین شوند، آن را از بین خواهد برد.
فناوری SynthID Text چه چیزی را در خروجی Gemini نشانهگذاری میکند؟
فناوری SynthID Text همزمان با نگارش Gemini، الگوی خود را در احتمالات توکنها جایگذاری میکند. شرکت Google DeepMind واترمارک متنی SynthID را برای برنامه و نسخه تحت وب Gemini در 14 مه 2024 معرفی کرد. این روش «با وارد کردن اطلاعات اضافی به توزیع توکنها در لحظه تولید از طریق تعدیل احتمال تولید توکنها» عمل میکند. شرکت DeepMind در ادامه همان سال، این روش را از طریق مجموعه ابزار Responsible Generative AI Toolkit به صورت متنباز منتشر کرد.
محدودیتهای منتشرشده به اندازه خود روش اهمیت دارند. SynthID Text روی پاسخهای طولانیتر و متنوعتر بهترین نتیجه را دارد. این روش در پاسخهای کوتاه مبتنی بر واقعیت، یعنی جایی که مدل تقریباً هیچ آزادی در انتخاب واژگان ندارد، عملکرد ضعیفی از خود نشان میدهد. همچنین هنگامی که متن بهطور کامل بازنویسی یا ترجمه شود، میزان اطمینان مجدداً کاهش مییابد.
یافتههای نویسههای پنهان و نگارش هوش مصنوعی: چرا هیچیک وجود دیگری را اثبات نمیکند؟
یک نویسه پنهان نشاندهنده آن است که ابزاری متن شما را پردازش کرده است، نه دلیلی بر اینکه هوش مصنوعی آن را نوشته باشد.
هر نویسه نامرئی توضیحی کاملاً عادی دارد که قبل از پیدایش نگارش با هوش مصنوعی نیز وجود داشته است. واژهپردازها، سیستمهای مدیریت محتوا و صادرکنندگان فایلهای PDF دهههاست که آنها را درج میکنند. وجود یک یافته به شما میگوید که متن از یک نرمافزار عبور کرده است، که این موضوع تقریباً در مورد هر جملهای که توسط هر کسی منتشر میشود صدق میکند.
نویسههای نامرئی به جز هوش مصنوعی از کجا میآیند؟
واژهپردازها، ویرایشگرهای وب، فایلهای خروجی PDF، ابزارهای ترجمه، برنامههای پیامرسان و حتی کپی و پیست ساده، همگی خودبهخود نویسههای نامرئی درج میکنند.
| منبع | نویسههایی که معمولاً اضافه میکند | علت |
|---|---|---|
| واژهپردازها | U+00A0, U+2019, U+2014, U+00AD | تصحیح خودکار و درج خط پیوند خودکار |
| ویرایشگرهای وب و سیستمهای مدیریت محتوا (CMS) | U+200B, U+FEFF | نشانههای شکست خط و نشانگرهای کدگذاری فایل |
| خروجیهای PDF | U+2009, U+202F, U+00A0 | حفظ فاصلهگذاری حروفچینی هنگام کپی کردن مجدد متن |
| ابزارهای ترجمه و بومیسازی | U+200C, U+200D, U+061C | نمایش صحیح خطوط عربی، فارسی و هندی |
| برنامههای چت و پیامرسان | U+200D, U+FE0F | توالیهای ایموجی و نحوه نمایش متن یا ایموجی |
| کپی و پیست میان برنامهها | کد U+FEFF، فاصلههای ترکیبی Zs | تبدیل کدگذاری در کلیپبورد |
جمله آزمایشی 40 بایتی من بدون آنکه حتی با یک مدل زبانی برخوردی داشته باشد، شامل 4 یافته بود. این تمام استدلال در یک اندازهگیری عینی است.
چرا خطهای تیره بلند (Em Dash) واترمارک نیستند
خط تیره بلند یک علامت نگارشی معمولی است که نویسندگان، ویراستاران و ابزارهای تصحیح خودکار قرنهاست از آن استفاده میکنند، بنابراین هیچ نشانهای درباره اینکه چه کسی جمله را نوشته در بر ندارد.
اصلاحیه سال 2025 این مسئله را حل کرد. شرکت OpenAI در 14 نوامبر 2025 اعلام کرد که ChatGPT در نهایت از دستورالعمل سفارشی برای توقف استفاده از خط تیره بلند اطاعت خواهد کرد. سام آلتمن در همان روز به صراحت گفت: «اگر در دستورالعملهای سفارشی خود به ChatGPT بگویید از خط تیره بلند استفاده نکند، سرانجام کاری را که قرار است انجام میدهد». عادتی که کاربر میتواند آن را در تنظیمات شخصیسازی غیرفعال کند، هرگز یک واترمارک نبوده است؛ بلکه الگویی از سبک نگارش بود که در آموزش شکل گرفته بود و راهحل آن نیز صرفاً یک ترجیح بود.
این پاککننده همچنان حذف خط تیره را ارائه میدهد و دلیل آن کاملاً شفاف است: این یک فیلتر سبک نگارش برای افرادی است که در متن خود خواهان نقلقولهای مستقیم و خطهای تیره ساده هستند. این یک فیلتر واترمارک نیست و نظر هیچ ابزار تشخیصی را در مورد متن شما تغییر نخواهد داد.
چه زمانی پاکسازی متن را خراب میکند: خطهای فارسی، عربی، هندی و ایموجیها
حذف نویسههای با عرض صفر میتواند متن صحیح را خراب کند، زیرا برخی خطوط نگارشی برای املای درست کلمات به آنها نیاز دارند.
من چهار موردی را که بیشتر از همه دچار بههمریختگی میشوند بررسی کردم و دقیقاً آنچه رخ داد را ثبت نمودم. واژه فارسی میخواهم هشت نویسه است و U+200C در میان آن مانع چسبیدن این دو بخش به یکدیگر میشود. با حذف آن به میخواهم میرسید که هفت نویسه است و شکل نوشتاری متفاوتی دارد. در خط دواناگری، عبارت क्ष دارای یک U+200D است که پیوند صحیح حروف را شکل میدهد و حذف آن، ظاهر نمایش دادهشده بر روی صفحه را تغییر میدهد. ایموجی خانواده 👨👩👧👦 شامل هفت نقطه کد است؛ چهار تصویر که با سه اتصالدهنده U+200D در کنار هم قرار گرفتهاند. با حذف اتصالدهندهها، این ایموجی به 👨👩👧👦 یعنی چهار فرد جداگانه تجزیه میشود. یک قلب سرخ ❤️ دارای U+FE0F است تا به شکل ایموجی نمایش داده شود و بدون آن، همان نقطه کد به یک نماد متنی ساده ❤ بازمیگردد.
به همین دلیل است که این ابزار یافتهها را قبل از پاکسازی هر چیزی نشان میدهد، تکتک موارد یافتشده را میتوان حفظ کرد، و حالت سختگیرانه (Strict) حالت پیشفرض نیست. ویراستاری که روی یک زبان کار میکند یک خروجی تمیز میبیند؛ اما ویراستاری که روی شش زبان کار میکند، یک گزارش اشکال خواهد دید.
نتیجهگیری نهایی درباره پاکسازی واترمارک متنی هوش مصنوعی
پاکسازی نویسههای نامرئی برای داشتن متنی تمیز، قابلانتقال و امن، کاری ارزشمند است.
دو دلیل استفاده از این ابزار را توجیه میکنند: نخست آنکه نویسههای پنهان، بیصدا در نتایج جستجو، جستجوهای صفحات گسترده، کدها و نشانیهای اینترنتی اختلال ایجاد میکنند. دوم آنکه نویسههای برچسب میتوانند دستوراتی را به دستیار هوش مصنوعی منتقل کنند که هیچکس آنها را تایپ نکرده و هیچکس نمیتواند ببیند. این امر پاکسازی متن را به جای یک اقدام ظاهری، به یک عادت امنیتی تبدیل میکند.
هرکسی که امیدوار است با این کار واترمارک شرکتهای ارائهدهنده را از بین ببرد، لایه اشتباهی را پاکسازی میکند. مدلهای Claude و Gemini متن را در انتخاب کلمات نشانهگذاری میکنند، OpenAI تصاویر و صوت را نشانهگذاری میکند و نه متن را، و هیچ میزانی از حذف نویسهها روی هیچیک از آنها تأثیری ندارد. یکی از راههای تضعیف این واترمارکهای آماری، ترجمه متن به چند زبان مختلف و سپس بازگرداندن آن به زبان اصلی است.
یک صفحه از متن خود را در کادر ورودی بالا الصاق کنید و یافتهها را بخوانید تا متن را بهتر درک کنید یا به سادگی خروجی را کپی نمایید.
در حال حاضر همین بود. از اینکه تا اینجا خواندید متشکریم.