AI szöveges vízjelek: Rejtett karakterek kontra tokenválasztási jelek
Az AI szöveges vízjelek két formában léteznek, és csak az egyikük áll olyan karakterekből, amelyeket törölni tud.
| Vízjel típusa | Hol található | Látható ennek az eszköznek | Eltávolítható ezzel az eszközzel |
|---|---|---|---|
| Rejtett karakteres jelek | A szöveg bájtjaiban, láthatatlan vagy szokatlan kódpontokként | Igen | Igen |
| Tokenválasztási jelek | Magukban a szóválasztásokban | Nem | Nem |
A rejtett karakteres jelek olyan kódpontok, amelyeket a szövegszerkesztő eltárol, de a képernyő soha nem jelenít meg.
A tokenválasztási jeleket az hordozza, hogy a modell melyik szót választotta az egyes lépésekben, így nem hagynak hátra megtalálható vagy eltávolítható karaktert. Ma minden olyan AI-eszköz ezt a típust használja, amely megjelöli a szöveges kimenetet.
Mitől lesz egy Unicode-karakter láthatatlan?
Egy karakter akkor láthatatlan, ha nem foglal szélességet a képernyőn. A Unicode ezt a viselkedést a Default_Ignorable_Code_Point tulajdonsággal és a formátumot jelölő Cf általános kategóriával tartja nyilván.
A Default_Ignorable_Code_Point egy származtatott tulajdonság, amely a szabvány minden verziójához egyszerű szöveges listaként jelenik meg a DerivedCoreProperties.txt fájlban. Ez a tisztító a 2025. szeptember 9-én megjelent Unicode 17.0 szabványhoz rögzített, amely 4803 új karaktert adott hozzá, és a kódolt karakterek teljes számát 159 801-re növelte.
Lekértem a Unicode 17.0 tulajdonságadatait, és magam számoltam meg őket. 4174 kódpont hordozza a Default_Ignorable_Code_Point tulajdonságot, de ezek közül csak 405 hozzárendelt karakter. A fennmaradó 3769 fenntartott hely, amelyet még semmi sem használ. A 405-ből 256 variációszelektor, 97 a Tags blokkban található, így 52 marad, amely a mindennapi írásban megjelenhet.
A Cf kategória 170 karaktert tartalmaz ugyanebben a verzióban. Ezért van az, hogy egy olyan kerek marketingszám, mint a „104 rejtett karakter”, önmagában semmit sem mond. Ha nincs mellette feltüntetve egy Unicode-verzió, a szám nem ellenőrizhető semmivel szemben.
Miért élik túl a tokenválasztási vízjelek a karaktertisztítást?
A tokenválasztási (más néven statisztikai) vízjel abban tárolódik, hogy a modell mely szavakat választotta, így a láthatatlan karakterek törlése nem távolítja el a statisztikai jeleket.
Az interneten egyetlen szöveges vízjeltisztító sem képes eltávolítani a token- vagy statisztikai választáson alapuló vízjeleket, mivel az AI-eszközök által használt algoritmus védett és zárt.
Helyez el a ChatGPT vízjelet a szövegében?
Az OpenAI szerint nem. 2025. április 20-án a Rumidocs arról számolt be, hogy a GPT o3 és o4 mini válaszai az U+202F kódot, a NARROW NO-BREAK SPACE karaktert tartalmazták. Az OpenAI két nappal később válaszolt: a karakterek „a nagyléptékű megerősítéses tanulás sajátosságai” voltak, nem pedig vízjelek. A Rumidocs 2025. április 23-án frissítette a cikket azzal, hogy a speciális karakterek megjelenése megszűnt.
Az OpenAI 2024-ben ugyan kifejlesztett egy szöveges vízjelezési módszert, de soha nem adta ki. A jelenlegi származási súgócikkük felsorolja, mi hordoz ma jelzést: a képek C2PA Content Credentials és SynthID jelölést kapnak, a hanganyagok SynthID-t, a szövegek pedig egyiket sem. Ugyanez az oldal kijelenti, hogy „célunk, hogy a származási jelzéseket minden modalitásra kiterjesszük, beleértve a szöveget is”, ami inkább egy terv, mintsem kész termék.
Az őszinte válasz rövid. A ChatGPT nem látja el vízjellel a szövegét, és a karakterek, amelyeket az emberek 2025-ben találtak, egy olyan hiba következményei voltak, amelyet kijavítottak.
A ChatGPT és a Claude kimenetében található láthatatlan karaktertípusok
A tisztító által észlelt karakterek öt csoportba sorolhatók: nulla szélességű karakterek, szokatlan szóközök, vezérlőkarakterek, hasonló írásjelek, valamint címke- vagy magánhasználatú karakterek.
| Csoport | Példák | Hatása | Standard előbeállítás |
|---|---|---|---|
| Nulla szélességű karakterek | U+200B, U+200C, U+200D, U+2060, U+FEFF | Nem foglal szélességet, mégis tárolva van a fájlban | Eltávolítja az U+200B, U+2060, U+FEFF kódpontokat, és megtartja a két összekötőt |
| Szokatlan szóközök | U+00A0, U+2009, U+202F, U+3000 | Szóköznek tűnik, de eltérő karakterként rendezi és keresi a rendszer | Normál szóközre alakítja |
| Vezérlőkarakterek | C0 és C1 tartományok, kétirányú vezérlők | Irányítja a megjelenítést vagy megzavarja az értelmezőket, sosem jelenik meg kinyomtatva | Eltávolít mindent a tabulátor és az új sor kivételével |
| Hasonló írásjelek | Tipográfiai idézőjelek, en- és em-gondolatjelek, U+00AD | Megjelenik, de nem olyan karakterként, mint amit begépelt | Változatlanul hagyja |
| Címke- és magánhasználatú | U+E0000 – U+E007F, magánhasználatú terület | Olvasható szöveget hordoz, amelyet ember nem lát | Eltávolítja |
Íme az az állandó példa, amelyet az ezen az oldalon található minden méréshez használtam. A „The meeting starts at 9:30 am on 12 May.” mondat közvetlenül egy egyszerű szövegszerkesztőbe beírva 40 karakter és 40 bájt. Miután megjárt egy szövegszerkesztő programot és visszatért, már 42 karakter és 49 bájt lett. Belül a legelején egy bájtsorrend-jelölő, az „am” után egy nulla szélességű szóköz, valamint két közönséges szóköz lapult, amelyeket észrevétlenül U+202F és U+00A0 kódra cseréltek. Kilenc plusz bájt. Láthatóan semmi sem változott.
The meeting starts at 9:30 am on 12 May.Nulla szélességű karakterek: U+200B, U+200C, U+200D, U+2060 és U+FEFF
A nulla szélességű karakterek nem foglalnak helyet a képernyőn, de továbbra is jelen vannak a fájlban, ezért a beillesztett szöveg olyan jeleket hordozhat, amelyeket senki sem láthat.
| Kódpont | Hivatalos Unicode-név | Valódi feladata |
|---|---|---|
| U+200B | ZERO WIDTH SPACE | Lehetséges sortörési pontot jelöl, többnyire webszerkesztők illesztik be |
| U+200C | ZERO WIDTH NON-JOINER | Elválasztva tartja a betűket a perzsa és arab szavakban |
| U+200D | ZERO WIDTH JOINER | Egyetlen képpé egyesíti az emojikat, és ligatúrákat képez az indiai írásrendszerekben |
| U+2060 | WORD JOINER | Megakadályozza a sortörést az adott ponton |
| U+FEFF | ZERO WIDTH NO-BREAK SPACE | A bájtsorrend-jelölő, amelyet általában egy szövegszerkesztő hagy hátra, és nem egy AI |
Ebből az ötből kettő valódi funkcióval bíró karakter, nem felesleges szemét. Az U+200C és az U+200D jelentést hordoz valódi nyelvekben, ezért a Standard előbeállítás változatlanul a helyén hagyja őket.
Szokatlan szóközök: U+00A0, U+2009, U+202F és U+3000
A szokatlan szóközök közönséges szóköznek tűnnek, de eltérő kódpontot hordoznak, ami megzavarja a keresést, a rendezést és a programkódot.
A Unicode 17.0 17 karaktert határoz meg a Zs kategóriában (szóközelválasztó), és ezek közül csak egy a billentyűzetén található szóköz. Mind a 17-et kigyűjtöttem a karakteradatbázisból az UTF-8 bájtszélességükkel együtt, mert a bájtméret az, ami költségessé teszi őket.
| Kódpont | Hivatalos Unicode-név | UTF-8 bájtok |
|---|---|---|
| U+0020 | SPACE | 1 |
| U+00A0 | NO-BREAK SPACE | 2 |
| U+1680 | OGHAM SPACE MARK | 3 |
| U+2000 to U+200A | EN QUAD-tól HAIR SPACE-ig, 11 karakter | Egyenként 3 |
| U+202F | NARROW NO-BREAK SPACE | 3 |
| U+205F | MEDIUM MATHEMATICAL SPACE | 3 |
| U+3000 | IDEOGRAPHIC SPACE | 3 |
Egyetlen U+202F három bájtot foglal, míg egy normál szóköz egyet, és a „9:30 am” kifejezésre való keresés nem fog egyezni a „9:30 am” szöveggel, ha a térköz U+202F. Ez az eltérés az oka annak, hogy a szóközök még a Standard előbeállításban is normalizálásra kerülnek.
9:30 am
9:30 amKimásolhatja és beillesztheti a mintaszöveget a fenti eszköz beviteli mezőjébe az eredmény megtekintéséhez.
Gondolatjelek, tipográfiai idézőjelek és lágy elválasztójelek, amelyeket a szerkesztők szúrnak be
A tipográfiai idézőjelek, a hosszú gondolatjelek és az U+00AD lágy elválasztójel általában egy szövegszerkesztő automatikus javítási beállításából származnak, nem pedig nyelvi modellből.
A Unicode 17.0 a Dash tulajdonságot 31 karakternek adja meg, a billentyűzetén lévő egyszerű U+002D karaktertől kezdve az U+2014 EM DASH és U+2E3A TWO-EM DASH karakterekig. Ezek közül csak egy felel meg egy billentyűleütésnek. A többi akkor jelenik meg, amikor a szoftver úgy dönt, mit szeretett volna írni. Az U+00AD a kivétel, mert csak akkor jelenik meg kötőjelként, ha ott törik meg a sor, mindenhol máshol pedig láthatatlan marad.
A gondolatjelek jelentik azt a kérdést, amely a legtöbb embert egy ilyen oldalra hozza, a rövid válasz pedig az, hogy semmit sem bizonyítanak. A részletes levezetés lejjebb található, a hosszú gondolatjelekről (em dash) szóló szakaszban.
Címke- és magánhasználatú karakterek, amelyek utasításokat rejtenek el a szövegben
A Unicode Tags blokkban található karakterek (U+E0000 – U+E007F) egy teljes mondatot is hordozhatnak, amelyet emberi olvasó soha nem fog látni. A támadók így csempésznek rejtett utasításokat olyan szövegbe, amelyet később egy AI-asszisztens fog elolvasni.
Az AWS Security Blog 2025. szeptember 30-án foglalkozott a Unicode-karaktercsempészettel. Olyan címkekaraktereket ír le, amelyeket „eredetileg láthatatlan jelölőként terveztek a szövegen belüli nyelv jelzésére”, és amelyek „a prompt injection lehetséges támadási vektoraként jelentek meg”. A Cloud Security Alliance 2026. március 10-i kutatási feljegyzése ugyanezt a trükköt követte nyomon AI-ágens-készségekben, eszközleírásokban és MCP-szerverekben. Ez a munka a Tags blokkot az U+200B, U+200C, U+200D és U+FEFF karakterek mellett említi meg.
Összeállítottam egy példát, hogy lássam a méretét. A látható „Great work on the report.” mondat 25 karakter és 25 bájt. Hozzáfűztem egy 42 karakteres, címkekarakterekbe kódolt utasítást. A fájl 67 karakterre és 193 bájtra nőtt. A képernyőn még mindig öt szóként és egy pontként olvasható, egy parancsfájl pedig hiánytalanul kinyerte az utasítást a szövegből. Minden címkekarakter négy bájtot és nulla képpontot jelent.
Great work on the report.Ez a legerősebb indok a szöveg megtisztítására, aminek semmi köze az AI-észleléshez. Ha egy weboldalról másol be szöveget egy csevegőasszisztensbe, előfordulhat, hogy olyan utasításokat ad át neki, amelyeket soha nem írt le.
Láthatatlan karakterek eltávolítása a böngészőben: A vizsgálat és tisztítás folyamata
Ez a tisztító a beillesztés pillanatában átvizsgálja a szöveget, felsorol minden találatot a hivatalos Unicode-nevével és pozíciójával, és semmin sem változtat, amíg meg nem nyomja a Szöveg tisztítása gombot.
A folyamat négy lépésből áll:
- Illessze be a szöveget, vagy húzzon be egy .txt vagy .md fájlt.
- Tekintse át a találatok listáját, amely megnevez minden egyes karaktert és annak helyét.
- Válasszon egy előbeállítást, vagy tartsa meg azokat az egyedi találatokat, amelyeket meg szeretne védeni.
- Tisztítsa meg a szöveget, majd másolja ki vagy töltse le az eredményt.
Ez a tisztító a szöveg egyetlen szavát sem írja át, fogalmazza újra vagy teszi emberibbé.
A Normál, Haladó és Szigorú előbeállítások összehasonlítása
A Normál előbeállítás eltávolítja a mindennapi szövegekben problémát okozó karaktereket, a Haladó szélesebb kört fed le, a Szigorú pedig a legtöbb elemet szűri ki.
| Karaktercsoport | Normál | Haladó | Szigorú |
|---|---|---|---|
| Nulla szélességű szóköz, szóösszekötő, bájtsorrend-jelölő (BOM) | Eltávolítva | Eltávolítva | Eltávolítva |
| Kétirányú vezérlők és C0/C1 vezérlőkarakterek | Eltávolítva | Eltávolítva | Eltávolítva |
| Címkeblokk és magánhasználatú karakterek | Eltávolítva | Eltávolítva | Eltávolítva |
| Lágy elválasztójel U+00AD | Eltávolítva | Eltávolítva | Eltávolítva |
| Szokatlan szóközök a Zs kategóriában | U+0020 szóközre alakítva | U+0020 szóközre alakítva | U+0020 szóközre alakítva |
| U+200C és U+200D összekötő karakterek | Megtartva | Eltávolítva az emojisorozatokon kívül | Mindenhol eltávolítva |
| Variációs szelektorok | Megtartva | Eltávolítva az emojisorozatokon kívül | Mindenhol eltávolítva |
| Tipográfiai idézőjelek és gondolatjelek | Megtartva | Megtartva | Egyenes idézőjelekké és sima kötőjellé alakítva |
Az előbeállítások mellett három egykattintásos szűrő található: a láthatatlan karakterek törlése, a gondolatjelek és kötőjelek eltávolítása, valamint az emojik eltávolítása. Ezen szabályok közzététele szándékos döntés. Minden versenytárs eszköz egyetlen gomb mögé rejti a szabályrendszerét, így egészen addig nem tudhatja, mit távolított el a szövegéből, amíg valami el nem romlik.
Hogyan tartja épségben a kódblokkokat a Markdown kódvédelem?
Bekapcsolt Markdown mód és védelem mellett a tisztító kihagyja a körülhatárolt és sorközi kódokat, így az adott karaktert igénylő kódrészlet változatlan marad.
A programkód az egyetlen olyan terület, ahol egy folyószövegben szemétnek tekintett karakter tartóelem lehet. Egy reguláris kifejezés vagy egy tesztsztring függhet attól, hogy a bájtsorrend-jelölő pontosan a helyén maradjon.
Elhagyja a szövege az eszközét?
Nem. Mind a vizsgálat, mind a tisztítás a böngészőjében fut, és az oldal soha nem tölti fel vagy tárolja a szövegét.
A teljes őszinteséghez hozzátartozik a dolog másik fele is. Ez az oldal ingyenes, így hirdetéseket jeleníthet meg és webanalitikát használhat. Az opcionális JSON-jelentés rögzíti a módosításokat, de a szövegéből semmit sem tartalmaz.
Szöveg- és fájlkorlátok: 20 000 szó és 1 MB
A tisztító legfeljebb 20 000 szónyi beillesztett szöveget vagy egyetlen, legfeljebb 1 MB méretű UTF-8 fájlt fogad el .txt vagy .md formátumban.
Minden más kívül esik a hatókörön: nem támogatott a HTML, DOCX, PDF, JSON vagy CSV, a beillesztett tartalom pedig kizárólag egyszerű szövegként érkezik. JavaScript használata szükséges. Nincs felhasználói fiók és nincs fizetés. A felület 25 nyelven érhető el. A hivatalos Unicode elnevezések mindegyik nyelven angolul maradnak, mivel egy lefordított karakternévre már nem lehet pontosan hivatkozni.
Ha szöveg helyett fotókat szeretne kezelni, lehetősége van eltávolítani az AI-információkat a képről vagy szerkeszteni a kép metaadatait.
AI-szövegjelölés szolgáltatónként: a ChatGPT, a Claude, a Gemini és a Grok összehasonlítása
Csak egyes AI-szolgáltatók jelölik meg a szöveges kimenetet, és mindegyikük, amely ezt megteszi, szóválasztást alkalmaz a rejtett karakterek helyett.
| Szolgáltató | Jelöli a szöveget | Módszer | Felismeri ez a tisztító | Forrás és dátum |
|---|---|---|---|---|
| Anthropic, Claude | Igen | Tokenkiválasztáson alapuló vízjel, a SynthID Text egyik változata | Nem | Anthropic, 2026. augusztus 11-i bejelentés, 2026. augusztus 14-i technikai feljegyzés, frissítve: 2026. szeptember 1. |
| Google, Gemini | Igen | SynthID Text, tokenvalószínűség-moduláció | Nem | Google DeepMind, 2024. május 14., még abban az évben nyílt forráskódúvá téve |
| OpenAI, ChatGPT | Nincs megerősített szöveges vízjel | A szövegekhez éles környezetben nincs ilyen. A képek C2PA és SynthID, a hanganyagok SynthID jelölést hordoznak | Nem alkalmazható | OpenAI eredetigazolási (provenance) súgócikk, aktuális: 2026. szeptember 2. |
| xAI, Grok | Nincs nyilvános kötelezettségvállalás | Nincs megadva | Nem alkalmazható | Az xAI nem írta alá a Bizottság átláthatósági magatartási kódexét, közzétéve: 2026. augusztus 12. |
Az Anthropic közlése szerint a 2026. augusztus 2-án vagy azt követően indított modellek már a megjelenéskor tartalmazzák a jelölést. Folyamatban van a jelölés hozzáadása az ezen időpont előtt kiadott modellekhez is. A szöveges vízjelek észlelése nem nyilvános ellenőrző eszköz. Az Anthropic kijelenti, hogy az észlelés „jelenleg privát előnézetben érhető el a jogosult szervezetek számára, az uniós jogszabályoknak megfelelően”. A jogosultak körébe szabályozó hatóságok, bűnüldöző szervek, médiaorgánumok, tényellenőrök, kutatók, oktatási intézmények és uniós civil szervezetek tartoznak. Az Anthropic által szintén kínált ingyenes Claude Content Checker a generált fájlokban lévő C2PA Content Credentials adatokat olvassa be, ami teljesen más dolog, mint a szöveges vízjel.
Az, hogy az xAI nem írta alá a magatartási kódexet, még nem mentesíti a Grok-ot magának az AI Actnek (a mesterséges intelligenciáról szóló uniós jogszabálynak) a hatálya alól. Az önkéntes kódex a megfelelés egyik útja, nem pedig a jogszabály helyettesítője.
Hogyan működik a Claude szöveges vízjelezése?
A Claude egyenértékű szavak közül választ, és egy titkos kulcs dönti el, melyiket használja. A jelölés a döntések sorozata, nem pedig egy karakter a szövegben.
Az Anthropic egyszerűen fogalmazza meg a mechanizmust: „Ahelyett, hogy egy tetszőleges véletlenszám-generátort használna a következő szó kiválasztásához, a vízjelezés a kulcsot és az azt megelőző néhány szót használja fel annak meghatározására, hogy a modell melyik szót válassza.” A vállalat azt is kijelenti, hogy a Claude szöveges vízjele „a Google DeepMind által a Nature folyóiratban 2024-ben publikált SynthID-Text megközelítés egyik változata”.
A robusztusságot illetően az Anthropic konkrétan fogalmaz: „Az enyhe szerkesztés valószínűleg nem távolítja el teljesen a vízjelet”, míg egy teljes átírás, ahol minden szót kicserélnek, már megszünteti azt.
Mit jelöl meg a SynthID Text a Gemini kimenetében?
A SynthID Text a Gemini szövegalkotása során a tokenvalószínűségekbe ágyazza be a mintáját. A Google DeepMind 2024. május 14-én jelentette be a SynthID szöveges vízjelezést a Gemini alkalmazásban és a webes felületen. A módszer úgy működik, hogy „a generálás pillanatában további információkat visz be a tokeneloszlásba a generált tokenek valószínűségének modulálásával”. A DeepMind még abban az évben nyílt forráskódúvá tette a módszert a Responsible Generative AI Toolkit eszköztárán keresztül.
A közzétett korlátok éppolyan fontosak, mint maga a módszer. A SynthID Text a hosszabb és változatosabb válaszok esetén működik a legjobban. Gyengén teljesít a rövid, tényszerű válaszoknál, ahol a modellnek szinte semmilyen szabadsága sincs a megfogalmazásban. A megbízhatóság akkor is jelentősen lecsökken, ha a szöveget alaposan átírják vagy lefordítják.
Rejtett karakterek és AI-szerzőség: miért nem bizonyítja egyik a másikat?
A rejtett karakter arra bizonyíték, hogy valami feldolgozta a szöveget, nem pedig arra, hogy AI írta azt.
Minden láthatatlan karakterre létezik teljesen hétköznapi magyarázat, amely jóval az AI-alapú szövegírás megjelenése előtt keletkezett. A szövegszerkesztők, tartalomkezelő rendszerek és PDF-exportálók évtizedek óta szúrnak be ilyeneket. A találat mindössze annyit jelez, hogy a szöveg átment valamilyen szoftveren – ami szinte minden közzétett mondatra igaz.
Honnan származnak a láthatatlan karakterek az AI-n kívül?
A szövegszerkesztők, webszerkesztők, PDF-exportálások, fordítóeszközök, csevegőalkalmazások, valamint az egyszerű másolás és beillesztés mind maguktól szúrnak be láthatatlan karaktereket.
| Forrás | Gyakran hozzáadott karakterek | Ok |
|---|---|---|
| Szövegszerkesztők | U+00A0, U+2019, U+2014, U+00AD | Automatikus javítás és automatikus elválasztás |
| Webes és CMS-szerkesztők | U+200B, U+FEFF | Sortörési javaslatok és fájlkódolási jelölők |
| PDF-exportálások | U+2009, U+202F, U+00A0 | A tipográfiai térközök megőrzése a szöveg kimásolásakor |
| Fordító- és lokalizációs eszközök | U+200C, U+200D, U+061C | Az arab, perzsa és indiai írásrendszerek helyes megjelenítése |
| Csevegő- és üzenetküldő alkalmazások | U+200D, U+FE0F | Emojisorozatok, valamint szöveges vagy emoji formátumú megjelenítés |
| Alkalmazások közötti másolás és beillesztés | U+FEFF, vegyes Zs szóközök | Karakterkódolási átalakítás a vágólapon |
A saját 40 bájtos tesztmondatom négy találatot produkált anélkül, hogy valaha is találkozott volna egy nyelvi modellel. Ez az egyetlen mérés összefoglalja az egész érvelést.
Miért nem vízjelek a gondolatjelek (em dash)?
A gondolatjel egy teljesen megszokott írásjel, amelyet az írók, szerkesztők és automatikus javítók évszázadok óta használnak, így semmiféle információt nem hordoz arról, ki írta a mondatot.
A 2025-ös javítás pontot tesz az ügy végére. Az OpenAI 2025. november 14-én közölte, hogy a ChatGPT végre engedelmeskedik a gondolatjelek elhagyását kérő egyéni utasításoknak. Sam Altman aznap világosan fogalmazott: „Ha az egyéni utasításokban megkéri a ChatGPT-t, hogy ne használjon gondolatjeleket, végre azt teszi, amit elvárnak tőle”. Egy olyan szokás, amelyet a felhasználó kikapcsolhat a személyre szabási beállításokban, soha nem volt vízjel. Csupán egy a betanítás során felvett stílusminta volt, a megoldás pedig egy beállítási preferencia.
Ez a tisztító továbbra is felkínálja a gondolatjelek eltávolítását, mégpedig őszinte indokból: ez egy stílusszűrő azoknak, akik egyenes idézőjeleket és sima kötőjeleket szeretnének a szövegükben. Ez nem vízjelszűrő, és semmit sem változtat azon, amit bármelyik detektor mond a szövegéről.
Amikor a tisztítás tönkreteszi a szöveget: perzsa, arab, indiai írásrendszerek és emojik
A nulla szélességű karakterek eltávolítása elronthatja a helyes szöveget, mivel egyes írásrendszerekben elengedhetetlenek a szavak megfelelő leírásához.
Lefuttattam a négy leggyakrabban hibát okozó esetet, és pontosan feljegyeztem a történteket. A perzsa میخواهم szó nyolc karakterből áll, és a közepén található U+200C megakadályozza a két rész összekapcsolódását. Ha törli, a میخواهم alakot kapja: hét karaktert és egy eltérő írásképet. A dévanágari írásban a क्ष egy U+200D-t tartalmaz, amely a helyes ligatúrát alkotja; ennek eltávolítása megváltoztatja a képernyőn látható formát. A család emoji 👨👩👧👦 hét kódpontból áll: négy kép, amelyeket három U+200D összekötő tart össze. Távolítsa el az összekötőket, és négy különálló alakra esik szét: 👨👩👧👦. A piros szív ❤️ az U+FE0F kódpontot hordozza, hogy emojiként jelenjen meg; nélküle ugyanez a kódpont egyszerű szöveges szimbólummá alakul vissza: ❤.
Ezért jeleníti meg az eszköz a találatokat a tisztítás előtt, ezért tarthatók meg az egyedi elemek, és ezért nem a Szigorú az alapértelmezett beállítás. Az egyetlen nyelven dolgozó szerkesztő tiszta eredményt lát; a hat nyelven dolgozó szerkesztő egy hibajelentést.
Végső összegzés az AI-szövegvízjelek tisztításáról
A láthatatlan karakterek megtisztítását érdemes elvégezni a tiszta, hordozható és biztonságos szöveg érdekében.
Két ok indokolja ennek az eszköznek a használatát. Az első, hogy a rejtett karakterek észrevétlenül hibákat okoznak a keresési találatokban, a táblázatkezelők keresőfüggvényeiben, a programkódban és az URL-címekben. A második, hogy a címkekarakterek olyan utasításokat juttathatnak el egy AI-asszisztenshez, amelyeket senki sem gépelt be, és senki sem lát. Ezért a tisztítás inkább biztonsági szokás, semmint pusztán esztétikai kérdés.
Bárki, aki egy szolgáltató vízjelének kijátszásában reménykedik, nem a megfelelő szinten próbálkozik. A Claude és a Gemini a szóválasztásban helyezi el a jelölést, az OpenAI a képeket és a hanganyagokat jelöli, a szöveget nem, és semmilyen mértékű karaktertörlés nem éri el ezeket. Az ilyen statisztikai vízjelek kijátszásának egyik módja, ha a szöveget lefordítja néhány különböző nyelvre, majd visszalefordítja az eredetire.
Illesszen be egy oldalt a saját szövegéből a fenti beviteli mezőbe, és olvassa el a találatokat a szöveg jobb megértéséhez, vagy egyszerűen másolja ki a kimenetet.
Egyelőre ennyi. Köszönjük, hogy elolvasta!