Iparági jelentés #001

Mit árul el az egészségügy webtopológiája az AI-felkészültségről

Tizenegy Fortune 500 egészségügyi oldal elemzése szerint nagyjából minden negyedik lap nem érhető el a kezdőlapról belső szerkesztői linkeket követve, és a topológiai hibamódok, amelyek az egyik oldalt megbénítják, ritkán bénítják meg ugyanúgy a következőt.

Iparág · Egészségügy Adathalmaz · Q1 2026 Elemzett oldalak · 11 Közzétéve · 2026. május 26.

A lényeg

A 2026 első negyedévében bejárt tizenegy Fortune 500 egészségügyi oldalon, összesen 7 125 lapon és 11,1 millió token nyilvános tartalmon, a tartalom nagyjából negyede nem érhető el úgy, hogy a kezdőlapról belső szerkesztői linkeket követünk. Az XML-sitemap a lapok többségét megmenti a sitemapet olvasó keresőmotor-crawlerek számára, de marad egy maradék: minden tizenkettedik lap szerkezetileg láthatatlan: nincs szerkesztői út hozzá a kezdőlapról, és a sitemapben sem szerepel. URL-ként létezik az oldalon, de sehol sem hirdetik, ahol egy magára hagyott crawler megtalálhatná.

A következmény közvetlen. Amikor egy linkkövető AI-ügynököt egy nagy egészségügyi márkáról kérdeznek, a márka lapjainak nagyjából negyede nincs abban a válasz-térben, amit az ügynök magától elér. Ennek a résnek egy jelentős szelete olyan tartalom, amit az oldal maga a crawlereknek sem hirdet.

A háromszintű elérhetőségi modell

Egy oldal minden lapja a három elérhetőségi szint egyikébe esik:

  1. Belső linkeken elérhető. Létezik olyan út a kezdőlapról, amely szerkesztői (tartalmon belüli) linkeket követve vezet a laphoz. Ezek azok a lapok, amelyeket egy linkkövető AI-ügynök magától megtalál.
  2. Csak a sitemapben. A lap szerepel az oldal XML-sitemapjében, de nem vezet hozzá belső szerkesztői linkút. A sitemapet olvasó crawlerek indexelik. Az ügynökök, amelyek nem olvassák, nem.
  3. Szerkezetileg elérhetetlen. A lap sem szerkesztői linkeken nem érhető el, sem a sitemapben nincs jelen. URL-ként létezik az oldalon, de sehol sem hirdetik, ahol egy magára hagyott crawler megtalálhatná. Hogy egyáltalán felbukkan-e egy keresésben, az más oldalakról érkező külső bejövő linkeken múlik.

A 11 oldalas egészségügyi mintánkon átlagolva:

Belső linkeken elérhető: 72.8% Belső linkeken elérhető 72.8% Csak a sitemapben: 19.3% Csak a sitemapben 19.3% Szerkezetileg elérhetetlen: 7.9% 7.9%
  • Szerkezetileg elérhetetlen (7.9%)
Mintaátlag 11 egészségügyi F500 oldalon, 2026 Q1.
Adatok megtekintése
Szegmens Érték
Belső linkeken elérhető 72.8%
Csak a sitemapben 19.3%
Szerkezetileg elérhetetlen 7.9%

Az átlagok elfedik, milyen egyenetlenül oszlik el a hiba. Az alábbi oldalankénti pontsávon a tizenegyből négy oldal szerkezetileg-elérhetetlen aránya nulla vagy annak közelében van: a szerkesztői gráfjuk és a sitemapjük egyetért abban, mi az oldal. A maradék hét 0,4% és 34,7% között szóródik, és az egyik oldal a lapjainak teljes harmadát teszi ki minden hirdetett úton kívülre.

0% 10% 20% 30% 40% mintaátlag 7.9% SH5: 2.9% SH5 SH2: 0.4% SH2 SH9: 0% SH9 SH6: 0% SH6 SH3: 0% SH3 SH10: 11.3% SH10 SH1: 0% SH1 SH11: 7% SH11 SH4: 11.1% SH4 SH7: 20% SH7 SH8: 34.7% SH8 Szerkezetileg elérhetetlen laparány (az oldal lapjainak %-a)
Minden pont egy oldal. Mintaátlag 7,9% (n=11).
Adatok megtekintése
Oldal Szerkezetileg elérhetetlen laparány (az oldal lapjainak %-a)
SH1 0%
SH3 0%
SH6 0%
SH9 0%
SH2 0.4%
SH5 2.9%
SH11 7%
SH4 11.1%
SH10 11.3%
SH7 20%
SH8 34.7%
Mintaátlag 7.9%

Egészségi mutatók: a hibamódok nem esnek egybe

A hagyományos intuíció szerint az árvák (a befelé mutató szerkesztői link nélküli lapok) a domináns szerkezeti probléma. Az egészségügyi F500 adatok érdekesebb történetet mesélnek: a legrosszabb árva-arányú oldalak nem ugyanazok, mint a legrosszabb zsákutca-arányúak.

0% 10% 20% 30% 40% 50% mintaátlag 13% SH6: 4.2% SH6 SH8: 3.6% SH8 SH11: 2.8% SH11 SH9: 22.4% SH9 SH1: 2.3% SH1 SH4: 13.4% SH4 SH7: 20.2% SH7 SH2: 0.4% SH2 SH10: 12.3% SH10 SH5: 19.1% SH5 SH3: 42.6% SH3 Árva-arány (az oldal lapjainak %-a)
Nulla befelé mutató szerkesztői linkkel rendelkező lapok. Mintaátlag 13,0% (n=11).
Adatok megtekintése
Oldal Árva-arány (az oldal lapjainak %-a)
SH2 0.4%
SH1 2.3%
SH11 2.8%
SH8 3.6%
SH6 4.2%
SH10 12.3%
SH4 13.4%
SH5 19.1%
SH7 20.2%
SH9 22.4%
SH3 42.6%
Mintaátlag 13%
0% 20% 40% 60% 80% mintaátlag 14.6% SH1: 4.5% SH1 SH4: 1.8% SH4 SH3: 1.2% SH3 SH5: 0.5% SH5 SH7: 20.5% SH7 SH6: 0% SH6 SH10: 15.8% SH10 SH2: 0% SH2 SH9: 14.7% SH9 SH8: 29.1% SH8 SH11: 72% SH11 Zsákutca-arány (az oldal lapjainak %-a)
Lapok, amelyek befelé mutató linket kapnak, de kifelé semmire nem linkelnek. Mintaátlag 14,6% (n=11), egyetlen szélsőséges oldal húzza.
Adatok megtekintése
Oldal Zsákutca-arány (az oldal lapjainak %-a)
SH2 0%
SH6 0%
SH5 0.5%
SH3 1.2%
SH4 1.8%
SH1 4.5%
SH9 14.7%
SH10 15.8%
SH7 20.5%
SH8 29.1%
SH11 72%
Mintaátlag 14.6%

Vesd össze a két sávot. A legmagasabb árva-arányú oldalnak (SH3, 42,6%) csaknem a legalacsonyabb zsákutca-aránya van (1,2%). A legmagasabb zsákutca-arányú oldalnak (SH11, 72,0%) csaknem a legalacsonyabb árva-aránya (2,8%). Ezek független hibamódok, nem ugyanannak a problémának a két arca.

A pontsávok azt is megmutatják, hogy a zsákutca-arányok szórása nagyobb, mint az árva-arányoké. Az árvák a tizenegyből tíz oldalon 0,4% és 22,4% között csoportosulnak, egy oldal pedig 40% fölé fut. A zsákutca-arányok a tizenegyből tízen egyenletesebben terülnek szét 0% és 30% között, majd a szélsőséges esetben 72%-ra ugranak.

A tanulság egy linkszerkezetet bejáró AI-ügynök számára: egy árva hiányzó belépési pont, egy zsákutca viszont keringési végpont. Mindkettő megbukik az ügynök azon elvárásán, hogy egy lapra megérkezni további lapok felfedezését jelenti. Ezeken az egészségügyi oldalakon a hiba ritkán csak az egyik vagy a másik. A legtöbb oldalon a kettő közül legalább az egyik a piros tartományban van.

Az iparági pontozótábla

Az ötlencsés elemzés minden oldalnak zöld, sárga vagy piros pontszámot ad mind az öt lencsén. A mintán:

Oldal Váz Méret, sűrűség és átlagos úthossz. Mekkora az oldal, és mennyire összekapcsolt a törzs szintjén. Keringés PageRank-eloszlás és szerkezeti szűk keresztmetszetek. Hogyan áramlik a fontosság a lapok között, és mely csomópontok tartják össze az egészet. Szervek Közösségdetektálás. A tematikus klaszterek tisztán elválnak-e, vagy egyetlen óriásklaszter ural mindent. Egészség Szigetek, árvák és zsákutcák. Hol haldoklik szerkezetileg a tartalom: elérhetetlen, linkeletlen vagy lezáruló. Idegrendszer Kattintási mélység, hidak és közösségek közötti linkelés. Az oldal jól tervezett épület-e, vagy összefüggéstelen szobák halmaza.
SH1
SH2
SH3
SH4
SH5
SH6
SH7
SH8
SH9
SH10
SH11
  • Zöld: egészséges
  • Sárga: mérsékelt aggály
  • Piros: kritikus
Ötlencsés pontozótábla a 11 egészségügyi oldal mindegyikére.

A minta a hőtérképen: a vázak és a keringés többnyire rendben vannak. Az Egészség és a Szervek a gyenge pontok. A tizenegyből tíz oldal zöld vázat kap, a maradék egy sárgát, vagyis a linksűrűség a törzs szintjén egészséges. De a tizenegyből három piros az Egészségen, és csak kettő zöld, miközben a tizenegyből négy piros a Szerveken. A kép következetes: az egészségügyi F500 oldalak a felszínen jól megépítettek, és hibásak azon a szinten, ahogy a szerkesztői jel a tematikus közösségek között utazik.

Kattintási mélység: az elérhetőség adója

Még a technikailag elérhető lapok is ülhetnek messze a kezdőlaptól. A kohorsz átlagos maximális kattintási mélysége 7,3 kattintás; az egyik oldalon vannak 14 kattintás mélyen lévő lapok. A mintán átfutva a lapok 21%-a él 4-es vagy nagyobb kattintási mélységben.

Kattintási-mélység mutató Mintaátlag (n=11) Tartomány
Maximális kattintási mélység 7,3 kattintás 3–14
Átlagos kattintási mélység 3,2 kattintás 1,7–4,2
Lapok ≥4 mélységben 21,0% 0%–37%

Két rezsim él egymás mellett. Öt oldal maximális mélysége három-öt kattintásnál tetőzik: vagy a kezdőlap keveset ér el szerkesztői linkeken, vagy az egész linkgráf lapos legyező, nem hierarchia. A másik véglet az SH6 a 14-es mélységgel, egy mély, de lineáris gráf, ahol egyes lapokhoz tizennégy szerkesztői ugrás kell a belépési ponttól. Az AI-ügynökök és a hagyományos crawlerek egyaránt a sekély utak felé hajlanak. Egy lap, amelyhez hét vagy több szerkesztői ugrás kell, a gyakorlatban csak annyira felfedezhető, amennyire a sitemap-sora.

Tartalomminőség léptékben

Mind a tizenegy oldal együtt: 7 125 lap, 11,1 millió token törzsszöveg, és nagyjából 257 000 belső szerkesztői link közöttük.

Tartalmi mutató Mintaátlag (n=11) Megjegyzés
Lap per oldal 648 Medián 699, tartomány 239–998
Átlagos szószám per lap 874 Medián 605; hosszú lapok hosszú farka
Átlagos tokenszám per lap ~1470 Karakter-alapú becslés (hossz / 4)
Vékony tartalmú lapok (200 szó alatt) 17,2% Tartomány 0%–37%
Nulla tartalmú lapok ~1% A „redirect / héj-oldal” arány
Belső és külső linkek aránya 82% belső Az egészségügyi oldalak többnyire önmagukra linkelnek
Title-tag lefedettség 99,5% Szinte univerzális
Meta-leírás lefedettség 80,5% Minden ötödik lapról hiányzik a leírás

A vékony-tartalom szám az, amit figyelni érdemes. A kohorsz átlagos oldalán minden hatodik lap 200 szónál rövidebb. Ezek azok a lapok, amelyek legalább annyira a sitemapnek léteznek, mint az olvasónak: redirect-célok, navigációs csonkok, lokációs oldalak, egy-állítású landoló oldalak, archivált esemény-összefoglalók. Egy AI-ügynök szemszögéből gyenge jelek: túl kevés szöveg egy magabiztos összefoglaló rögzítéséhez, de elég ahhoz, hogy telezsúfoljanak egy tudásgráfot. Némelyik vékony lap legitim (egy kategória-landoló, amely a gyerekeire delegál). A 17,2%-os mintaátlag a jelzésre érdemes rendszerszintű hányad, nem az egyes lap.

Mit oszt meg minden egészségügyi F500 oldal

Minden oldal egyetlen legnagyobb URL-szakaszát nézve egy következetes alak rajzolódik ki. A tizenegyből hat oldal domináns tartalomtípusa egy sajtóközlemény- / hír- / hírszoba-szakasz; azokon az oldalakon, ahol ez a szakasz létezik, rendszeresen az összes bejárt lap 40% és 80% közötti részét adja.

Hír / hírszoba változat
50.6%
6 a 11 oldalból: olyan nevek alatt jelenik meg, mint /news, /newsroom, /knowledge-center, /media-center
Terápiás / termékterület
41.2%
3 a 11 oldalból: pl. /innovativemedicine, /life-and-science, /public-policy-institute
Márka / rólunk
27.3%
2 a 11 oldalból: /who-we-are, /about-us
Egy-lokálos burkoló
100%
1 a 11 oldalból: az egész oldal a /en-us alatt él, további szakaszszerkezet nélkül

Az oldal lapjainak átlagos %-a a domináns szakaszon, ahol az létezik

Minden oldal legnagyobb URL-útvonal-szakasza, archetípus szerint csoportosítva a 11 oldalon.

A kohorsz domináns mintája a sajtóközlemények / hírek / hírszoba valamilyen változata. A minta fele hordozza ezt az archetípust, és azokon az oldalakon átlagosan az összes bejárt lap felét adja. Az ebben a kötegben szereplő egészségügyi F500 oldalak szerkezetileg hírarchívumok, tetejükön egy vékony termékréteggel.

Ez az egyetlen építészeti döntés végiggyűrűzik a fenti topológiai mutatók többségén. A sajtóközlemény-tartalom nagy volumenű, gyorsan avuló, és ritkán linkel keresztbe a saját dátum-silóján kívülre. Egy 2018-as negyedéves eredményközlemény aligha linkel egy 2024-es termékbevezetésre, és fordítva. Az eredmény pontosan az a topológia, amit mértünk: mély kattintási mélység, a hír-silóban koncentrálódó magas árva- és zsákutca-arányok, kevés szakaszok közötti linkelés. A legtöbb egészségügyi F500 oldal nem valami szokatlan módon hibás építészetileg. Sajtóközlemény-archívumok, amelyek történetesen terméklapokat is hostolnak.

Mit jelent ez az AI-keresési felkészültség szempontjából

Két különböző AI-fogyasztási minta másképp lép kölcsönhatásba a három elérhetőségi szinttel. Az indexelő crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) beolvassák a sitemap.xml-t, és a 2. szintű, csak-sitemapben lapokat ugyanúgy elérik, mint a Googlebot; számukra a szerkezetileg elérhetetlen 7,9% a releváns rés. A másik eset az ügynöki böngészés lekérdezéskor: egy LLM, amely valós időben követ belső linkeket egy konkrét kérdés megválaszolásához („mit kínál ez a cég az onkológiában?”). Ez a mód link-kötött. Nem tölti be előre a sitemapet; azt járja be, ami szerkesztőileg linkelve van onnan, ahol landol. Az ügynöki esetben a teljes 27%-os, linkeken elérhetetlen szám van játékban.

A szerkezeti probléma mindkét rezsimben számít, de a másodikban élesebben. A szakasz hátralévő része a linkkövető esetről szól.

Egy AI-ügynöknek, amely a belső linkszerkezetet használja tartalom felfedezésére és rangsorolására, három következmény adódik ezekből az adatokból.

1. A tartalom nagyjából negyede láthatatlan egy linkkövető ügynök számára. A 27%-os átlagos, linkeken elérhetetlen arány azt jelenti, hogy minden három lapra, amiről az ügynök bejárással tudomást szerez, jut nagyjából még egy, amit sosem lát. A tipikus oldal nagyjából 19%-át a sitemap menti meg (a sitemapet olvasó crawlerek számára); a maradék 8% láthatatlan minden számára, ami nem ismeri eleve az URL-t.

2. Még az elérhető lapok is gyakran sehová sem vezetnek. A zsákutca-arány nem hiányzó-lap probléma; keringési probléma. Az ügynök megérkezik a lapra, de semmit sem tud meg arról, mi van mellette. A tematikus városrészek nem épülnek fel, mert a linkek, amelyek felépítenék őket, nem léteznek. Ez érinti azt, hogyan válaszol az ügynök olyan kérdésekre, mint „mi mást kínál még ez a cég ezen a területen?” A válasz-tér szükségtelenül beszűkül.

3. A sajtóközlemény-tartalom elnyomja a terméktörténetet. Amikor egy hír / hírszoba szakasz az oldalak bejárható lapjainak nagyjából felét adja átlagosan azon az oldal-felen, ahol ez a minta dominál, és a szerkesztői linkelés többnyire a dátum-silón belül marad, egy AI-ügynök arra a kérdésre, hogy „mit csinál ez a cég?”, azt a választ kapja, hogy „sajtóközleményeket ad ki”. A terméktörténet, amit a marketingcsapat a felszínen szeretne látni, relatíve alul-linkelt marad az alapból létező hírarchívum-tartalomhoz képest.

A megoldás nem több tartalom, több lap vagy egy újratervezés. Szerkezeti: a zsákutcák lezárása tematikus szomszédokra mutató kimenő linkekkel, az árvák megmentése a közösségeikbe, azoknak a szakaszok közötti hidaknak a felépítése, amelyek egy sajtóközlemény-archívumból valódi termék-gerincű topológiát csinálnak. Ez a Digital MRI szolgáltatás teljes premisszája.

Módszertan

Ez a jelentés tizenegy anonimizált Fortune 500 egészségügyi weboldal topológiai és tartalmi adatait összesíti. Minden oldal ugyanazon a folyamaton ment át: Playwright-alapú tartalmi feltérképezés, törzstartalom-kinyerés (a navigációs, fejléc- és lábléclinkek kiszűrése), gráfépítés globális-nav-link szűrővel, és az ötlencsés topológiai elemzés (Váz, Keringés, Szervek, Egészség, Idegrendszer). Minden azonosító információt semleges kódnevek (SH1-től SH11-ig) váltottak fel; a hozzárendelést ez a jelentés nem teszi közzé. Oldalszintű adat-függelék kérésre elérhető.

A tizenegy oldal kurált kohorsz, nem az egészségügyi iparág véletlen mintája. Az összesített számok (mintaátlagok, tartományok) ezt a köteget írják le, és feltáró referenciaértékekként közöljük őket az F500 egészségügyi topológiához, nem a tágabb szektorra vonatkozó pontbecslésekként. Egy nagyobb, iparágakon átívelő alapvonal készülőben van.

Egy tizenkettedik, eredetileg ebbe a kötegbe szánt Fortune 500 egészségügyi oldal kiesett, miután a crawl-hosztunkról ismételten TCP-szintű hálózati elérhetetlenséget mutatott (geo-blokkolás az oldal peremén). Nem része a fenti számoknak.

Megjegyzés arról, mit mér a „szerkezetileg elérhetetlen”

Ebben a jelentésben a szerkezetileg elérhetetlen olyan lapokra utal, amelyekhez nem vezet belső szerkesztői linkút a kezdőlapról, és nincsenek benne az oldal XML-sitemapjében. Ez annak a mértéke, hogy az oldal maga mennyire hirdeti szerkezetileg a lapot, nem a lap keresőmotoros indexeltségi állapotáé. Azok a lapok, amelyeket az oldal maga jelöl nem-indexelhetőnek, kimaradnak a számításból.

A kezdőlap azért a horgony, mert az a lap, amit a crawlerek és az ügynökök szinte mindig elsőként érnek el: a kanonikus belépési pont, amelyre a domain gyökere, a keresési találatok, a külső hivatkozások és a márka saját marketingje is linkel. A felfedezés innen halad kifelé azokon a szerkesztői linkeken át, amelyeket a kezdőlap kitesz. Egy lap, amely ezeket a linkeket követve nem érhető el, gyakorlati értelemben olyan lap, amit az oldal senkinek sem hirdet, aki a főbejáraton érkezik.

Jogi nyilatkozat. Ez az elemzés webtopológiai feltérképezéssel és hálózattudományi módszerekkel készült, beleértve a PageRanket, a Louvain közösségdetektálást és a köztiség-centralitást. A crawler tiszteletben tartja az oldalszintű robots-direktívákat; a tiltott lapokat sosem töltöttük le, és nem részei ennek az adathalmaznak. A navigációs, fejléc- és lábléclinkek automatikusan kizárásra kerültek: bármely link-cél, amely a lapok több mint 80%-án megjelent, globális navigációként lett kezelve, és a topológiai elemzés előtt kikerült a gráfból. Csak a tartalmon belüli (szerkesztői) linkek maradnak. Az oldal által nem-indexelhetőnek jelölt lapok levonásra kerülnek a szerkezetileg-elérhetetlen számból. Minden adat kizárólag nyilvánosan elérhető oldalszerkezetet képvisel. Nem gyűjtöttünk és nem tároltunk tartalmat, metaadatot vagy felhasználói adatot. Minden azonosító információ anonimizált; a kódnév-domain hozzárendelést szándékosan nem publikáljuk. A tokenszámok karakter-alapú becslések (a lap hossza osztva néggyel), nem tokenizáló kimenetek. A kattintási mélységet a kezdőlaptól mért szélességi-bejárásos távolságként mérjük, belső szerkesztői linkeket követve. A statisztikai minták kizárólag oktatási célt szolgálnak, és nem minősülnek tanácsnak semmilyen konkrét oldalról vagy cégről.