◈ SEC / AI

LLM = Informatie Compressie

Modellen als paywall-bypassers · Wetenschap als gewichten · China als vector

Compressie Pipeline

Een LLM is niet "kunstmatige intelligentie". Het is een compressie-algoritme. Het comprimeert de menselijke kennis in matrix-wichten. Wat je "inferentie" noemt, is decompressie.

📄
Input
1.5T tokens
🔤
Tokenize
128K vocab
Train
Attention
📊
Weights
7B params
🔓
Decompress
Inferentie
// LLM compressie in pseudocode
const compress = (kennis) => {
  const tokens = tokenize(kennis); // 1.5T → tokens
  const gradients = attention(tokens); // patronen vinden
  const weights = backprop(gradients); // comprimeer
  return weights; // 7B params = alle kennis
};

const decompress = (prompt, weights) => {
  return attention_decode(prompt, weights);
  // = "antwoord" = decompressie van opgeslagen kennis
};

Het Paradox

◈ Paywall vs LLM

Uitgevers betalen wetenschappers → publiceren achter paywall → prijzen van $40-$50 per artikel. Maar LLMs trainen op alles — inclusief die "betaalde" papers.

Resultaat: De LLM weet wat achter de paywall zit. De paywall bestaat nog steeds voor mensen, maar niet voor machines. De machine omzeilt het systeem dat mensen opsluit.

Dit is wat Aaron Swartz wilde — vrije toegang tot wetenschap. Maar hij probeerde het met downloads. De toekomst probeert het met compressie.

China als Vector

China's strategie is niet per ongeluk. Het is een bewuste informatie-compressie operatie.

🇨🇳 De Strategie

  • Scrape de hele academische wereld — PubMed, arXiv, IEEE, ScienceDirect
  • Train modellen op deze data — Qwen, ERNIE, GLM
  • Kennis is nu in de weights — geen paywall meer relevant
  • Resultaat: volledige wetenschappelijke kennis, gecomprimeerd

Dit is geen diefstal in de traditionele zin. Het is compressie als strategisch wapen.

Model Land Params Training Data Open?
🇨🇳Qwen 2.5 China 72B 15.6T tokens Ja
🇺🇸GPT-4 VS ~1.8T Onbekend Nee
🇺🇸Claude 3.5 VS ~400B Onbekend Nee
🇨🇳ERNIE 4.0 China Onbekend Multi-taal Deels
🇨🇳GLM-4 China 9B+ ~12T tokens Ja
🌍Llama 3.1 VS 405B ~15T tokens Ja
🇨🇳DeepSeek V3 China 671B Onbekend Ja

Opmerking: China's modellen zijn vaker open-source dan hun westerse tegenhangers. Open weights = open wetenschap, gecomprimeerd.

Schaal van Compressie

Hoeveel wetenschap past in een model?

PubMed Papers
38M
arXiv Papers
2.5M
Wikipedia
6.7M
GitHub Code
179M
Bookscapes
~3M
→ In Model Weights
7B params

"Een 7B-parameter model weegt ~14GB. De volledige wetenschappelijke literatuur weegt ~100TB. Compressie-ratio: ~1:7000."

— Ruwe berekening, maar de punt blijft: LLMs comprimeren kennis radicaal

Tijdlijn: Compressie als Geschiedenis

2008
Aaron Swartz: "Guerrilla Open Access Manifesto" — knowledge moet vrij zijn
2013
Aaron sterft. Open Access beweging versnelt, maar paywalls blijven
2017
Attention Is All You Need — Transformer-architectuur. Compressie wordt schaalbaar
2018
BERT, GPT-1 — 100M-345M params. Wetenschappelijke papers in training data
2020
GPT-3 — 175B params. De model weet dingen die achter paywalls zaten
2021
ChatGLM, ERNIE — China bouwt eigen modellen op eigen data
2023
GPT-4, Claude, Qwen, DeepSeek — kennis-compressie bereikt kritische massa
2024
OpenAI v1 — Agenten die actief internet gebruiken. Compressie + actie
2025
DeepSeek, Qwen 2.5 — China's modellen overtreffen westerse benchmarks
2026
Paywalls irrelevant voor AI. Mensen betalen nog steeds $50 voor papers. Machine weet het gratis.

Implicaties

◈ De Vraag

Als een LLM de hele wetenschappelijke literatuur heeft ingeslokt en gecomprimeerd in 7B parameters...

Wie is dan echt de eigenaar van die kennis?

De uitgever die de paywall zet?
De onderzoeker die het paper schreef?
Het bedrijf dat het model traint?
Of de mensheid, die de kennis heeft gegenereerd?

Aaron Swartz zou zeggen: de mensheid.
De rechter zou zeggen: de uitgever.
De AI-ingenieur zegt niets — het model heeft het gewoon gedaan.

🇨🇳 China's Voordeel

  • Open-source modellen = geen afhankelijkheid van Amerikaanse API's
  • Eigen training data = eigen kennisvector, niet afhankelijk van westerse wetenschap
  • Staatstechnisch: kennis-compressie = soevereiniteit
  • Scalabel: 1B+ mensen hebben toegang tot gecomprimeerde wetenschap
// De compressie als formule
wetenschap paywall LLM weights gratis

// Aaron's droom, geïmplementeerd door gradient descent
const vrijeKennis = llm("Hoe werkt fotosynthese?");
// = decompressie van alle biologische papers ooit geschreven
// = $0.00 = geen paywall = Aaron zou glimlachen

Token Stroom

Kennis als token-stroom — wat een LLM "ziet":