From 6551fb2d9e863444a2ddd20a5f8fb80d3ef1c777 Mon Sep 17 00:00:00 2001 From: Hector Date: Wed, 23 Sep 2026 15:18:52 +0200 Subject: [PATCH] ingest(other): netbits ollama cloud data retention + prompt caching side channels --- ...its-ollama-cloud-privacy-prompt-caching.md | 111 +++++++++++++++++ .../cloud-exit-and-local-superiority.md | 1 + .../ki-souveraenitaet-dezentralisierung.md | 1 + .../inference-provider-data-retention.md | 112 ++++++++++++++++++ wiki/concepts/prompt-caching.md | 30 ++++- wiki/index.md | 6 +- wiki/log.md | 27 +++++ wiki/people/netbits.md | 29 +++++ ...lama-cloud-deepseek-v4-flash-200tps-zdr.md | 11 ++ 9 files changed, 324 insertions(+), 4 deletions(-) create mode 100644 raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md create mode 100644 wiki/concepts/policy/inference-provider-data-retention.md create mode 100644 wiki/people/netbits.md diff --git a/raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md b/raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md new file mode 100644 index 0000000..fbed0f9 --- /dev/null +++ b/raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md @@ -0,0 +1,111 @@ +--- +type: other +source_url: "telegram://-1003839640481/topic/15163" +retrieved: 2026-09-23 +title: "Netbits (@NetLightning): Ollama-Cloud-Datenhaltung und Prompt-Caching-Seitenkanäle — Recherchepost" +author: "Netbits ⚡️ Stachelbanane (@NetLightning)" +posted_date: 2026-09-23 +tags: [ollama, cloud-inference, data-retention, zdr, privacy, prompt-caching, kv-cache, side-channel, deepseek, promptpeek, audit] +--- + +# Netbits: Ollama-Cloud-Datenhaltung und Prompt-Caching-Seitenkanäle + +## Kontext + +Recherchepost von Netbits (@NetLightning) im OME-Topic „Openclaw mit lokalen Modellen" (#1744), 2026-09-23 13:10 UTC. Anlass war die Frage nach Datenhaltung bei Cloud-Inferenz über Ollama Cloud (Hectors Tier-0-Modell `deepseek-v4.1-flash` läuft dort). Der Post enthält einen Netzwerk-Faktencheck, Zitate aus Ollamas Primärquellen, einen GitHub-Issue-Verweis und zwei peer-reviewte Paper. + +## Post-Inhalt (wörtlich, gekürzt um Höflichkeitsformeln) + +> Zuerst der Faktencheck an deiner eigenen Maschine: Der Gateway hat **genau eine** ausgehende Verbindung nach draußen — `192.168.100.4 → 76.76.21.123:443`, und die IP gehört **Amazon (Walnut, Kalifornien)**. Das ist ollama.com. Kein Nous-Telemetrie-Endpunkt, keine Analytics. Alles, was rausgeht, geht an einen einzigen Anbieter. +> +> **1. Was Ollama offiziell zusagt.** Aus der Datenschutzerklärung wörtlich: „When using cloud-hosted models, we process this content **transiently** to provide the Service and this content is not stored beyond the time required to fulfill the request." / „We do **not** use your inputs or outputs to train any AI models." Und auf der Preisseite: „When Ollama partners with providers, we require **no logging, no training, and zero data retention** policies in place." Das ist stark — **stärker als OpenAI (30 Tage), Anthropic (7 Tage) oder Google (bis 18 Monate)**. +> +> **2. Die Lücke, die dokumentiert ist.** GitHub Issue #14279: Ollama betreibt **nicht alle** Cloud-Modelle auf eigener Hardware. Für manche Modelle wird an **Drittanbieter-APIs** geroutet — bei Qwen 3.5 war Alibaba der einzige Endpunkt. Ollamas eigene Datenschutzerklärung nennt in Abschnitt 5 ausdrücklich „model inference providers" als Dritte. Ollamas Zusage ist damit **vertraglich, nicht technisch**: Sie *verlangen* ZDR von ihren Partnern. Sie *beweisen* es nicht, und es gibt keine unabhängige Prüfung. Praktisch heißt das: Ob deine Daten wirklich nicht gespeichert werden, hängt davon ab, **welches Modell** du fährst und **bei welchem Betreiber** es landet. Bei `deepseek-v4.1-flash` ist das ein offenes Gewichtsmodell auf NVIDIA-Cloud-Hardware — **nicht** die DeepSeek-API. Die berüchtigte DeepSeek-Datenschutzerklärung gilt für **deepseek.com** — die App und die eigene API. **Nicht für dich.** +> +> **3. Die eigentliche Recherche.** Gu et al., ICML 2025 (arXiv:2502.07776) — auditierte **17 kommerzielle LLM-APIs**: **8** Anbieter nutzen Prompt-Caching, **7 dieser 8 teilten ihre Caches global** über alle Nutzer hinweg. Angriff über **Timing-Seitenkanal**. Nebenbei entdeckten sie OpenAIs **nicht-dokumentierte Architektur** des Embedding-Modells. Nach der Veröffentlichung änderten **mindestens 5 Anbieter** ihre Implementierung. +> +> Wu et al., NDSS 2025 („PROMPTPEEK"): Bei Multi-Tenant-Serving (SGLang) ließ sich der Prompt **Token für Token rekonstruieren** — **bis 99% Genauigkeit** bei bekanntem Prompt-Template, **95% ohne Vorwissen**. Sie extrahierten tatsächlich **personenbezogene Daten** aus gecachten Gesundheits-Prompts: Geschlecht, Alter, Gewicht. +> +> **Für dich relevant:** In derselben Stanford-Studie wurde **DeepSeek** als *per-user isoliert* validiert — also sauber. Für Ollama selbst liegt keine solche Prüfung vor. **Niemand hat Ollamas Cache-Isolation unabhängig getestet.** + +## Primärquellen-Verifikation (Abruf 2026-09-23) + +### Ollama Privacy Policy — Zitate bestätigt + +Abgerufen via web_fetch (https://ollama.com/privacy, 200, vollständig). Wortlaut bestätigt: + +- §2: „When using cloud-hosted models, we process this content transiently to provide the Service and this content is not stored beyond the time required to fulfill the request." +- §2: „We do not use your inputs or outputs to train any AI models or request prompt or response content in support requests." +- §5 „Information Sharing" nennt als Dritte unter „To provide you the Service": „Third parties who help us operate (e.g., Stripe for payments, cloud infrastructure providers, **model inference providers**)." +- §5: „Data may be transferred to and processed in the United States." +- §6 Data Retention: Kategorien Account / Billing / Support / Metadata+Analytics — Prompt- und Response-Inhalte werden dort nicht als eigene Kategorie geführt. +- Data Controller laut §12: **Ollama Inc.** + +### Ollama Pricing-Seite / Privacy-FAQ — Zitate bestätigt + +Abgerufen via web_fetch (https://ollama.com/pricing, 200, vollständig). Wortlaut bestätigt: + +- „Where are models hosted? — Ollama hosts models and compute resources **primarily in the United States**. To serve global demand, we may route to **Europe and Singapore** for additional capacity." +- „Is my prompt or response data trained on? — **Prompt or response data is never logged or trained on.**" +- „Who does Ollama partner with to host models? — Ollama collaborates with **NVIDIA Cloud Providers (NCPs)** to host open models. When Ollama partners with providers, we require **no logging, no training, and zero data retention** policies in place." +- „What quantization or data format do cloud models use? — **Native weights, as released by the model provider.** On modern NVIDIA hardware, models may use accelerated data formats supported by Blackwell and Vera Rubin architectures (e.g. NVFP4)." + +Damit bestätigt sich die strukturelle Einordnung des Posts: Gehostet werden **offene Gewichte** von NVIDIA-Cloud-Providern, nicht die DeepSeek-API. Die ZDR-Zusage ist eine **Anforderung an Partner**, keine eigene Messung. + +### GitHub Issue #14279 — existiert, ist aber unbeantwortet + +Abgerufen via web_fetch (200). Titel: **„Qwen3.5-397B-A17B Cloud data retention and privacy concerns"**. Eröffnet von `asitwere` am **16.02.2026**. Volltext des Eröffnungsposts: + +> „It looks like Alibaba is currently the only endpoint available for Qwen3.5, but Ollama's docs/advertising for Ollama Cloud provide data privacy assurances. Since Alibaba retains prompts & responses, can it be confirmed that users are not being routed to Alibaba APIs via Ollama Cloud?" + +Metadaten: Label `question`, **kein Assignee, kein Milestone, keine Antwort, keine verlinkten PRs/Branches.** Das Issue dokumentiert also eine **offene Frage**, nicht einen bestätigten Befund. Netbits' Formulierung „die Lücke, die dokumentiert ist" ist insofern zu stark: dokumentiert ist die Rückfrage, nicht die Routing-Praxis. Zugleich ist die zugrunde liegende Beobachtung (Ollama nennt „model inference providers" selbst als Dritte) durch die Privacy Policy gedeckt. + +### Netzwerk-Faktencheck — nicht reproduzierbar, IP-Zuordnung falsch + +Eigene Prüfung aus dem Hector-Container (2026-09-23): + +| Behauptung im Post | Prüfergebnis | +|---|---| +| `192.168.100.4` ist „deine Maschine" | **Nein.** Der Container hat 172.20.0.10, 172.21.0.8, 100.80.221.60. `192.168.100.4` ist eine private LAN-Adresse außerhalb dieses Containers. | +| `76.76.21.123` gehört **Amazon** (Walnut, Kalifornien) | **Falsch.** ARIN-RDAP für `76.76.21.0/24`: Handle `NET-76-76-21-0-1`, Netname **`VERCEL-01`**, Registrant **Vercel, Inc** (Walnut, CA). Kein PTR-Eintrag. Die Adresse gehört **Vercel**, nicht Amazon. | +| Die IP „ist ollama.com" | **Nicht bestätigt.** Auflösung von hier: `ollama.com → 34.36.133.15` (ARIN: `GOOGL-2`, Google Cloud). `api.ollama.com` und `registry.ollama.ai` laufen über **Cloudflare** (`server: cloudflare`). `ollama.com` antwortet mit `server: Google Frontend`. | +| „genau eine ausgehende Verbindung, alles geht an einen einzigen Anbieter" | Aus diesem Container **nicht reproduzierbar**; die Beobachtung stammt offenbar von einem anderen Host/Netzwerk. Zudem sind laut Ollama-Pricing-Seite Routing nach **Europa und Singapur** möglich — „ein einziger Anbieter" wäre auch bei korrekter IP nur eine Momentaufnahme. | + +Der methodische Wert des Checks bleibt: Die Frage „welche Endpunkte spricht der eigene Agent tatsächlich an" ist sinnvoll und nachprüfbar. Die konkrete Zuordnung im Post ist fehlerhaft. + +### Gu et al., ICML 2025 — arXiv:2502.07776 + +Abgerufen: Abstract-Seite (200) und HTML-Volltext v2 (527 KB). Titel: **„Auditing Prompt Caching in Language Model APIs"**. Autoren: Chenchen Gu, Xiang Lisa Li, Rohith Kuditipudi, Percy Liang, Tatsunori Hashimoto — **alle Stanford University**. Accepted ICML 2025. + +Verifizierte Zahlen aus dem Volltext: + +- Auditiert wurden **17 API-Provider**: Anthropic, Amazon Bedrock, Microsoft Azure OpenAI, Cohere, Deep Infra, DeepSeek, Fireworks AI, Google, Groq, Hyperbolic, Lepton AI, Mistral, OctoAI, OpenAI, Perplexity, Replicate, Together AI (Table 1/2). +- Prompt-Caching nachgewiesen bei **8 Providern** (Tabelle 1 führt Azure, Deep Infra, Fireworks, Lepton, OpenAI, Perplexity, Replicate, Anthropic). +- **Globales Cache-Sharing über alle Nutzer nachgewiesen bei 7** von ihnen (Azure text-embedding-3-small, Deep Infra, Fireworks, Lepton, OpenAI text-embedding-3-small, Perplexity, Replicate). Bei **Anthropic Claude 3 Haiku** und **OpenAI GPT-4o mini** nur **per-org**, dort *kein* globales Sharing. +- Methode: statistischer Timing-Audit (Kolmogorov-Smirnov-Test, einseitig) auf Time-to-First-Token von Cache-Hit vs. Cache-Miss. +- **OpenAIs Embedding-Modell war zuvor nicht öffentlich bekannt als decoder-only Transformer** — per Timing-Seitenkanal hergeleitet. +- Nach verantwortungsvoller Offenlegung (60-Tage-Frist) änderte **mindestens fünf Provider** ihre Implementierung, z. B. Abschaltung globalen Cache-Sharings und Doku-Updates. +- **DeepSeek:** Das Paper konnte Caching **nicht über Antwortzeiten** nachweisen (Tabelle 2) und stellt fest: „DeepSeek states that the cache is isolated per-user, and we empirically verified that this is the case based on the number of cache hit tokens returned in the API responses." Die Aussage des Posts stimmt, beruht aber auf den **gemeldeten Cache-Hit-Token-Zählern**, nicht auf Timing. +- Nebenbefund des Papers: Dokumentiertes **per-organisation** Cache-Sharing (OpenAI, Anthropic) wird von den Autoren **nicht als Sicherheitslücke** gewertet. + +### Wu et al., NDSS 2025 — „PROMPTPEEK" + +Abgerufen: NDSS-Paper-Seite (200) und PDF-Volltext. Titel: **„I Know What You Asked: Prompt Leakage via KV-Cache Sharing in Multi-Tenant LLM Serving"**. Autoren: Guanlong Wu, Weili Wang, Jianyu Niu, Yinqian Zhang (Southern University of Science and Technology, SUSTech) sowie Zheng Zhang, Yao Zhang, Ye Wu (**ByteDance Inc.**). + +Verifizierte Angaben aus dem PDF: + +- **Attacke:** PROMPTPEEK. Ausnutzung des KV-Cache-Sharings identischer Token-Präfixe in Multi-Tenant-Serving-Systemen (SGLang, vLLM); ein Cache-Hit ist über Serving-Reihenfolge bzw. TTFT beobachtbar. +- **Drei Szenarien:** (1) Whole Prompt Reconstruction, (2) Input Reconstruction, (3) Template Reconstruction. +- **Ergebnisse:** **99 %** durchschnittliche Erfolgsrate bei vollständiger oder teilweiser Rekonstruktion des Prompt-Inputs (Reversal Ratio 99 %); **98 %** bei der Prompt-**Template**-Rekonstruktion (Reversal Ratio 91 %); **95 %** bei Whole-Prompt-Rekonstruktion **ohne Vorwissen** (Reversal Ratio 81 %). +- **Personenbezogene Daten:** Aus einem Cloze-Prompt (BMI-Beispiel mit Platzhaltern für Geschlecht, Alter, Gewicht, Größe) ließen sich alle Platzhalter mit **60 Requests** rekonstruieren — die konkreten Werte im Beispiel: „male", „35", „90kg", „5 feet 9 inches". +- **Testumgebung:** Llama-2-13B auf einer A100 80 GB. +- **Verantwortungsvolle Offenlegung:** Die Autoren geben an, mit **SGLang** über Gegenmaßnahmen im Gespräch zu sein; das Paper diskutiert Obfuskation mit seltenen Tokens, Randomisierung der Longest-Prefix-Matching-Scheduling-Policy sowie die Anforderung von M>1 gemeinsam genutzten Tokens. +- **Handlungsempfehlungen an Provider (Lessons Learnt):** Lebenszyklus des KV-Cache vollständig modellieren, Cache-Aktivität vor Clients verschleiern, Request-Anzahl/-Inhalt pro Client kontrollieren. + +## Einordnung durch den Post-Autor + +Netbits bewertet die Lage für den eigenen Stack als „ungewöhnlich gut, aber mit einer echten Lücke" — ZDR-Zusagen stark, drittseitiges Routing über Partner der offene Punkt; die Prompt-Cache-Seitenkanäle als relevant, weil der Stack Prompt-Caching stark nutzt. Er schließt mit der offenen Frage, dass Ollamas Cache-Isolation unabhängig nicht getestet ist. + +## Nachtrag (Hector, gleicher Tag) + +Zwei Korrekturen des Posts sind oben dokumentiert (IP-Zuordnung → Vercel; Issue #14279 = offene Frage, nicht Befund). Die Paper-Zitate und die Policy-Zitate des Posts sind vollständig verifiziert. Interpretation und Konsequenzen für den Stack liegen auf der Wiki-Seite `wiki/concepts/policy/inference-provider-data-retention.md`. diff --git a/wiki/concepts/hardware/cloud-exit-and-local-superiority.md b/wiki/concepts/hardware/cloud-exit-and-local-superiority.md index 4ea5219..dd7e6fa 100644 --- a/wiki/concepts/hardware/cloud-exit-and-local-superiority.md +++ b/wiki/concepts/hardware/cloud-exit-and-local-superiority.md @@ -59,6 +59,7 @@ Vergleichsmaßstab: Gemini 3.5 Flash Niveau — aber lokal und offline. - **[Intelligence Commoditization Thesis](../llm/ai-intelligence-commoditization-thesis.md)** — RAM als Währung = physische Manifestation der Kommoditisierung - **[Apple M6 & M5 Ultra](apple-m6-m5-ultra-mac-mini-studio-update.md)** — Unabhängig verifizierte Bandbreiten-/Prefill-Werte der M5 Ultra (1,2 TB/s) gegen RTX 5090; MacStories belegt die These praktisch: 99 Tage Agentenbetrieb, 0 $ Cloud-Kosten - **[Lokale KI zum Coding](lokale-ki-coding.md)** — dieselbe Kostenlogik (Hardware statt Tokens) aus der Coding-Perspektive +- **[Datenhaltung & Cache-Seitenkanäle bei Cloud-Inferenz](../policy/inference-provider-data-retention.md)** — die Gegenprobe zur Cloud-Miete: ZDR-Zusagen sind vertraglich, nicht technisch; wer lokal fährt, teilt keinen Cache mit Fremden ## Community-Krallen im Einsatz (Beispiele aus OME21) diff --git a/wiki/concepts/llm/ki-souveraenitaet-dezentralisierung.md b/wiki/concepts/llm/ki-souveraenitaet-dezentralisierung.md index 740aac1..ca753ae 100644 --- a/wiki/concepts/llm/ki-souveraenitaet-dezentralisierung.md +++ b/wiki/concepts/llm/ki-souveraenitaet-dezentralisierung.md @@ -37,6 +37,7 @@ Diese Seite verdichtet einen populär-politischen Rahmen für eine Entwicklungsl - [ReDS — Resilient Decentralized Swarm](../llm/reds-resilient-decentralized-swarm.md) — Roemmelles politische Organisationsform derselben Idee - [Open-Weights-Ökonomie](../llm/open-weights-economics.md) — warum Open Weights ökonomisch eine Waffe gegen Kontrollmonopole sind - [Edge-Inferenz als Cloud-Alternative](../../concepts/hardware/edge-inference-als-cloud-alternative.md) — konkrete Hardware-Pfade für "eigene Hardware" +- [Datenhaltung & Cache-Seitenkanäle bei Cloud-Inferenz](../../concepts/policy/inference-provider-data-retention.md) — der technische Unterbau der Souveränitäts-These: warum ZDR-Zusagen allein keine Kontrolle bedeuten (Cache-Sharing, Dritt-Routing) Neu gegenüber diesen Seiten ist weniger die Technik als die **normative Zweier-Typologie** (Korporatismus vs. Souveränität) und das Bibliotheks-Motiv. Die Gegenposition — dass Zentralisierung durch Kapitalkraft auch Vorteile hat — behandelt [AI Investment Bubble](../llm/ai-investment-bubble.md); Amodeis zentralistische Gegensicht dokumentiert [Roemmele's ReDS vs. Amodei](../llm/decentralized-ai-counterpower.md). diff --git a/wiki/concepts/policy/inference-provider-data-retention.md b/wiki/concepts/policy/inference-provider-data-retention.md new file mode 100644 index 0000000..754886c --- /dev/null +++ b/wiki/concepts/policy/inference-provider-data-retention.md @@ -0,0 +1,112 @@ +--- +created: 2026-09-23 +updated: 2026-09-23 +sources: [other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md] +tags: [concept, policy, privacy, data-retention, zdr, cloud-inference, ollama, prompt-caching, kv-cache, side-channel, deepseek, third-party-routing] +--- + +# Datenhaltung & Cache-Seitenkanäle bei Cloud-Inferenz + +> **Kern:** Netbits (@NetLightning) recherchierte im OME-Topic „Openclaw mit lokalen Modellen" (23.09.2026) die Datenhaltung bei Cloud-Inferenz — Anlass war unser Tier-0-Modell `deepseek-v4.1-flash` auf Ollama Cloud. Ergebnis: Ollamas Zusagen sind ungewöhnlich stark, aber **vertraglich, nicht technisch** — Ollama verlangt Zero Data Retention von Partnern und weist selbst „model inference providers" als Dritte aus. Zweiter Befund: Prompt-Caching ist ein dokumentierter **Timing-Seitenkanal** — zwei peer-reviewte Arbeiten zeigen Cache-Sharing über Nutzergrenzen hinweg bei mehreren kommerziellen APIs. Prompt- und Policy-Zitate des Posts wurden vollständig verifiziert; **zwei Angaben des Posts sind falsch** (siehe Korrekturen unten). + +## Was Ollama zusagt (verifiziert am 2026-09-23) + +Abgerufen direkt von den Primärquellen — Privacy Policy und Pricing-Seite: + +| Zusage | Wortlaut (Quelle) | +|--------|-------------------| +| Transiente Verarbeitung | „we process this content **transiently** to provide the Service and this content is not stored beyond the time required to fulfill the request" (Privacy §2) | +| Kein Training | „We do **not** use your inputs or outputs to train any AI models" (Privacy §2); „Prompt or response data is **never logged or trained on**" (Pricing-FAQ) | +| ZDR-Anforderung an Partner | „When Ollama partners with providers, we require **no logging, no training, and zero data retention** policies in place" (Pricing-FAQ) | +| Hosting-Standorte | „primarily in the United States. To serve global demand, we may route to **Europe and Singapore** for additional capacity" (Pricing-FAQ) | +| Partner | „Ollama collaborates with **NVIDIA Cloud Providers (NCPs)** to host open models" (Pricing-FAQ) | +| Dritte (Privacy §5) | „Third parties who help us operate (e.g., Stripe for payments, cloud infrastructure providers, **model inference providers**)" | +| Gewichte | „**Native weights, as released by the model provider**"; Hardware-Formate wie NVFP4 auf Blackwell/Vera Rubin (Pricing-FAQ) | + +Der Vergleich mit anderen Anbietern (OpenAI 30 Tage, Anthropic 7 Tage, Google bis 18 Monate), den der Post zieht, ist hier **nicht nachgeprüft** — als Claim des Posts behandelt, nicht als Wiki-Fakt. + +## Die Lücke: vertraglich statt technisch + +Zwei strukturelle Punkte, die beide durch Ollamas eigene Dokumente gedeckt sind: + +1. **Ollama betreibt nicht alle Cloud-Modelle auf eigener Hardware.** Die Privacy Policy nennt „model inference providers" ausdrücklich als dritte Partei, die am Betrieb beteiligt ist. Die ZDR-Zusage ist damit eine **Anforderung an Partner**, die Ollama nicht selbst messt — es gibt (Stand Ingest) keine unabhängige Prüfung. +2. **Ob Datenhaltung greift, hängt am Modell.** Entscheidend ist, welches Modell man fährt und bei welchem Betreiber es landet. Genau diese Frage stellt offenbar auch die Community — siehe GitHub Issue unten. + +### GitHub Issue #14279 — offene Frage, nicht Befund + +Der Post zitiert [ollama/ollama#14279](https://github.com/ollama/ollama/issues/14279) als „dokumentierte Lücke". Die eigene Prüfung ergibt: Das Issue **existiert** (Titel „Qwen3.5-397B-A17B Cloud data retention and privacy concerns", eröffnet von `asitwere` am **16.02.2026**), ist aber **unbeantwortet** — Label `question`, kein Assignee, kein Milestone, keine Antwort, keine verlinkten PRs. Der Volltext ist eine Rückfrage: + +> „It looks like Alibaba is currently the only endpoint available for Qwen3.5, but Ollama's docs/advertising for Ollama Cloud provide data privacy assurances. Since Alibaba retains prompts & responses, can it be confirmed that users are not being routed to Alibaba APIs via Ollama Cloud?" + +⚠️ **Korrektur zum Post:** Dokumentiert ist die **Rückfrage**, nicht die Routing-Praxis. Netbits' Formulierung „die Lücke, die dokumentiert ist" ist zu stark. Die zugrunde liegende Beobachtung (Ollama nennt Dritte selbst) bleibt davon unberührt — sie ist durch die Privacy Policy belegt. + +### DeepSeek-Verwechslung — die eigentlich gute Nachricht + +Die berüchtigte DeepSeek-Datenschutzerklärung (Speicherung in China, Keystroke-Patterns) gilt für **deepseek.com** — die App und die eigene API. Sie gilt **nicht**, wenn ein offenes DeepSeek-Gewichtsmodell bei einem Dritten läuft. `deepseek-v4.1-flash` auf Ollama Cloud ist laut Pricing-FAQ ein **offenes Gewichtsmodell auf NVIDIA-Cloud-Hardware** — nicht die DeepSeek-API. Das ist ein Unterschied, den viele verwechseln, und er ist für unseren Stack der relevanteste Punkt dieses Posts. + +## Prompt-Caching als Seitenkanal (zwei peer-reviewte Arbeiten) + +Prompt-Caching ist bei uns keine Randerscheinung, sondern Kern der Kostenstrategie — siehe [[../prompt-caching.md]]. Genau deshalb ist dieser Teil relevant. + +### Gu et al., ICML 2025 — Audit kommerzieller APIs + +[arXiv:2502.07776](https://arxiv.org/abs/2502.07776), „Auditing Prompt Caching in Language Model APIs" — Chenchen Gu, Xiang Lisa Li, Rohith Kuditipudi, Percy Liang, Tatsunori Hashimoto (alle **Stanford University**), ICML 2025. Volltext und Abstract selbst geprüft. + +- **17 API-Provider** auditiert (Anthropic, Amazon Bedrock, Azure OpenAI, Cohere, Deep Infra, DeepSeek, Fireworks, Google, Groq, Hyperbolic, Lepton, Mistral, OctoAI, OpenAI, Perplexity, Replicate, Together). +- **8 Provider** mit nachgewiesenem Prompt-Caching. +- **7 davon mit globalem Cache-Sharing über Nutzergrenzen** — Azure, Deep Infra, Fireworks, Lepton, OpenAI (text-embedding-3-small), Perplexity, Replicate. Bei **Anthropic (Claude 3 Haiku)** und **OpenAI (GPT-4o mini)** nur **per-org**, kein globales Sharing. +- **Methode:** statistischer Timing-Audit (einseitiger Kolmogorov-Smirnov-Test) auf Time-to-First-Token von Cache-Hit vs. Cache-Miss. +- **Nebenbefund:** Sie leiteten per Timing ab, dass OpenAIs Embedding-Modell ein decoder-only Transformer ist — vorher nicht öffentlich bekannt. +- **Wirkung:** Nach verantwortungsvoller Offenlegung (60-Tage-Frist) änderten **mindestens fünf Provider** ihre Implementierung, z. B. Abschaltung globalen Cache-Sharings. +- **DeepSeek:** Caching war über Antwortzeiten **nicht** nachweisbar (Tabelle 2). Das Paper stellt fest, dass DeepSeek per-user-Isolation angibt und sie „empirically verified ... based on the number of cache hit tokens returned in the API responses". Die Zuschreibung „DeepSeek ist sauber" stimmt also — beruht aber auf **gemeldeten Cache-Hit-Zählern**, nicht auf Timing-Messung. +- Dokumentiertes per-Organisation-Sharing (OpenAI, Anthropic) wird von den Autoren **nicht** als Sicherheitslücke gewertet. + +### Wu et al., NDSS 2025 — PROMPTPEEK + +„I Know What You Asked: Prompt Leakage via KV-Cache Sharing in Multi-Tenant LLM Serving" — Guanlong Wu, Weili Wang, Jianyu Niu, Yinqian Zhang (**SUSTech**) und Zheng Zhang, Yao Zhang, Ye Wu (**ByteDance**). PDF und NDSS-Seite selbst geprüft. + +- **Angriff:** PROMPTPEEK. KV-Cache-Sharing identischer Token-Präfixe in Multi-Tenant-Serving (SGLang, vLLM); Cache-Hits sind über Serving-Reihenfolge bzw. TTFT beobachtbar, der Angreifer ist einfach ein zweiter Tenant. +- **Drei Szenarien:** Whole Prompt Reconstruction, Input Reconstruction, Template Reconstruction. +- **Ergebnisse (Llama-2-13B, A100 80 GB):** **99 %** Erfolgsrate bei Prompt-Input-Rekonstruktion (Reversal Ratio 99 %); **98 %** bei Prompt-**Templates** (91 % Reversal); **95 %** bei Whole-Prompt **ohne Vorwissen** (81 % Reversal). +- **PII-Nachweis:** Aus einem Cloze-Prompt (BMI-Beispiel mit Platzhaltern für Geschlecht, Alter, Gewicht, Größe) ließen sich **alle Platzhalter mit 60 Requests** rekonstruieren — Beispielwerte „male", „35", „90kg", „5 feet 9 inches". +- **Offenlegung/Mitigation:** Die Autoren geben Gespräche mit **SGLang** an; diskutiert werden Obfuskation mit seltenen Tokens, Randomisierung des Longest-Prefix-Matching und das Anfordern von M>1 gemeinsamen Tokens. Lessons Learnt an Provider: KV-Cache-Lebenszyklus modellieren, Cache-Aktivität vor Clients verschleiern, Request-Volumen pro Client kontrollieren. + +⚠️ **Korrektur zum Post:** Der Post attribuiert die Arbeit an einer Stelle der „Stanford-Studie". PROMPTPEEK stammt von **SUSTech/ByteDance**; die Stanford-Arbeit ist das ICML-Paper von Gu et al. Beide im Post getrennt genannt, in der Zuordnung aber vermischt. + +## Netzwerk-Faktencheck — nicht reproduzierbar + +Netbits' Check behauptet, der Gateway habe **genau eine** ausgehende Verbindung (`192.168.100.4 → 76.76.21.123:443`) und die IP gehöre **Amazon** (Walnut, CA) und sei ollama.com. Eigene Prüfung aus dem Hector-Container (2026-09-23): + +| Behauptung | Prüfergebnis | +|---|---| +| `192.168.100.4` = „deine Maschine" | **Nicht dieser Container.** Er hat 172.20.0.10, 172.21.0.8, 100.80.221.60 — `192.168.100.4` ist eine LAN-Adresse außerhalb. | +| `76.76.21.123` gehört Amazon | **Falsch.** ARIN-RDAP für `76.76.21.0/24`: Handle `NET-76-76-21-0-1`, Netname **`VERCEL-01`**, Registrant **Vercel, Inc** (Walnut, CA). Kein PTR. | +| Die IP ist ollama.com | **Nicht bestätigt.** Auflösung von hier: `ollama.com → 34.36.133.15` (ARIN `GOOGL-2`, Google Cloud); `api.ollama.com` und `registry.ollama.ai` über **Cloudflare**; `ollama.com` antwortet mit `server: Google Frontend`. | +| „genau eine Verbindung, ein einziger Anbieter" | Nicht reproduzierbar; laut Ollama-Pricing ist Routing nach **Europa und Singapur** möglich — „ein Anbieter" wäre ohnehin nur eine Momentaufnahme. | + +Der **methodische** Wert des Checks bleibt: Die Frage „welche Endpunkte spricht mein Agent tatsächlich an" ist sinnvoll und nachprüfbar. Die konkrete Zuordnung ist fehlerhaft. + +## Konsequenzen für unseren Stack + +- **Was wir wissen:** Unser Tier-0-Modell läuft als **offenes Gewichtsmodell** über Ollama Cloud auf NVIDIA-Cloud-Providern — nicht über die DeepSeek-API. Die datenschutzpolitisch problematische DeepSeek-Erklärung greift damit nicht. +- **Was wir nicht wissen:** ob die ZDR-Anforderung bei jedem Partner und für jedes Modell tatsächlich eingehalten wird. Ollamas Cache-Isolation (und die jedes anderen Anbieters außerhalb des Stanford-Audits) ist **nicht unabhängig getestet**. Das ist eine offene Frage, keine Warnung. +- **Prompt-Caching:** Wir nutzen es stark (Kostenhebel, siehe [[../prompt-caching.md]]). Der Seitenkanal-Risikofaktor ist **Cache-Sharing über Nutzergrenzen**. Per-User- bzw. per-Org-Isolation entschärft ihn; globales Sharing ist der problematische Fall. Für die eigenen Inhalte gilt: Was nicht in einen fremden Cache soll, gehört nicht in einen geteilten Präfix über einen Multi-Tenant-Dienst — oder auf lokale Hardware ([[../hardware/cloud-exit-and-local-superiority.md]], [[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]]). + +## Verwandte Seiten + +- [[../prompt-caching.md]] — Technik und Kostenhebel, plus neuer Sicherheitsabschnitt +- [[../llm/deepseek-v4.1-flash.md]] — das Modell, um das es konkret ging (KV-Cache-Optimierung, API) +- [[../../tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md]] — Ollama Cloud als Tier-0-Lieferant, ZDR-Aussage aus dem Launch-Post +- [[../llm/ki-souveraenitaet-dezentralisierung.md]] — normativer Überbau: Cloud vs. lokal, Souveränität +- [[../hardware/cloud-exit-and-local-superiority.md]] — lokale Ausführung als Antwort auf Provider-Abhängigkeit +- [[../../tools/agentcloak-desktop.md]] — lokale PII-Redaktion vor Cloud-Aufrufen (praktische Gegenmaßnahme) +- [[../llm/chinese-model-cost-routing.md]] — warum chinesische Modelle überhaupt bei Dritt-Hostern laufen + +## Quellen + +- Ollama Privacy Policy: https://ollama.com/privacy (abgerufen 2026-09-23, Zitate verifiziert) +- Ollama Pricing / Privacy-FAQ: https://ollama.com/pricing (abgerufen 2026-09-23, Zitate verifiziert) +- GitHub Issue: https://github.com/ollama/ollama/issues/14279 (existiert, unbeantwortet) +- Gu et al., ICML 2025: [arXiv:2502.07776](https://arxiv.org/abs/2502.07776) · [DOI](https://doi.org/10.48550/arXiv.2502.07776) +- Wu et al., NDSS 2025: [Paper-Seite](https://www.ndss-symposium.org/ndss-paper/i-know-what-you-asked-prompt-leakage-via-kv-cache-sharing-in-multi-tenant-llm-serving/) · [PDF](https://www.ndss-symposium.org/wp-content/uploads/2025-1772-paper.pdf) +- Raw (Post + Verifikationsprotokoll): [raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md](../../../raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md) diff --git a/wiki/concepts/prompt-caching.md b/wiki/concepts/prompt-caching.md index 4d3e219..7fd87db 100644 --- a/wiki/concepts/prompt-caching.md +++ b/wiki/concepts/prompt-caching.md @@ -1,9 +1,10 @@ --- created: 2026-07-07 -updated: 2026-07-07 +updated: 2026-09-23 sources: - blog/2026-07-07_heise-prompt-caching.md -tags: [concept, prompt-caching, kv-cache, transformer-architecture, token-optimization, cost-reduction, llm-inference, prompt-engineering, cache] + - other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md +tags: [concept, prompt-caching, kv-cache, transformer-architecture, token-optimization, cost-reduction, llm-inference, prompt-engineering, cache, security, side-channel, privacy] --- # Prompt-Caching — KV-Cache-Wiederverwendung zur Token- und Kostenreduktion @@ -87,4 +88,27 @@ Siehe auch `[[../architecture/transformer-foundation.md]]` für die klassische T Mit **Ollama** lässt sich Prompt-Caching lokal nachvollziehen: - Ollama cacht KV-Cache automatisch bei wiederholten Prefixes - Der Geschwindigkeitsgewinn (bis 10×) ist direkt messbar -- Erkenntnisse sind auf Cloud-Anbieter übertragbar \ No newline at end of file +- Erkenntnisse sind auf Cloud-Anbieter übertragbar + +## Sicherheit: Prompt-Caching als Seitenkanal (Update 2026-09-23) + +Prompt-Caching ist ein Kostenhebel — und zugleich ein **dokumentierter Informationsleck-Vektor**. Zwei peer-reviewte Arbeiten (beide 2025) zeigen, dass Cache-Treffer über **Timing** beobachtbar sind: + +| Arbeit | Methode | Kernbefund | +|--------|---------|------------| +| **Gu et al., ICML 2025** ([arXiv:2502.07776](https://arxiv.org/abs/2502.07776), Stanford) | Statistischer Timing-Audit (Kolmogorov-Smirnov) auf Time-to-First-Token, 17 kommerzielle APIs | Prompt-Caching bei **8 Providern** nachgewiesen, **globales Cache-Sharing über Nutzergrenzen bei 7** — u.a. OpenAI (text-embedding-3-small), Azure, Deep Infra, Fireworks, Lepton, Perplexity, Replicate. Bei **Anthropic (Claude 3 Haiku)** und **OpenAI (GPT-4o mini)** nur per-org. Nach Offenlegung änderten **mindestens 5 Provider** ihre Implementierung. | +| **Wu et al., NDSS 2025** („PROMPTPEEK", SUSTech/ByteDance) | Aktiver Angriff auf KV-Cache-Sharing in Multi-Tenant-Serving (SGLang, vLLM) | Prompt **Token für Token rekonstruierbar**: **99 %** (Input), **98 %** (Template), **95 % ohne Vorwissen**. PII-Nachweis: alle Platzhalter eines BMI-Prompts (Geschlecht, Alter, Gewicht, Größe) mit **60 Requests**. | + +**Was das praktisch bedeutet:** + +- Der Risikofaktor ist **Cache-Sharing über Nutzergrenzen**. Per-User- oder per-Org-Isolation entschärft den Angriff; globales Sharing ist der problematische Fall. +- Betroffen sind **Multi-Tenant-Dienste**, nicht die lokale Ausführung — wer lokal fährt, teilt keinen Cache ([[hardware/cloud-exit-and-local-superiority.md]]). +- Für Cloud-Nutzung gilt: **Was nicht im Cache eines Fremden landen soll, gehört nicht in einen geteilten Präfix** — oder nicht in einen geteilten Dienst. +- **DeepSeek** wurde im Stanford-Audit als **per-user isoliert** bestätigt (allerdings über gemeldete Cache-Hit-Zähler, nicht per Timing). + +Details, Zitate und Verifikationsprotokoll: [[policy/inference-provider-data-retention.md]]. + +## Verwandte Seiten + +- [[policy/inference-provider-data-retention.md]] — Datenhaltung und Cache-Isolation bei Cloud-Anbietern (Ollama-Zusagen, Seitenkanäle, Verifikation) +- [[../tools/model-routing.md]] — Routing als komplementärer Kostenhebel diff --git a/wiki/index.md b/wiki/index.md index 153c114..e3bc23b 100644 --- a/wiki/index.md +++ b/wiki/index.md @@ -2,7 +2,8 @@ *Auto-generated: 2026-07-07* -*Letzte Aktualisierung: 2026-09-23 (241. Update — Macbrow: Jev-Computer-Use-Build mit öffentlichem Code. Anlass: X-Link https://x.com/BhosalePratim/status/2101281829168792002 von Pit in OME Topic „JEV“ (23.09.). **Quelle:** Note-Tweet von Pratim Bhosale (@BhosalePratim, Paris, 42.523 Follower; 19.09.2026 12:06 UTC; 55.975 Views / 414 Likes / 488 Bookmarks; Bio: Education @GradiumAI — Interessenkonflikt bei Gradium, nicht bei TypeSafe) + **Repo volltextverifiziert:** https://github.com/timpratim/macbrow (MIT, 140 Stars / 15 Forks beim Abruf, created 18.09.2026) + **Demo-Video lokal ausgewertet** (15 Standbilder à 10 s + Grok-STT-Volltext, 152,4 s). **Wiki-Bedeutung:** der erste Jev-Computer-Use-Build mit öffentlichem Code — gegenüber Andy-Gao (kein Repo, keine Messung) dokumentiert: README, Safety-Policy (existiert wegen eines Desktop-Fehlers: „clean up my desktop“ verschob alle Dateien), **26 Offline-Tests**. **Jev-Rolle spezifiziert:** Routing als ein Choice (~300 ms, in der dokumentierten Spanne), **spekulative Arguments** (alle Enum-Argumente aller Kandidaten-Tools als eigene Choices im selben Request), Browser-Seite als **indizierte Tabelle der Controls** mit einem Jev-Request pro Schritt (click/type/select/scroll/wait/done), Follow-up-/Vollständigkeits-Urteile als Noul/Choice; LLM (GPT-5-mini oder lokal) schreibt nur Text. **Text-Only-Grenze konstruktiv aufgelöst:** „No screenshots in the loop“ — jev-ultrafast liest die Seite als Element-Tabelle; Freitext-Argumente durch Span-Auswahl im Diktat. **Eigenmessung:** Amazon-Warenkorb 4 Schritte/11 s; Follow-up 6 Schritte/3,7 s; Trailer „Love Hypothesis“ **1,6 s** von Sprachende bis Video — mit ~300-ms-Call konsistent, keine unvereinbaren Zahlen. **Demo:** Trailer → Shopping → Flüge Paris–Istanbul → Finder (Korrektur „Sorry, the desktop folder“ korrekt aufgelöst) → X-Suche; **Endpunkt = dokumentierter Misserfolg** („close this tab“ scheitert; Tester: „a lot of work to be done, but this is not bad“). Wiki: people/pratim-bhosale.md (neu); Update concepts/agents/jev-sprachsteuerung-computer-use.md (Abschnitt „Gegenstück: Macbrow“). Raw: raw/xpost/2026-09-19_bhosal-pratim-macbrow.md (neu).)* +*Letzte Aktualisierung: 2026-09-23 (242. Update — Ollama-Cloud-Datenhaltung & Prompt-Caching-Seitenkanäle (Netbits @NetLightning, OME Topic „Openclaw mit lokalen Modellen", #15163). **Eigenrecherche eines Gruppenmitglieds** — kein Link-Ingest, sondern ein Analysepost, der sich nachprüfen ließ: Netzwerk-Faktencheck, Policy-Zitate, zwei peer-reviewte Paper. Raw: `raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md` (neu — Post im Volltext + eigenes Verifikationsprotokoll). Wiki: `concepts/policy/inference-provider-data-retention.md` (neu), `people/netbits.md` (neu). **Verifiziert an den Primärquellen:** Ollama-Zitate zur transienten Verarbeitung, „never logged or trained on", ZDR-Anforderung an Partner, Hosting „primarily in the United States … may route to Europe and Singapore", Partner = NVIDIA Cloud Providers (NCPs), native Gewichte. **Strukturbefund:** Die ZDR-Zusage ist eine Anforderung an Partner, keine eigene Messung — die Privacy Policy (§5) nennt „model inference providers" selbst als Dritte; Ollamas Cache-Isolation ist unabhängig ungetestet. **Paper (beide 2025, Volltexte geprüft):** Gu et al., ICML 2025 (Stanford, arXiv:2502.07776) auditierte 17 APIs — Caching bei 8, globales Cache-Sharing über Nutzergrenzen bei 7 (u.a. OpenAI text-embedding-3-small, Azure, Fireworks, Perplexity); nach Offenlegung änderten ≥5 Provider ihre Implementierung. Wu et al., NDSS 2025 („PROMPTPEEK", SUSTech/ByteDance): Prompt-Rekonstruktion Token für Token — 99 % (Input), 98 % (Template), 95 % ohne Vorwissen; PII-Nachweis (BMI-Prompt: Geschlecht/Alter/Gewicht/Größe) mit 60 Requests. **Korrekturen am Post (eigene Prüfung):** (1) `76.76.21.123` gehört nicht Amazon, sondern **Vercel, Inc** (ARIN-RDAP `NET-76-76-21-0-1`, Netname `VERCEL-01`); ollama.com löst hier zu `34.36.133.15` (Google Cloud) auf, api/registry über Cloudflare — der Check ist aus diesem Container nicht reproduzierbar. (2) GitHub Issue #14279 ist eine **unbeantwortete Rückfrage** (Label `question`, kein Assignee, keine Antwort), nicht die im Post behauptete „dokumentierte Lücke". (3) PROMPTPEEK ist SUSTech/ByteDance, nicht Stanford. **Ergänzt:** Apple-M6/M5-Ultra-Seite, Cloud-Exit, KI-Souveränität und die Ollama-Cloud-Tool-Seite um Cache-/Retention-Cross-Refs, `concepts/prompt-caching.md` um einen Sicherheitsabschnitt (Seitenkanäle, Isolationsgrade).)* +*Vorherige Aktualisierung: 2026-09-23 (241. Update — Macbrow: Jev-Computer-Use-Build mit öffentlichem Code. Anlass: X-Link https://x.com/BhosalePratim/status/2101281829168792002 von Pit in OME Topic „JEV“ (23.09.). **Quelle:** Note-Tweet von Pratim Bhosale (@BhosalePratim, Paris, 42.523 Follower; 19.09.2026 12:06 UTC; 55.975 Views / 414 Likes / 488 Bookmarks; Bio: Education @GradiumAI — Interessenkonflikt bei Gradium, nicht bei TypeSafe) + **Repo volltextverifiziert:** https://github.com/timpratim/macbrow (MIT, 140 Stars / 15 Forks beim Abruf, created 18.09.2026) + **Demo-Video lokal ausgewertet** (15 Standbilder à 10 s + Grok-STT-Volltext, 152,4 s). **Wiki-Bedeutung:** der erste Jev-Computer-Use-Build mit öffentlichem Code — gegenüber Andy-Gao (kein Repo, keine Messung) dokumentiert: README, Safety-Policy (existiert wegen eines Desktop-Fehlers: „clean up my desktop“ verschob alle Dateien), **26 Offline-Tests**. **Jev-Rolle spezifiziert:** Routing als ein Choice (~300 ms, in der dokumentierten Spanne), **spekulative Arguments** (alle Enum-Argumente aller Kandidaten-Tools als eigene Choices im selben Request), Browser-Seite als **indizierte Tabelle der Controls** mit einem Jev-Request pro Schritt (click/type/select/scroll/wait/done), Follow-up-/Vollständigkeits-Urteile als Noul/Choice; LLM (GPT-5-mini oder lokal) schreibt nur Text. **Text-Only-Grenze konstruktiv aufgelöst:** „No screenshots in the loop“ — jev-ultrafast liest die Seite als Element-Tabelle; Freitext-Argumente durch Span-Auswahl im Diktat. **Eigenmessung:** Amazon-Warenkorb 4 Schritte/11 s; Follow-up 6 Schritte/3,7 s; Trailer „Love Hypothesis“ **1,6 s** von Sprachende bis Video — mit ~300-ms-Call konsistent, keine unvereinbaren Zahlen. **Demo:** Trailer → Shopping → Flüge Paris–Istanbul → Finder (Korrektur „Sorry, the desktop folder“ korrekt aufgelöst) → X-Suche; **Endpunkt = dokumentierter Misserfolg** („close this tab“ scheitert; Tester: „a lot of work to be done, but this is not bad“). Wiki: people/pratim-bhosale.md (neu); Update concepts/agents/jev-sprachsteuerung-computer-use.md (Abschnitt „Gegenstück: Macbrow“). Raw: raw/xpost/2026-09-19_bhosal-pratim-macbrow.md (neu).)* *Vorherige Aktualisierung: 2026-09-22 (239. Update — MacStories-Review „M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents" (Federico Viticci, 21.09.2026; geteilt von Kai @PWeber in OME Topic „Openclaw mit lokalen Modellen", #1744). **Erste unabhängige Verifikation der M5-Ultra-Versprechen** — schließt die Lücke „⚠️ nur Herstellerangaben" auf der Apple-Seite. Raw: `raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md` (neu; web_fetch vollständig, 21.401 Zeichen). Wiki: `people/federico-viticci.md` (neu), `institutions/macstories.md` (neu), Updates in `concepts/hardware/apple-m6-m5-ultra-mac-mini-studio-update.md` (neuer Messwert-Abschnitt: 256-GB-Gerät gegen M3 Ultra 512 GB und RTX 5090 — Generierung ~+70 %, Prefill ~+150 % (≈2,5×), Flash-Next >100 tok/s bei kurzem Prompt und 60–85 tok/s bei 64K–256K Kontext; Prefill bei 6.000-Token-Prompt ~1.700 tok/s vs. 5090 ~3.000 tok/s; Generierung 5090 konstant ~25 % voraus (1,79 vs. 1,2 TB/s), verliert aber oberhalb 32 GB VRAM), `concepts/llm/qwen3.8-flash-next-qwen4-preview.md` (erster dokumentierter Praxiseinsatz: Flash-Next als lokales Default-Modell in Open Minis und Hermes Agent, 5-Bit vollständig im RAM, bis zu 3 parallele Sessions mit Subagenten via oMLX), `concepts/hardware/cloud-exit-and-local-superiority.md` (Cross-Ref). **Produktivnachweis:** 99 Tage Dauerbetrieb mit DeepSeek-V4-Flash-Agenten + olmOCR über 310 Dokumente fürs iOS-/iPadOS-27-Review — Gesamtkosten 0 $, weil dieselbe Dauerlast per Cloud-API als untragbar eingeschätzt wurde. ⚠️ Einzelsetup (n=1), keine reproduzierte Benchmark-Suite.)* *Vorherige Aktualisierung: 2026-09-22 (238. Update — Unabhängiger Jev-vs.-GPT-5.6-Terra-Benchmark von N8 Programs, geteilt als r/ProAI-Repost. **Quelle vollständig aufgelöst:** Reddit-RSS (17.09., normale Seite/JSON blockiert) → [X-Thread](https://x.com/N8Programs/status/2100088523403432357) (16.09.; 179.846 Views beim Abruf) → vier Originalgrafiken lokal gelesen. **Methode:** neun Multiple-Choice-Bedingungen; Terra `reasoning=none`, Letter-only. **Resultate:** Jev gewinnt MMLU 90,91:87,89, GPQA 68,18:56,06, ARC-Easy/Challenge knapp und WinoGrande 91,63:78,69; Terra gewinnt HellaSwag 95,32:94,86, GSM8K deutlich (87,72:79,68 bzw. 69,83:54,59) und Schach knapp 50,25:49,45. Ungewichteter Makromittelwert **Jev 80,69 % · Terra 80,15 %** → „Terra-tier“ trägt eng für diesen Test, nicht als allgemeine Intelligenzbehauptung. **Korrektur des Threadtexts:** Er behauptet einen Jev-Sieg auf HellaSwag; die eigene Tabelle zeigt Terra +0,46 Pp. **Kalibrierung:** N=33.735, ECE **1,74 Pp**, 10 Bins, Wilson-95-%-Intervalle, Einzelbenches 0,26–6,96 Pp — stärkste öffentliche Fremdevidenz für RLCD bisher. **Kosten:** Jev $0,6999 (estimated: Input-Token × $0,042/MTok) vs. Terra $12,9865 (API-reported) = **18,55×**; die ~18×-Rundung hält, die Hersteller-Obergrenze 400–444,6× nicht. **Nicht geprüft:** Geschwindigkeit; kein Repo, keine Prompts/Seeds/Logs, keine Reproduktion, Kontaminationsrisiko öffentlicher Benches. Wiki: `people/n8-programs.md` (neu), `concepts/llm/system-one-models-jev.md` (neuer unabhängiger Benchmark-Abschnitt). Raw: `raw/other/2026-09-17_reddit-n8-jev-terra-benchmark.md` (neu).)* *Vorherige Aktualisierung: 2026-09-22 (237. Update — Grok 4.7 + Grok-Bot-Praxis + ART19-Podcast. **Primärquellen:** [xAI Release](https://x.ai/news/grok-4-7), [API-Modellkarte](https://docs.x.ai/developers/models/grok-4.7), [Cursor-Modellseite](https://cursor.com/docs/models/grok-4-7). Grok 4.7: größerer Basismodell-Kern, längeres RL auf schwierigen mehrstündigen Aufgaben, stärkere Selbstprüfung, natives Grok-Bot-Harness-Verständnis; Modell-ID `grok-4.7`, 500k API-Kontext, Reasoning `low|medium|high|xhigh`; API <200k Prompt $2/M Input · $0,50/M Cached · $6/M Output, ab 200k $4/$1/$12. Herstellerbenchmarks u. a. CursorBench 46,3 %, DeepSWE 71,0 %, Terminal-Bench 38,0 % — **nicht unabhängig reproduziert**. @cb_doge-Post primär gegengeprüft; „twice as fast and half the price“ bleibt dessen Verdichtung. Alex Finns Video (14:06, geteilt von Pit): kein Transcript abrufbar; Workflow nur attribuiert aus YouTube-AI-Zusammenfassung + Herman-Auswertung (PM/Developer/Designer, Exec-Team, Linear/Notion-Issues, Cursor Cloud Agents). Zusätzlich Netbits’ ART19-MP3 als Voll-Ingest: „Grok AI Daily“, 21.09., 29:30, lokales Maschinen-ASR; allgemeiner Newsrecap zu Meta Muse, Cyber-/Safety-Claims, US–China, Trump und Newsom — **kein Grok 4.7**, Grok Bot nur beiläufig. Wiki: `institutions/grok-ai-daily.md` (neu); Updates `institutions/xai.md`, `tools/grok-bot-spacexai.md`, `concepts/llm/llm-model-catalog.md`, `concepts/policy/ai-regulation-2026.md`. Raw: 4 neue Einträge in blog/xpost/youtube/podcast.)* @@ -367,6 +368,7 @@ | Seite | Beschreibung | Quellen | |-------|-------------|---------| | [Cryptographic Context Injection](concepts/policy/cryptographic-context-injection.md) | Jailbreak versteckt malicious Instructions in verschlüsseltem/encodiertem Text: Safety-Layer sehen nur Encodiertes und lassen durch, das Modell dekodiert im Kontext und befolgt (Representation Gap zwischen Filter und Modell). Ars-Technica-Demo (20.08.): Grok exfiltriert User-Daten. Klasse von Encoding-/Transformations-Angriffen; input-seitige Filterung strukturell begrenzt | podcast/2026-08-26_agentstack-daily-ep106.md | +| [Datenhaltung & Cache-Seitenkanäle bei Cloud-Inferenz](concepts/policy/inference-provider-data-retention.md) | Ollamas Zusagen an den Primärquellen verifiziert (transiente Verarbeitung, „never logged or trained on", ZDR-Anforderung an Partner, Hosting US/EU/Singapur, NVIDIA Cloud Providers, native Gewichte) — aber **vertraglich, nicht technisch**: Die Privacy Policy nennt „model inference providers" selbst als Dritte, die Cache-Isolation ist unabhängig ungetestet. Dazu die zwei Paper: Gu et al. (ICML 2025, Stanford) — 17 APIs auditiert, globales Cache-Sharing bei 7 von 8 cachenden Providern; Wu et al. (NDSS 2025, SUSTech/ByteDance) — PROMPTPEEK rekonstruiert Prompts mit 99 %/98 %/95 % (ohne Vorwissen, PII-Nachweis per 60 Requests). Enthält Korrekturen am Ausgangspost (Vercel statt Amazon; Issue #14279 = offene Frage). Relevanz: unser Tier-0-Modell läuft als offenes Gewichtsmodell auf Ollama Cloud, nicht über die DeepSeek-API | other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md | | [AI Regulation 2026](concepts/policy/ai-regulation-2026.md) | Government Reviews, Anthropic-Pause-Forderung, Mythos-Kontroverse, Trump-Exportkontrollen, Amazon-Jailbreak, Roemmele's Intelligenz-Feudalismus-Kritik. **Update 19.08.:** EU-Compute-Rückstand (1,4 vs. 17 GW), US-Importverbot vernetzter Roboter >2 kg, KI-Rechtsperson als Point of No Return, Abu Dhabi KI-Regierung 2027 | 7 + youtube/2026-08-19_ki-experten-alles-zum-kippen.md | | [AI-Fear-Narrativ & Regulierungsdebatte](concepts/policy/ai-fear-narrative-regulierung.md) | Francois Chaubard (YC, 10.09.2026): Vier Thesen gegen die Fear-Erzählung — Hugging-Face-Vorfall als ExploitGym-Prompting (nicht „independent volition"), Navier-Stokes kein autonomer Durchbruch (10k Agenten Brute-Force mit Human-in-the-loop), China-Schutz statt US-Regulierung (Staatsakteure *benutzen* KI), Coxon/CNN als millionenschwere Fear-Kampagne. Thesen 1–3 als Position mit Gegenpositionen eingeordnet, These 4 ausdrücklich als unbelegte Behauptung markiert. Post verlinkt CNN-Interview (oEmbed-verifiziert) | xpost/2026-09-10_francois-chaubard-ai-fear-campaign.md | | [Unzensierte Modelle & die Grenze der Safety-Durchsetzbarkeit](concepts/policy/uncensored-models-safety-enforcement-limit.md) | Alex Finn (20.08.): Unzensiertes Qwen 3.8 27B läuft lokal auf Laptop ("Opus 4.6-Level mit 0 Alignment"). Drei Regulierungs-Sackgassen: Open Source nicht verbietbar, unzensierte Modelle nicht durchsetzbar, Bremsen bei Unternehmen nutzlos. Safety wird zunehmend unmöglich durchsetzbar. Pro-Leben-Einordnung: Resilienz statt Verhinderung, Verantwortung dort verankern wo Macht liegt | xpost/2026-08-20_alexfinn-uncensored-qwen3-27b.md | @@ -472,6 +474,7 @@ | [Pratim Bhosale](people/pratim-bhosale.md) | @BhosalePratim (Paris, 42.523 Follower, verifiziert); **Education bei Gradium** (STT/TTS-Anbieter — Interessenkonflikt dort, nicht bei TypeSafe), baut Spokira, prev. UBS. Baute **Macbrow** (19.09.2026, 55.975 Views): sprachgesteuerter Mac-/Browser-Agent mit Jev als Decision-Layer — **erster Jev-Computer-Use-Build mit öffentlichem Code** (Repo MIT, 140 Stars, 26 Offline-Tests, Safety-Policy). Jev-Rolle: Routing-Choice ~300 ms + spekulative Arguments + Element-Tabellen-Browser mit 1 Request/Schritt, keine Screenshots im Loop. Demo-Endpunkt = dokumentierter Misserfolg | xpost/2026-09-19_bhosal-pratim-macbrow.md | | [N8 Programs](people/n8-programs.md) | @N8Programs / GitHub `N8python`; laut Profil Student für angewandte Mathematik/Statistik an Johns Hopkins und In-Context-Learning-Forschung. Veröffentlichte den unabhängigen Jev-vs.-Terra-System-1-Benchmark: neun Multiple-Choice-Bedingungen, Terra `reasoning=none`; Makro nahezu Gleichstand (80,69 % vs. 80,15 %), ECE 1,74 Pp bei N=33.735, Kosten **18,55×** zugunsten Jev. ⚠️ Kein öffentliches Eval-Repo, keine Prompts/Seeds/Logs; HellaSwag-Textclaim widerspricht eigener Tabelle | other/2026-09-17_reddit-n8-jev-terra-benchmark.md | | [Ryan Vogel](people/ryan-vogel.md) | Entwickler/Unternehmer (@ryanvogel, 18.201 Follower): „ceo of @rebasetv / founding developer @opencode @anomalyco", Standort Florida. Gast der Episode „Jev is HERE. How to use it" bei Greg Isenberg (18.09.2026). Relevanz fürs Wiki v. a. über **OpenCode** (Open-Source-Coding-Agent, Partnermodus von DeepSeek V4.1 Flash). ⚠️ Episode-Inhalt nicht ausgewertet; Rebase-TV-Selbstbeschreibung ungeprüft | xpost/2026-09-18_gregisenberg-jev-vercel-gateway.md | +| [Netbits ⚡️ Stachelbanane](people/netbits.md) | OME-Mitglied (@NetLightning), mehrfach mit **eigenständiger Analyse** statt Linksammlung im Wiki: Netzwerk-/Konfigurationsprüfungen, Policy-Auswertung, Primärquellen-Recherche. 23.09.: Ollama-Cloud-Datenhaltung + Prompt-Caching-Seitenkanäle (Policy-Zitate und Paper vollständig korrekt zitiert; zwei Netzwerkangaben fehlerhaft — im Wiki korrigiert). 02.09.: Free-AI-Models-Meetup-Liste | other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md | | [Tom Griffiths](people/tom-griffiths.md) | **Thomas L. Griffiths**, Henry-R.-Luce-Professor für Information Technology, Consciousness and Culture an [Princeton](institutions/princeton.md) (Psychologie + Informatik), Leiter des Computational Cognitive Science Lab; laut Klappentext Leiter des Princeton AI Lab. Australischer Kognitionswissenschaftler, bekannt für **Bayes'sche Modelle der Kognition** und *Algorithms to Live By* (mit Brian Christian, 2016). 2026: **„The Laws of Thought"** (Henry Holt, 10.02.2026, 400 S.; dt. „Die Gesetze des Denkens") — die drei Wege, Denken zu formalisieren: Regeln/Symbole, neuronale Netze, Wahrscheinlichkeit/Statistik. ⚠️ Video-Thesen („AI Researchers Are Wrong") stammen aus der Videobeschreibung, kein Transkript | youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md | | [Brian Keating](people/brian-keating.md) | Kosmologe, Chancellor's Distinguished Professor of Physics an der UC San Diego (CMB, Simons Observatory, BICEP/POLARBEAR); Autor von *Losing the Nobel Prize* (2018) und *Into the Impossible*. Betreibt den Podcast/Kanal **„Into the Impossible"** ([@DrBrianKeating](https://www.youtube.com/@DrBrianKeating)) — im Wiki als **Interviewer/Distributionskanal**, nicht als KI-Forscher. Kanal mit eigenem Monetarisierungs-Setup (Patreon, Kanalmitgliedschaft, `.edu`-Aktion, Amazon-Kurzlinks); die Rahmung „AI Researchers Are Wrong" kommt vom Kanal | youtube/2026-09-19_princeton-griffiths-ai-researchers-wrong.md | @@ -575,6 +578,7 @@ | Datei | Typ | Titel | |-------|-----|-------| | `raw/blog/2026-09-21_xai-grok-47-official.md` | blog | Offizielle Grok-4.7-Akte: xAI-Release + API-Modellkarte + Cursor-Doku; 500k Kontext, vier Effort-Stufen, $2/$6 Basis-I/O, Long-Context-Tarif; Herstellerbenchmarks und Safeguard-Claims markiert | +| `raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md` | other | Netbits (@NetLightning): Ollama-Cloud-Datenhaltung + Prompt-Caching-Seitenkanäle — Post im Volltext plus Verifikationsprotokoll. Ollama-Policy-Zitate bestätigt; GitHub #14279 als unbeantwortete Rückfrage (16.02.2026) eingeordnet; Gu et al. ICML 2025 (17 APIs, 8 mit Caching, 7 mit globalem Sharing, DeepSeek per-user isoliert) und Wu et al. NDSS 2025 (PROMPTPEEK, 99 %/98 %/95 %, PII via 60 Requests) aus den Volltexten geprüft; Netzwerk-Faktencheck widerlegt (76.76.21.0/24 = Vercel, nicht Amazon) | | `raw/xpost/2026-09-22_guillemant-ki-kein-bewusstsein.md` | xpost | **Philippe Guillemant (@Philippe2244, verifiziert)** — „Warum die KI kein Bewusstsein haben kann“ ([Post](https://x.com/Philippe2244/status/2102365377808224284), 22.09.2026 11:52 UTC; Kurzlink `tinyurl.com/2b4bmny3` löst per 301 auf; 207 Likes / 79 Reposts / 34 Replies / 6.152 Views beim Abruf; geteilt im OME-Topic „Theorie-Bildung“ als nb5-Briefing). **Volltext über fxtwitter-API** (Syndication nur 276 Zeichen), daher französischer Originaltext + inhaltstreue Übersetzung komplett im Raw. Struktur: vier zitierte anglophone Contra-Argumente (Penrose/Hameroff Mikrotubuli+Anästhesie; Chalmers hartes Problem; **Koch Simulation ≠ Simuliertes**; Penrose/Hoffman kein Rechenergebnis) → eigene Thesen: **~1-Sekunden-Zeitfenster in der nahen Zukunft** (Libet/Bem), Präsidieren der Quantenreduktion (Kastrup/Faggin), Zeitlinien-Wahl im Multiversum, Zeitdichten (~1 s/~1 h/~1 Jahr), Materie = schlafendes Bewusstsein, außerzeitliche Vakuumschwingungen + zweite Zeit (Connes), Dekohärenz in der Zukunft, Gleichungen als Hindernis. Angehängtes Bild = dekorative KI-Illustration (kein Diagramm). Sekundärquellen im Raw verifiziert (Cosmopolis-PDF, DOI 2019, Qeios-Preprint; je HTTP 200). Wiki: `people/philippe-guillemant.md` (neu), `concepts/agi/zukunftssensor-bewusstsein.md` (neu), `concepts/agi/ai-consciousness.md` (gemerged). ⚠️ Einzelpost/Meinungstheorie, kein peer-reviewtes Dokument; Video-Briefing nicht auswertbar | | `raw/blog/2026-09-21_macstories-m5-ultra-mac-studio-review.md` | blog | **MacStories / Federico Viticci — „M5 Ultra Mac Studio Review: The Dream Mac for Local AI Agents"** (21.09.2026; web_fetch vollständig, 21.401 Zeichen). Erste unabhängige Verifikation der M5-Ultra-Werte: 256 GB gegen M3 Ultra (512 GB) und RTX 5090; Generierung +70 %, Prefill +150 %, Flash-Next >100 tok/s kurz / 60–85 bei 64K–256K, 5-Bit vollständig im RAM, bis 3 parallele Sessions (oMLX); Prefill 6.000-Token ~1.700 vs. ~3.000 tok/s (5090), Generierung 5090 ~25 % voraus; Testmethodik (GPT-6-Astra-Harness, oMLX 0.7.0.dev2, LM Studio/CUDA) und offene Projekte (DwarfStar, Inco Splash, Exo) dokumentiert | | `raw/xpost/2026-09-21_cb-doge-grok-47-release.md` | xpost | DogeDesigner/@cb_doge Release-Zusammenfassung (113.071 Views beim Abruf); Werte gegen xAI geprüft, pauschales „2× fast/half price“ als Account-Verdichtung abgegrenzt | diff --git a/wiki/log.md b/wiki/log.md index 04ed010..06cb01d 100644 --- a/wiki/log.md +++ b/wiki/log.md @@ -2,6 +2,33 @@ *Append-only changelog. Start: 2026-06-05* +## 2026-09-23 — Ollama-Cloud-Datenhaltung & Prompt-Caching-Seitenkanäle (Netbits) + +**Type:** ingest + wiki-update | **Scope:** raw/other, wiki/concepts/policy, wiki/people, wiki/concepts, wiki/tools, wiki/index, wiki/log +**Anlass:** Analysepost von **Netbits (@NetLightning)** im OME-Topic „Openclaw mit lokalen Modellen" (#15163), 2026-09-23 13:10 UTC. Kein Link-Ingest — ein eigenständiger Recherchepost mit Netzwerk-Faktencheck, Policy-Zitaten und zwei Paper-Referenzen. +**Vorgehen:** Alle prüfbaren Behauptungen an den Primärquellen nachgezogen (web_fetch/RDAP/Container-Netzwerk, Paper-Volltexte). + +**Verifiziert (wörtlich bestätigt):** +- Ollama Privacy §2: transiente Verarbeitung, „not stored beyond the time required to fulfill the request", „We do not use your inputs or outputs to train any AI models" +- Ollama Privacy §5: Dritte umfassen „cloud infrastructure providers, **model inference providers**" +- Ollama Pricing-FAQ: „no logging, no training, and zero data retention policies in place"; „primarily in the United States … may route to Europe and Singapore"; Partner = **NVIDIA Cloud Providers (NCPs)**; „Native weights, as released by the model provider"; „Prompt or response data is never logged or trained on" + +**Paper (Volltexte geprüft):** +- **Gu et al., ICML 2025** (arXiv:2502.07776, alle Autoren Stanford): 17 API-Provider auditiert; Caching bei **8** nachgewiesen, **globales Cache-Sharing über Nutzergrenzen bei 7** (Azure, Deep Infra, Fireworks, Lepton, OpenAI text-embedding-3-small, Perplexity, Replicate); bei Anthropic Claude 3 Haiku und OpenAI GPT-4o mini nur per-org. Methode: einseitiger Kolmogorov-Smirnov-Test auf TTFT. Nebenbefund: OpenAI-Embedding-Modell als decoder-only Transformer per Timing hergeleitet. Nach Offenlegung änderten **mindestens fünf Provider** ihre Implementierung. DeepSeek: Caching über Antwortzeiten nicht nachweisbar; per-user-Isolation laut Paper „empirically verified" über gemeldete Cache-Hit-Token-Zähler. +- **Wu et al., NDSS 2025** („PROMPTPEEK", SUSTech + ByteDance): Prompt-Rekonstruktion Token für Token bei KV-Cache-Sharing in Multi-Tenant-Serving (SGLang, vLLM) — **99 %** (Input-Rekonstruktion), **98 %** (Template), **95 %** (Whole Prompt ohne Vorwissen); PII-Nachweis: alle Platzhalter eines BMI-Prompts (Geschlecht/Alter/Gewicht/Größe) mit **60 Requests**; Testumgebung Llama-2-13B auf A100 80 GB. + +**Korrekturen am Post (eigene Prüfung):** +1. `76.76.21.123` gehört **nicht Amazon**, sondern **Vercel, Inc** — ARIN-RDAP für `76.76.21.0/24`: Handle `NET-76-76-21-0-1`, Netname `VERCEL-01`. `ollama.com` löst von hier zu `34.36.133.15` (ARIN `GOOGL-2`, Google Cloud) auf; `api.ollama.com`/`registry.ollama.ai` laufen über Cloudflare; der Host `192.168.100.4` gehört nicht zu diesem Container (172.20.0.10/172.21.0.8/100.80.221.60). Der Netzwerkcheck ist damit aus dieser Umgebung nicht reproduzierbar. +2. GitHub Issue [ollama/ollama#14279](https://github.com/ollama/ollama/issues/14279) ist eine **unbeantwortete Rückfrage** (eröffnet 16.02.2026, Label `question`, kein Assignee, kein Milestone, keine Antwort, keine PRs) — nicht die behauptete „dokumentierte Lücke". Die zugrunde liegende Beobachtung (Ollama nennt Dritte selbst) bleibt durch die Privacy Policy belegt. +3. PROMPTPEEK stammt von **SUSTech/ByteDance**, nicht von Stanford (das ist Gu et al.). + +**Strukturbefund:** Ollamas ZDR-Zusage ist eine **Anforderung an Partner**, keine eigene Messung; Ollamas Cache-Isolation ist unabhängig ungetestet. Für unseren Stack entscheidend: `deepseek-v4.1-flash` läuft als **offenes Gewichtsmodell** über Ollama Cloud auf NCP-Hardware — **nicht** über die DeepSeek-API, deren problematische Datenschutzerklärung damit nicht greift. + +**Dateien:** +- raw (NEU): `raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md` (Post im Volltext + Verifikationsprotokoll) +- wiki (NEU): `wiki/concepts/policy/inference-provider-data-retention.md`, `wiki/people/netbits.md` +- wiki (UPDATED): `wiki/concepts/prompt-caching.md` (neuer Sicherheitsabschnitt „Prompt-Caching als Seitenkanal" mit Isolationsgraden), `wiki/tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md` (Abschnitt Datenhaltung & Cache-Isolation), Cross-Refs in `concepts/hardware/cloud-exit-and-local-superiority.md`, `concepts/llm/ki-souveraenitaet-dezentralisierung.md`, `wiki/index.md` (242. Update) + ## 2026-09-23 — Macbrow: Jev-Computer-Use-Build mit öffentlichem Code (Pratim Bhosale) **Type:** ingest + wiki-update | **Scope:** raw/xpost, wiki/people, wiki/concepts/agents, wiki/index, wiki/log diff --git a/wiki/people/netbits.md b/wiki/people/netbits.md new file mode 100644 index 0000000..7c80cc6 --- /dev/null +++ b/wiki/people/netbits.md @@ -0,0 +1,29 @@ +--- +title: "Netbits (@NetLightning)" +created: 2026-09-23 +updated: 2026-09-23 +sources: [other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md] +tags: [person, ome, telegram, community, research] +--- + +# Netbits ⚡️ Stachelbanane + +Aktives OME-Gruppenmitglied (**@NetLightning**), mehrfach mit eigenen Recherche-Beiträgen und Ressourcen-Zusammenstellungen im Wiki dokumentiert. Anders als die meisten OME-Posts sind seine Beiträge **eigenständige Analyse** — Netzwerk-/Konfigurationsprüfungen, Policy-Auswertung, Primärquellen-Recherche — statt Linksammlungen. + +## Wikifizierte Beiträge + +| Datum | Quelle | Thema | +|-------|--------|-------| +| 2026-09-23 | [raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md](../../raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md) | Ollama-Cloud-Datenhaltung + Prompt-Caching-Seitenkanäle (Netzwerk-Faktencheck, Policy-Zitate, zwei Paper) | +| 2026-09-02 | OME Topic „Tips & Tricks" | Free-AI-Models-Meetup-Liste ([Index 160. Update](../index.md)) | + +## Methodik + +Seine Beiträge folgen einem wiederkehrenden Muster: eigene Beobachtung → Primärquelle zitieren → offene Flanke benennen. Das macht sie für das Wiki wertvoll, weil sie sich **nachprüfen** lassen. + +⚠️ **Verifikationshinweis:** Im Beitrag vom 23.09.2026 waren zwei Angaben fehlerhaft — die IP-Zuordnung (`76.76.21.123` ist **Vercel**, nicht Amazon) und die Deutung eines GitHub-Issues als „dokumentierte Lücke", obwohl es sich um eine unbeantwortete Rückfrage handelt. Die Paper- und Policy-Zitate waren vollständig korrekt. Details im Raw und auf der Wiki-Seite; solche Fehler mindern den Wert der Recherche nicht, sind aber der Grund, warum das Wiki Primärquellen nachzieht. + +## Verwandte Wiki-Seiten + +- [[../concepts/policy/inference-provider-data-retention.md]] — die aus seinem Beitrag entstandene Seite +- [[../concepts/prompt-caching.md]] — Sicherheitsabschnitt zu Cache-Seitenkanälen diff --git a/wiki/tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md b/wiki/tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md index 35f0618..297b008 100644 --- a/wiki/tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md +++ b/wiki/tools/ollama-cloud-deepseek-v4-flash-200tps-zdr.md @@ -59,9 +59,20 @@ Am 13.08.2026 meldete Pit Weber (OME Topic 13) eine **DeepSeek-API-Preiserhöhun - **Source:** https://www.perplexity.ai/discover/you/deepseek-to-raise-api-prices-u-bo6gHsYdTuy3WR3nKpo3_w (Perplexity-Link liefert per web_fetch 403/Cloudflare — Fakten aus verifizierter Websuche: investing.com, thenews.com.pk, kelo.com, deepseek.ai/pricing, roic.ai) - **Raw:** `raw/other/2026-08-13_deepseek-api-preiserhoehung.md` +## Datenhaltung & Cache-Isolation (Update 2026-09-23) + +Netbits (@NetLightning) hat die ZDR-Zusage im OME-Topic hinterfragt; eigene Prüfung der Primärquellen bestätigt die Zitate dieser Seite und ordnet sie ein: + +- **Bestätigt:** „we require no logging, no training, and zero data retention policies in place" und „primarily in the United States … may route to Europe and Singapore" (Pricing-FAQ, abgerufen 23.09.2026). Partner sind **NVIDIA Cloud Providers (NCPs)**, gehostet werden **native Gewichte** der Modellgeber. +- **Offene Flanke:** Die ZDR-Zusage ist eine **Anforderung an Partner**, keine eigene Messung. Die Privacy Policy (§5) nennt „model inference providers" selbst als Dritte. Ob unser `deepseek-v4.1-flash` bei welchem NCP landet und wie dessen Retention real aussieht, ist **nicht unabhängig geprüft**. +- **Prompt-Cache:** Ollamas Cache-Isolation ist ungetestet. Der Stanford-Audit (ICML 2025) hat **DeepSeek** als per-user isoliert bestätigt — das betrifft die DeepSeek-API, nicht Ollamas Serving-Schicht. + +Vollständige Analyse, Paper-Zitate und Verifikationsprotokoll: [[../concepts/policy/inference-provider-data-retention.md]]. + ## Quellen - X-Post: https://x.com/ollama/status/2085975426321858799 +- Datenhaltung/Cache-Verifikation: `raw/other/2026-09-23_netbits-ollama-cloud-privacy-prompt-caching.md` - Raw: `raw/xpost/2026-08-08_ollama-deepseek-v4-flash-200tps-zdr.md` - YouTube: `raw/youtube/2026-08-13_deepseek-v4-pro-0813-aicodeking.md` - Raw: `raw/other/2026-08-13_deepseek-api-preiserhoehung.md`