DeepSeek-API

-

ist eine von DeepSeek gestartete Modellaufrufplattform, die HTTP-API-Schnittstellen für Modelle der Serien DeepSeek-V3, DeepSeek-R1 und DeepSeek-V4 bereitstellt. Es ist mit dem OpenAI-Protokollformat kompatibel und unterstützt Streaming-Ausgabe, Funktionsaufrufe, strukturierte JSON-Ausgabe, Kontext-Caching und dreistufige Argumentationsmodi (Non-think/Think High/Think Max). Der API-Preis ist 10-100-mal niedriger als der von GPT-5.5 Pro und der Eingabe-Cache-Treffer beträgt nur 0,02 Yuan/Million Token. Es ist eine der kostengünstigsten Lösungen für Entwickler und Unternehmen, um auf LLM-Funktionen zuzugreifen.

DeepSeek-API Produktoberfläche

DeepSeekAPI

Kernparameter und Statistiken

Die DeepSeek-API ist kein unabhängiges Modell, sondern eine aufrufende Plattform, auf der DeepSeek seine Modelle der V3/R1/V4-Serie in eine standardisierte HTTP-Schnittstelle kapselt. Sie teilt das zugrunde liegende Modell mit der DeepSeek-Webversion und der App, es gibt jedoch wesentliche Unterschiede in der Leistungsfähigkeit, den Aufrufmethoden, der Abrechnungslogik und den Nutzungsbeschränkungen – die API ist eher auf „programmierte Aufruf“-Szenarien als auf „Mensch-Computer-Dialog“-Szenarien ausgerichtet.

Parameterabmessungen DeepSeek-API-Spezifikationen
Protokollkompatibilität Kompatibilität mit dem OpenAI-API-Protokoll (kann „base_url“ direkt ersetzen)
Support-Modelle deepseek-chat (Nicht-Denkmodus, zeigt derzeit auf V4-Flash), deepseek-reasoner (Denkmodus, zeigt derzeit auf V4-Flash)
Kontextfenster Maximal 1 Mio. Token (V4-Serie), 128.000 (V3/R1-Serie)
Maximale Leistung Bis zu 384.000 Token (V4-Serie), 8.000–32.000 (V3/R1-Serie)
Streaming-Ausgabe Support (stream: true)
Funktionsaufruf Support (Toolaufruf und mehrstufige Aufgabenorchestrierung)
Strukturierte JSON-Ausgabe Support (response_format: {"type": "json_object"})
Kontext-Caching Unterstützt (Server speichert automatisch doppelte Präfixe im Cache, der Cache-Hit-Preis beträgt nur 0,02 Yuan/Million Token)
Argumentationsmodus Non-Think (geradlinig) / Think High (konventionelles Denken) / Think Max (maximale Denktiefe) drei Stufen verfügbar
Internetsuche Unterstützt (Suchparameter müssen in der Anfrage explizit aktiviert werden)
Multimodal Bildverständnis (basierend auf visuellem Sprachmodell, nicht-nativem multimodalem Modell)
API-Endpunkt https://api.deepseek.com
Kostenloses Kontingent Registrieren Sie sich und erhalten Sie 10 Millionen Eingabe-Tokens (ca. 100.000 kostenlose Anrufe)

Leistungs- und Durchsatzreferenz: DeepSeek-Beamte haben weiterhin keine genauen Werte für TTFT (First Word Delay) und TPM/RPM-Frequenzsteuerung offengelegt. Laut Stichprobendaten von Bewertungsgemeinschaften Dritter (z. B. Artificial Analysis) beträgt die TTFT von V4-Flash bei mittlerer Parallelität etwa 200–400 ms und von V4-Pro etwa 400–800 ms. Im Hinblick auf die Frequenzkontrolle kann sich der API-Standardwert auf den Basiswert von 60 Anfragen pro Minute (RPM) und 50 Millionen Token pro Tag beziehen. Für Hochfrequenzszenarien (>100 U/min) wenden Sie sich bitte an die Geschäftserweiterungsquote. Es ist zu beachten, dass TTFT von drei Faktoren beeinflusst wird: Kontextlänge, Auswahl des Inferenzmodus und Parallelität. Im Think Max-Szenario im 1M-Kontext kann die Verzögerung des ersten Wortes 3–5 Sekunden erreichen. Dies sind die physischen Kosten eines Szenarios mit extrem langem Kontext und keine Serviceausnahme.

Benutzer- und Markterkennung

Es gibt einen klaren Unterschied zwischen der Marktwahrnehmung der DeepSeek-API und der DeepSeek-Webversion: Erstere ist eine „Kostensenkung“ für Entwickler und Unternehmen, während letztere ein „kostenloses Dialogfenster“ für C-End-Benutzer ist.

Durchdringung der Entwickler-Community: Auf GitHub haben Integrationsprojekte rund um die DeepSeek-API (einschließlich der LangChain/LlamaIndex-Integration eines Drittanbieter-Client-MCP-Servers, einer API-Übertragung usw.) mehr als 5.000 Sterne gesammelt. Das OpenAI-kompatible Protokoll der API reduziert die Migrationskosten erheblich – Entwickler müssen lediglich „base_url“ von „https://api.openai.com“ in „https://api.deepseek.com“ ändern, um den Wechsel abzuschließen, ohne die Codelogik zu ändern. Dies ist die treibende Kraft hinter der schnellen Verbreitung der DeepSeek-API in der Entwicklergemeinschaft.

Annahme durch B-Side-Unternehmen: Nach öffentlichen Informationen haben mehr als 30.000 Unternehmen über die API auf das DeepSeek-Modell zugegriffen und decken 12 Branchen ab, darunter Finanzen, medizinische Versorgung, Industrie und Regierungsangelegenheiten. Staatliche Unternehmen wie China UnionPay und die National Pipeline Network Group haben API-Aufrufe in Kerngeschäftsprozesse wie die Erstellung von Marketingtexten, intelligente Steuerung und Pipeline-Sicherheitsaudits eingebettet. Die Kernlogik des Unternehmens besteht nicht darin, die Modellleistung allein anzuführen, sondern in der wirtschaftlichen Betrachtung: „Bei gleichen Fähigkeiten betragen die API-Kosten nur 1/10-1/100 der internationalen Wettbewerbsprodukte.“

Positionierung der Bewertung durch Dritte: Auf Plattformen von Drittanbietern wie Artificial Analysis, OpenRouter und LMSYS Chatbot Arena haben die von DeepSeek API bereitgestellten Modelle der V4-Serie das beste Niveau von Open-Source-Modellen in Bezug auf Argumentation und Agentenfähigkeiten erreicht und sind mit Top-Closed-Source-Modellen in mathematischen MINT- und Wettbewerbscodierungsaufgaben vergleichbar. Allerdings ist es Gemini-3.1-Pro und Claude Opus 4.6 in Bezug auf die weltweite Wissensabdeckung und die „Natürlichkeit“ des kreativen Schreibens immer noch etwas unterlegen, was darauf hindeutet, dass das Modell hinter der API hinsichtlich der Long-Tail-Fakteninjektion und der Stilvielfalt Raum für weitere Optimierungen bietet.

Kostenvorteil

Bei der Kostenstruktur der DeepSeek API handelt es sich nicht um eine periodische Werbung, sondern um eine systematisch niedrige Preisgestaltung, die durch MoE-Architekturinnovation, hybride Aufmerksamkeitsmechanismen und technische Optimierung erreicht wird. Sein Preissystem hat einen „Dimensionalitätsreduzierungsschlag“ für chinesische Entwickler – es treibt die Kosten für den Aufruf großer Modell-APIs von „Cent/Million Token“ in die Größenordnung von „Cent/Million Token“.

Servicetyp Komponente DeepSeek-V4-Flash DeepSeek-V4-Pro (25 % Rabatt) Mitbewerberreferenz (GPT-5.5 Pro) Mitbewerberreferenz (Claude Opus 4.6)
Eingabe Cache-Treffer 0,02 Yuan/Million Token 0,025 Yuan/Million Token ~3,4 Yuan/Million Token Nicht bekannt gegeben
Cache-Fehler 1 Yuan/Million Token 3 Yuan/Million Token Ungefähr 30 $/Million Token Ungefähr 15 $/Million Token
Ausgabe 2 Yuan/Million Token 6 Yuan/Million Token Ungefähr 180 US-Dollar/Million Token Ungefähr 75 US-Dollar/Million Token

Echte Vorteile von Cache Hits: Kontext-Caching ist der am meisten unterschätzte Kostensenkungsmechanismus der DeepSeek-API. In Produktionsszenarien mit festen Systemaufforderungswörtern und stabilen Dialogpräfixen (z. B. Kundendienstroboter und Codeüberprüfungsassistenten) kann die Cache-Trefferquote 60–80 % erreichen, was bedeutet, dass der tatsächliche effektive Preis nur 0,4 Yuan/Million Token (V4-Flash-Ausgabe) betragen kann. Bei Anwendungsfällen, bei denen sich dynamische Inhalte häufig ändern (z. B. wenn jedes Mal eine völlig andere Frage eingegeben wird), geht die Cache-Trefferquote jedoch gegen Null. Zu diesem Zeitpunkt sollten Sie sich bei der Budgetierung auf den „Cache-Miss“-Preis beziehen.

Kostenlose Quotenstrategie: Bei der Registrierung werden 10 Millionen Input-Tokens (ca. 5 Millionen Output-Tokens) geschenkt, was ausreicht, damit eine einfache Anwendung (durchschnittlicher täglicher Input von 100.000 Tokens) etwa 100 Tage lang läuft. Verglichen mit dem kostenlosen OpenAI-Guthaben von 5 US-Dollar (ca. 36 Yuan) ist das tatsächliche Guthaben, das inländischen Entwicklern zur Verfügung steht, fast 30-mal höher. Bitte beachten Sie jedoch: Das kostenlose Kontingent ist zeitlich begrenzt (normalerweise 3 Monate) und der nicht genutzte Teil wird automatisch gelöscht.

API-Kostenvergleichsabzug: Am Beispiel einer mittelgroßen Anwendung, die 2 Millionen Token pro Tag verarbeitet und 1 Million Token eingibt, betragen die monatlichen Kosten für die Verwendung von V4-Flash ungefähr (1×60 + 2×30) = RMB 120; Die monatlichen Kosten für die Nutzung von V4-Pro mit einem Rabatt von 25 % betragen ungefähr (3×60 + 6×30) = 360 RMB. Die monatlichen Kosten von GPT-5.5 Pro unter derselben Auslastung betragen ungefähr (30×7,2×60 + 180×7,2×30) ÷ 100 ≈ 518 US-Dollar (ungefähr 3.700 Yuan), eine Differenz von 10–30 Mal.

Kostenkompromisse für Unternehmens-/Privatbereitstellungen: Die Wahl zwischen Open-Source-Modell-API-Aufrufen und selbstgehosteten Bereitstellungen ist kein reiner Preisvergleich. Der API-Modus erfordert keine Investitionen in GPU-Hardware sowie Betriebs- und Wartungsteams und eignet sich für Teams mit großen Schwankungen im Modellaufrufvolumen oder für Teams, die Produktkonzepte schnell überprüfen möchten. Obwohl die Grenzkosten eines einzelnen Anrufs bei privatisierter Bereitstellung niedriger sind (insbesondere in Szenarien mit hoher Parallelität), müssen dennoch Fixkosten wie Kauf/Leasing eines GPU-Servers (die monatliche Miete für 8×A100-80G beträgt etwa 50.000–80.000 Yuan), Personal für Betrieb und Wartung sowie Netzwerkbandbreite getragen werden. Die Gesamtkosten des Unternehmens sollten umfassend anhand der „jährlichen API-Gebühr im Vergleich zu den dreijährigen Gesamtbetriebskosten der privaten Bereitstellung“ bewertet werden und die Aktualisierungskosten berücksichtigen, die durch die Iteration der Modellversion verursacht werden.

Hauptfunktionen

Das funktionale Design der DeepSeek-API konzentriert sich auf die drei Hauptlinien „Senken der Integrationsschwelle, Erweitern der Anrufflexibilität und Steuern der Nutzungskosten“. Dabei geht es nicht einfach darum, die Muster-Chatbox auf die HTTP-Schnittstelle zu verschieben.

  • OpenAI-Protokollkompatibilität: Dies ist die pragmatischste Entscheidung für die DeepSeek-API. Durch die Verwendung des exakt gleichen Anforderungs-/Antwortformats müssen Entwickler kein neues SDK erlernen, sondern lediglich „base_url“ und „api_key“ ändern. Vorhandener OpenAI SDK-basierter Code, Toolketten (LangChain, LlamaIndex, AutoGPT usw.) und Überwachungs-Middleware (Helicone, Portkey usw.) können direkt wiederverwendet werden. Migrationskosten liegen bei nahezu Null – Die Umstellung eines mittelgroßen Projekts von OpenAI auf die DeepSeek-API dauert in der Regel nur 10 Minuten zum Ändern der Konfiguration und erfordert keine Code-Umgestaltung.

  • Funktionsaufruf: Unterstützt die Definition benutzerdefinierter Tools über den Parameter „tools“, sodass das Modell unabhängig entscheiden kann, welche externen Funktionen während des Inferenzprozesses aufgerufen werden sollen. Geeignet zum Erstellen von Agent-Anwendungen – das Modell kann das komplette Paket „Verstehen der Absicht des Benutzers → Entscheidung zum Aufrufen der Funktion → Analysieren der zurückgegebenen Ergebnisse → Generieren der endgültigen Antwort“ in einer Interaktion abschließen. Die Agentenfähigkeiten der V4-Serie erreichen SOTA im Open-Source-Modell, und die Genauigkeit des Funktionsaufrufs ist bei gleicher Parametermenge besser als bei den Serien Llama 4 und Qwen3.

  • Drei Ebenen des Denkmodus: Nicht-Denken (geradliniger Modus), Think High (normales, tiefgründiges Denken) und Think Max (maximales, tiefgründiges Denken), drei Stufen einstellbar. Non-Think eignet sich für verzögerungsempfindliche Aufgaben wie Übersetzung, Zusammenfassung und Informationsextraktion. TTFT liegt normalerweise innerhalb von 200 ms. Think High eignet sich für tägliche Fragen und Antworten sowie für das Denken mittlerer Komplexität, und der Ausgabetoken ist etwa 1,5- bis 3-mal so hoch wie der von Non-think. Think Max eignet sich für mathematische Beweise, Wettbewerbsprogrammierung und kontrafaktische Analyse und der Ausgabetoken kann das 3- bis 8-fache des Ausgabetokens von Non-think erreichen. Auswahlprinzip: Verwenden Sie Think High nicht für Aufgaben, die mit Non-think gelöst werden können, und verwenden Sie Think Max nicht für Aufgaben, die mit Think High gelöst werden können – je tiefer die Argumentationstiefe, desto mehr Token-Verbrauch und Verzögerung eines einzelnen Aufrufs steigen nichtlinear an.

  • Kontext-Caching: Der Server speichert automatisch die Systemaufforderungswörter und den vorherigen Konversationsverlauf in der Anfrage zwischen und verwendet die zwischengespeicherten Ergebnisse direkt wieder, wenn der Präfixinhalt nachfolgender Anfragen übereinstimmt. Für Szenarien wie Kundendienstroboter (feste Systemaufforderungen + Benutzerproblemänderungen) und Codeassistenten (fester Kontext + Überprüfung unterschiedlicher Codesegmente) kann die Cache-Trefferquote 60–80 % erreichen und die effektiven Kosten können auf 2–5 % des Fehlerpreises reduziert werden. Der Cache wird automatisch verwaltet und erfordert keinen manuellen Eingriff durch den Entwickler. Es ist jedoch wichtig zu beachten: Der Cache verfügt über eine TTL (normalerweise 5 bis 10 Minuten) und hochfrequente wiederholte Anforderungen können vollständig genutzt werden.

  • Strukturierte JSON-Ausgabe: Übergeben Sie response_format: {"type": "json_object"}, um das Modell zur Ausgabe von legalem JSON zu zwingen. Dies ist von entscheidender Bedeutung für Szenarien, in denen die KI-Ausgabe direkt mit nachgelagerten Automatisierungspipelines verbunden werden muss (z. B. Datenbereinigung, automatisches Ausfüllen von Formularen, API-Parametergenerierung). Bei der Verwendung muss das erwartete JSON-Schema in der Systemeingabeaufforderung klar angegeben werden. Das Modell folgt dem Schema gut, die Stabilität komplexer verschachtelter Strukturen und die Konsistenz von Feldtreffern müssen jedoch noch getestet und verifiziert werden.

  • Internetsuche: Suchparameter können in API-Anfragen aktiviert werden, sodass das Modell während der Inferenz Internetinformationen in Echtzeit abrufen kann, um die Wissensgrenze der Trainingsdaten zu durchbrechen. Suchergebnisse werden zur Inferenz als Kontext in das Modell eingefügt, anstatt Suchzusammenfassungen unabhängig zurückzugeben. Die Genauigkeit der Suchergebnisse in der V4-Serie ist im Vergleich zu V3 verbessert, es wird jedoch weiterhin empfohlen, in wichtigen Faktenszenarien manuelle Überprüfungspunkte festzulegen.

Modell- und Versionsentwicklung

Die Modellversionsentwicklung der DeepSeek-API wird mit der gesamten Modelliteration von DeepSeek synchronisiert, aber die API-Endpunktverwaltung hat ihren eigenen Lebenszyklus – das alte Modell wird nicht sofort offline geschaltet, aber die Ausfallzeit wird im Voraus benachrichtigt, so dass den Entwicklern ein Migrationsfenster bleibt.

API-Endpunkt-Zuordnungsbeziehung

Zeitknoten deepseek-chat (nicht nachdenken) „deepseek-reasoner“ (Denken) Wichtige Änderungen
26.12.2024 DeepSeek-V3 Die erste API-Version, grundlegende Konversationsfunktionen
20.01.2025 DeepSeek-V3 DeepSeek-R1 Die Denkmodus-API ist online, Argumentationsspezialisierung
28.05.2025 DeepSeek-V3-0324 DeepSeek-R1-0528 Deutlich verbesserte Denkfähigkeiten und mathematische Benchmarks
21.08.2025 DeepSeek-V3.1 DeepSeek-V3.1 (Denkmodus) Hybride Inferenzarchitektur, 128K-Kontext
22.09.2025 DeepSeek-V3.1-Terminus DeepSeek-V3.1-Terminus Sprachkonsistenz und Optimierung der Agentenfähigkeit
29.09.2025 DeepSeek-V3.2-Exp DeepSeek-V3.2-Exp Experimentelle Version mit spärlicher Aufmerksamkeit
01.12.2025 DeepSeek-V3.2 DeepSeek-V3.2 Allgemeine Fähigkeiten weiter verbessert
24.04.2026 Zeigen Sie auf V4-Flash, nicht denkend Verweisen Sie auf V4-Flash-Denken Die V4-Ära hat begonnen und der alte Endpunktname soll am 24.07.2026 eingestellt werden

Endpunktverwaltungsstrategie: DeepSeek API übernimmt die Strategie „feste Endpunktnamen und Rotation von Backend-Modellen“. Die beiden Endpunkte „deepseek-chat“ und „deepseek-reasoner“ haben nach der Veröffentlichung von V4 auf das V4-Flash-Modell hingewiesen. Ältere Modelle (V3, V3.1, V3.2) können aufgerufen werden, indem in der Anfrage der Parameter „model“ als spezifischer Modellname angegeben wird. Beamte haben Pläne angekündigt, die V3-Serienzuordnung der alten Endpunktnamen am 24.07.2026 zu deaktivieren. Entwickler sollten die Leistungsüberprüfung der Migration auf das neue Modell abschließen, bevor sie den Dienst beenden.

Beziehung zwischen API-Version und Modellversion: Die „Version“ der API ist keine unabhängige Softwareversionsnummer, sondern eine Zuordnungsschicht der Back-End-Modellversion. Jedes Mal, wenn DeepSeek ein neues Modell veröffentlicht, führt das API-Team Kompatibilitätstests, Leistungsstresstests und Stabilitätsüberprüfungen durch. Erst nach bestandener Verifizierung wird das neue Modell auf dem API-Endpunkt bereitgestellt. Daher verzögert sich der API-Start in der Regel um 3–14 Tage mit der Modellfreigabe. Das Vorhandensein dieser Verzögerungszeit bedeutet, dass Entwickler, die die neuesten Modellfunktionen anstreben, eher auf offizielle API-Ankündigungen als auf Modellveröffentlichungsankündigungen achten müssen.

Technische Vorteile

Die technische Wettbewerbsfähigkeit der DeepSeek-API ergibt sich nicht aus der Parameterskala eines einzelnen Modells, sondern aus der systemtechnischen Fähigkeit, „gleiche oder bessere Inferenzqualität bei geringeren Rechenleistungskosten zu erreichen“.

Geringe Aktivierungskosten der MoE-Architektur: V4-Pro aktiviert nur etwa 49B Parameter pro Token (entspricht 3 % der Gesamtparameter 1,6T), und V4-Flash aktiviert etwa 13B Parameter (entspricht 4,6 % von 284B). Die extrem niedrige Aktivierungsrate bedeutet, dass der pro API-Aufruf verbrauchte GPU-Rechenaufwand viel geringer ist als der eines Modells mit der gleichen Gesamtparametermenge. Dies ist der wichtigste technische Grund, warum die DeepSeek-API für 1/30 des Preises von GPT-5.5 Pro verkauft werden kann – nicht weil DeepSeek mit Verlust subventioniert, sondern weil die MoE-Architektur selbst geringere Rechenanforderungen für die Einheiteninferenz hat.

Kontextkostenrevolution des Hybrid-Aufmerksamkeitsmechanismus: Die Hybrid-Aufmerksamkeitsarchitektur (CSA + HCA) der V4-Serie reduziert den Berechnungsaufwand und die Speichernutzung in 1-Millionen-Ultra-Long-Context-Szenarien auf 10–27 % der herkömmlichen Vollaufmerksamkeitsmethode. Die direkte Bedeutung dieses Mechanismus für API-Aufrufer besteht darin, dass extrem lange Dokumentanalyseaufgaben, die zuvor den separaten Kauf von GPU-Instanzen mit höherer Spezifikation erforderten, jetzt mit Standardkonfigurationen ohne Aufruffehler aufgrund von OOM abgeschlossen werden können. Die Belegung des KV-Cache wird im Vergleich zu herkömmlichen Methoden auf 7–10 % reduziert, was bedeutet, dass unter den gleichen Hardwarebedingungen mehr gleichzeitige Anforderungen unterstützt werden können.

Inferenzbonus des FP8-Trainings mit gemischter Präzision: DeepSeek übernimmt die gemischte FP8-Präzision in der Trainingsphase vollständig, und die trainierten Modellgewichte unterstützen natürlich die FP8-Inferenz. Im Vergleich zur FP16-Inferenz kann die FP8-Inferenz die Grafikspeichernutzung um etwa 50 % und die Rechenlatenz um etwa 30 % reduzieren. Dies bedeutet, dass API-Dienstanbieter mehr gleichzeitige Inferenzanfragen auf demselben GPU-Cluster hosten können und der Kostenvorteil letztendlich an die API-Preise weitergegeben wird.

Compliance-Wert der Anpassung der inländischen Rechenleistung: DeepSeek hat eine intensive Zusammenarbeit mit der Ascend NPU von Huawei erreicht, und API-Dienste können die vollständige Prozessbeurteilung auf der Ascend-Plattform durchführen. Diese Fähigkeit hat einen „unersetzlichen Lizenzwert“ für Branchen wie Regierungsangelegenheiten, Finanzen und Energie, die lokalen Ersatzbedarf haben. Gemäß den Anforderungen der Xinchuang-Richtlinie kann es zu Compliance-Risiken kommen, wenn die zugrunde liegende Rechenleistung von API-Aufrufen vollständig von der NVIDIA-GPU abhängig ist. Bitte beachten Sie jedoch: Der Inferenzdurchsatz und die Stabilität auf der Ascend-Plattform sind immer noch schwächer als die von NVIDIA-GPUs derselben Generation, und der Latenzunterschied in Hochfrequenzszenarien kann 20–50 % erreichen.

Wie man es benutzt

Der Nutzungspfad der DeepSeek API ist in drei Schritte unterteilt: „Kontovorbereitung → API-Schlüsselerfassung → Schnittstellenaufruf“. Der Gesamtprozess stimmt in hohem Maße mit der OpenAI-API überein.

Nutzungsvergleich:

Nutzungsformular Geeignetes Szenario Eingang Kostenmodell
HTTP-API-Direktaufruf Backend-Service-Integration, automatisierter Workflow https://api.deepseek.com Bezahlen nach Token-Volumen
OpenAI SDK (Python/Node) Schnelle Migration, Prototypenentwicklung Ändern Sie „base_url“ und „api_key“ Wie oben
LangChain / LlamaIndex-Integration Complex Agent / RAG-Anwendung Konfiguration ChatOpenAI(model="deepseek-chat", openai_api_base="https://api.deepseek.com") Wie oben
Eine API/Neue API-Übertragung Multimodell-Aggregationsmanagement Selbstgebauter Transferservice Transferservicegebühr + API-Gebühr
MCP-Serverzugriff MCP-Clients wie Claude Desktop Konfigurieren Sie „mcpServers“ Wie oben

Python-Aufrufbeispiel (einschließlich Schlüsselparameter):

„Python von openai importieren OpenAI

client = OpenAI( api_key="", base_url="https://api.deepseek.com" )

Antwort = client.chat.completions.create( model="deepseek-chat", # zeigt derzeit auf den Nicht-Denkmodus von V4-Flash Nachrichten=[ {"role": "system", "content": "Sie sind ein professioneller Python-Code-Überprüfungsassistent. Bitte geben Sie die Überprüfungskommentare im JSON-Format aus."}, {"role": "user", "content": "Überprüfen Sie den folgenden Code:\ndef fib(n):\n wenn n <= 1: return n\n return fib(n-1) + fib(n-2)"} ], Temperatur=0,3, # Für Codeüberprüfungsszenarien wird eine niedrige Temperatur empfohlen max_tokens=4096, # Steuern Sie die Obergrenze der Ausgabelänge stream=True, # Streaming-Ausgabe aktivieren, um die Verzögerung des ersten Wortes zu reduzieren Response_format={"type": "json_object"}, # JSON-Ausgabe erzwingen

tools=[...], # Funktionsaufrufdefinition (optional)

# enable_search=True # Internetsuche (optional, Parametername muss bestätigt werden)

)

für chunk als Antwort: wenn chunk.choices[0].delta.content: print(chunk.choices[0].delta.content, end="") „

Vorschläge zur Optimierung wichtiger Parameter:

  • „Temperatur“: 0,1–0,3 wird für Code-/Mathematikszenarien empfohlen, 0,7–0,9 wird für kreatives Schreiben empfohlen und 0,0–0,2 wird für die Informationsextraktion empfohlen. Eine zu hohe Temperatur kann zu einer instabilen Ausgabe der Inferenzaufgabe führen.
  • „max_tokens“: Die V4-Serie unterstützt bis zu 384 KB. Bei der tatsächlichen Verwendung wird jedoch empfohlen, eine angemessene Obergrenze basierend auf den Aufgabenanforderungen festzulegen. Eine zu hohe Einstellung erhöht nicht nur die Wartezeit, sondern führt auch zu Abrechnungsverschwendung aufgrund ungenutzter Token.
  • „stream“: Für Produktionszwecke wird empfohlen, „stream=True“ immer zu aktivieren, was die vom Benutzer wahrgenommene Verzögerung des ersten Worts erheblich reduzieren kann. Der Erfahrungsunterschied kann in Szenarien mit langer Ausgabe mehrere Sekunden betragen.
  • „response_format“: In Szenarien, die eine strukturierte Ausgabe erfordern, wird empfohlen, den JSON-Modus zu aktivieren, aber das JSON-Schema der Modellausgabe muss in der Systemeingabeaufforderung klar angegeben werden. Im JSON-Modus opfert das Modell einen Teil der Generationsvielfalt, um die Formatkorrektheit sicherzustellen, und es wird nicht empfohlen, ihn für kreative Aufgaben zu aktivieren.
  • „Tools“ (Funktionsaufruf): Jede Tooldefinition muss „Name“, „Beschreibung“ und „Parameter“ (JSON-Schema) enthalten. Werkzeugbeschreibungen sollten so detailliert wie möglich sein – je präziser die Beschreibung, desto genauer kann das Modell das richtige Werkzeug auswählen.

So rufen Sie die Online-Suche auf : Beim Aufrufen der API müssen Sie suchbezogene Parameter zum Anforderungstext hinzufügen (die spezifischen Feldnamen unterliegen dem offiziellen API-Dokument). Der Suchschalter kann im Eingabefeld der Webversion und der App manuell aktiviert werden. Es ist zu beachten, dass die Netzwerksuche die Inferenzverzögerung erhöht (ca. 1–3 Sekunden) und nur in Szenarien aktiviert wird, in denen Echtzeitinformationen erforderlich sind.

Produktpreise

Das Preissystem der DeepSeek API verfolgt eine zweigleisige Strategie: „Kostenlose C-End-Webversion + extrem niedriger API-Volumenpreis“, und es gibt kein „monatliches Abonnementsystem“ oder „Paketpaket“-Modell. Der Preis wurde oben im Kapitel „Kostenvorteile“ detailliert beschrieben. Hier konzentrieren wir uns auf die tatsächlichen Kostenabzüge und Abrechnungsüberlegungen für unterschiedliche Verbrauchsniveaus.

Einzelne Entwickler/Nutzung in kleinem Maßstab: Das kostenlose Registrierungslimit liegt bei etwa 10 Millionen Eingabe-Tokens. Damit ein einzelner Entwickler ein automatisiertes Skript (z. B. einen AI-Generator für tägliche Zusammenfassungen) mit einer durchschnittlichen täglichen Eingabe von 100.000 Token ausführen kann, kann das kostenlose Kontingent etwa 100 Tage lang genutzt werden. Danach betragen die Kosten für V4-Flash etwa (1×3 + 2×1,5) = 6 Yuan/Monat (geschätzt auf der Grundlage einer durchschnittlichen täglichen Eingabe von 100.000 und einer Ausgabe von 50.000), was nahezu vernachlässigbar ist.

Mittelgroße Anwendung: Für eine Anwendung mit einem durchschnittlichen täglichen Input von 2 Millionen Token und einem Output von 1 Million Token betragen die monatlichen Kosten für die Nutzung von V4-Flash etwa (1×60 + 2×30) = 120 Yuan; Die monatlichen Kosten für die Nutzung von V4-Pro mit 25 % Rabatt betragen etwa 360 Yuan. Diese Größenordnung entspricht etwa 100.000 Gesprächen pro Monat, und die durchschnittlichen Kosten pro Anruf betragen etwa 0,0012–0,0036 Yuan (0,12–0,36 Cent), was weit unter den Durchschnittspreisen inländischer Mainstream-Cloud-APIs liegt.

Hochfrequenz-/Großserienproduktion mit Kontext: durchschnittlicher täglicher Input von 20 Millionen Token und Output von 10 Millionen Token, die monatlichen Kosten betragen ungefähr (1×600 + 2×300) = 1.200 Yuan (V4-Flash). Auf dieser Ebene wird empfohlen, sich an das DeepSeek-Geschäftsteam zu wenden, um gestaffelte Preise oder Rabatte für reservierte Ressourcen zu erhalten. Gleichzeitig ist eine Bewertung erforderlich: Wenn die monatliche API-Gebühr 5.000 Yuan übersteigt, kann die private Bereitstellung eine wirtschaftlichere Option sein, insbesondere wenn feste GPU-Ressourcen und ein komplettes Betriebs- und Wartungsteam vorhanden sind.

Abrechnungshinweise:

  • Input-Tokens und Output-Tokens werden separat abgerechnet und der Output-Preis ist höher als der Input (etwa das Zweifache).
  • Eingabetokens für Cache-Treffer genießen erhebliche Rabatte (bis zu 2 % des Miss-Preises).
  • Die Eingabeaufforderungswörter des Systems sind in der Abrechnung des Eingabe-Tokens enthalten und es wird empfohlen, sie zu optimieren, um die Kosten zu senken. – Suchergebnis-Tokens für Internetsuchen sind ebenfalls in der Eingangsabrechnung enthalten und die tatsächliche Nutzung kann die Erwartungen übertreffen.
  • Für fehlgeschlagene Anfragen (aufgrund von Frequenzkontrolle, Zeitüberschreitung, Parameterfehlern usw.) fallen keine Gebühren an, es wird jedoch empfohlen, eine angemessene Wiederholungsstrategie festzulegen, um Geschäftslücken zu vermeiden.

Anwendungsszenarien

Die Implementierungsszenarien der DeepSeek-API weisen „Stapelverarbeitung, strukturierte Ausgabe und automatisierte Integration“ als gemeinsame Merkmale auf, was eine klare Unterscheidung zum Szenario „Mensch-Computer-Interaktion“ für die Webversion darstellt.

  • Intelligentes Kundenservice- und Arbeitsauftragssystem: Integrieren Sie Deepseek-Chat (Non-Think-Modus) in das Kundenservicesystem, um FAQs, Arbeitsauftragsklassifizierung und standardisierte Antwortgenerierung zu bearbeiten. Funktionsaufrufe können zum Abfragen des Bestellstatus, der Bestandsinformationen oder der Benutzerhistorie verwendet werden und bilden ein „Verstehen → Abfrage → Antwort“-Konzept. Implementierungstipps: Kundenservice-Szenarien stellen hohe Anforderungen an die Konsistenz der Antwortformate. Es wird empfohlen, den JSON-Modus zu verwenden, um die Ausgabestruktur einzuschränken, und mindestens 500 Testfälle vorzubereiten, um hochfrequente Problemtypen abzudecken, bevor Sie online gehen. Der Kundenservice auf Unternehmensebene empfiehlt, das Kontext-Caching zu aktivieren, um die wiederholte Abrechnung von Systemaufforderungswörtern zu reduzieren.

  • Codeüberprüfung und automatisierte Tests: Verbinden Sie Deepseek-Reasoner (Think High-Modus) mit der CI/CD-Pipeline, um eine automatisierte Codeüberprüfung von Pull Requests durchzuführen, Unit-Tests zu generieren und Sicherheitslücken zu erkennen. Das 1M-Kontextfenster der V4-Serie kann die Kernquelldateien des gesamten Code-Warehouses zur dateiübergreifenden Analyse gleichzeitig lesen. Implementierungstipps: Der typische Tokenverbrauch in Codeüberprüfungsszenarien ist relativ hoch (2.000 bis 10.000 Token pro Datei). Es wird empfohlen, die Kosten durch inkrementelles Diff zu senken, anstatt den vollständigen Code einzureichen. In Modellen fehlen möglicherweise Best Practices für bestimmte Sprachframeworks. Daher wird empfohlen, Team-Codierungskonventionen in die Eingabeaufforderung einzufügen.

  • Massenproduktion von Inhalten und strukturierte Extraktion: Schlüsselfelder aus unstrukturierten Dokumenten (PDF, Word, gescannte Dokumente) extrahieren und im JSON-Format ausgeben. Es eignet sich für datenintensive Szenarien wie die Extraktion von Vertragsklauseln, die Eingabe von Rechnungsinformationen und die Analyse von Lebensläufen. Die V4-Serie bietet eine gute Leistung beim Verstehen von Post-OCR-Texten, weist jedoch immer noch Einschränkungen bei komplexen Tabellenstrukturen und handschriftlichen Inhalten auf. Implementierungstipp: Es wird empfohlen, lange Dokumente in 8K-16K-Token-Absätze zu unterteilen und sie separat zu verarbeiten, anstatt den vollständigen Text auf einmal einzureichen. Dies kann nicht nur die Token-Kosten kontrollieren, sondern auch die Wiederholungskosten reduzieren, wenn ein einzelner Absatz fehlschlägt.

  • Generierungs-Engine in der RAG-Anwendung: Fungiert als generative segmentierte Komponente der RAG-Pipeline, empfängt die abgerufenen Kontextfragmente und generiert die endgültige Antwort. Der niedrige Preis der DeepSeek-API macht sie besonders für Wissensdatenbank-Q&A-Anwendungen geeignet – solche Anwendungen haben normalerweise lange Eingaben (Zusammenführung von Suchergebnissen) und kurze Ausgaben (Antworten von wenigen Sätzen), sodass die Kostenstruktur natürlich günstig ist. Implementierungstipps: In RAG-Szenarien kann der Think-High-Modus normalerweise genauere Antworten generieren als der Non-Think-Modus, aber der Ausgabe-Token-Verbrauch steigt um 50–100 %, was ein spezifisches Testgleichgewicht zwischen Genauigkeit und Kosten erfordert.

  • Agent-Workflow und -Automatisierung: Verbinden Sie LLM mit externen Tools (Datenbankabfrage-API-Aufrufe, Dateivorgänge, Webseitenzugriff) über Funktionsaufrufe, um eine mehrstufige Aufgabenautomatisierung zu erstellen. Die V4-Serie verfügt über die beste Agentenfähigkeit unter den Open-Source-Modellen und die Erfolgsquote der einstufigen Aufgabenplanung ist 5–10 Prozentpunkte höher als die der Hauptkonkurrenten. Implementierungstipps: Das Agentenszenario muss eine Obergrenze für die Anzahl der Schritte (empfohlen 10–20 Schritte) und eine Timeout-Kontrolle implementieren, um zu verhindern, dass das Modell bei der Planung komplexer Aufgaben Endlosschleifen oder Token-Anstiege durchführt.

Nicht für Szenarien geeignet: Die DeepSeek-API eignet sich nicht für Echtzeitanwendungen, die eine Antwort im Millisekundenbereich erfordern (z. B. Online-Übersetzung, Sprachdialog in Echtzeit), da selbst der Nicht-Denkmodus eine Netzwerklatenz und Inferenzlatenz von über 200 ms aufweist. Es ist auch nicht für Szenarios des Markentextens geeignet, die extrem hohe Originalitätsanforderungen an den Ausgabestil stellen – das DeepSeek-Modell ist immer noch schwächer als die Claude-Serie in Bezug auf kreative Vielfalt und Stilkonsistenz. Darüber hinaus bestehen bei Produktionsszenarien, die Hochfrequenzanrufe (>100 U/min) erfordern und Frequenzkontrollbeschränkungen nicht akzeptieren können, Verfügbarkeitsrisiken, bevor das Unternehmen kontaktiert wird, um eine Quotenerweiterung zu erhalten.

Anwendbare Personen

Die Positionierung der DeepSeek API legt fest, dass ihre Kernbenutzergruppe „technische Teams und Einzelpersonen sind, die über Entwicklungskapazitäten verfügen, Kosteneffizienz anstreben und KI-Funktionen in ihre eigenen Systeme einbetten müssen“.

  • Einzelentwickler und unabhängige Entwickler: Über die API kann in persönlichen Projekten zu sehr geringen Kosten auf LLM-Funktionen zugegriffen werden. Geeignet zum Erstellen von Automatisierungsskripten, Assistenten für persönliche Wissensdatenbanken, Tools zur Codeunterstützung usw. Nicht für Grenzen geeignet: Wenn es sich bei den Anforderungen nur um Fragen und Antworten zu täglichen Gesprächen und nicht um eine programmatische Integration handelt, sollten Sie der Verwendung der kostenlosen Webversion von DeepSeek Vorrang vor der API geben – die API erfordert eine nutzungsbasierte Bezahlung, auch wenn das kostenlose Kontingent aufgebraucht ist. Es wird empfohlen, über grundlegende Python/Node.js-Entwicklungsfähigkeiten zu verfügen und zumindest HTTP-Anfragen und das JSON-Format zu verstehen.

  • Start-up-Teams und kleine und mittlere Technologieunternehmen: Der niedrige Preis der API ermöglicht es Start-up-Teams, KI-Funktionen in den frühen Phasen des Produkts zu monatlichen Kosten von mehreren zehn bis Hunderten von Yuan zu integrieren, ohne im Voraus in GPU-Hardware investieren zu müssen. Die Lauffähigkeit von V4-Flash auf einer einzigen Karte senkt auch die Hardware-Eintrittsbarriere für selbst gehostete Alternativen. Implementierungstipps: Es wird empfohlen, zunächst das Produktkonzept und die Benutzerakzeptanz im API-Modus zu überprüfen und dann auf der Grundlage des skalierten Kostenmodells zu entscheiden, ob auf eine selbstgehostete Bereitstellung umgestellt werden soll. Beachten Sie die Kompatibilitätsrisiken, die durch den API-Versionswechsel im Vertrag entstehen – die Deaktivierung des alten Endpunkts kann zu einer Dienstunterbrechung führen.

  • Unternehmensentwicklungsteam und Systemintegrator: Integrieren Sie LLM-Funktionen über APIs in interne Systeme (OA, CRM, ERP, Kundendienstplattform), um Prozessautomatisierung und Entscheidungsunterstützung zu erreichen. Unternehmensbenutzer sollten priorisieren, ob die Frequenzkontrollgrenzen der API den Spitzenbedarf der Unternehmen decken und ob die Datenschutzbestimmungen die Übertragung vertraulicher Informationen über die API zulassen. Kaufvoraussetzungen: Unternehmen sollten spezifische Szenarien und quantifizierbare Effizienzindikatoren für die KI-Integration klären, anstatt API-Kontingente zu erwerben, um „zuerst zur KI zu gelangen“. Es wird empfohlen, kostenlose Credits zu verwenden, um die technische Verifizierung während der PoC-Phase abzuschließen und dann in großen Mengen zu kaufen.

  • KI-Anwendungsentwickler und Agent-Builder: Nutzen Sie Funktionsaufruf- und Tool-Aufruffunktionen, um komplexe mehrstufige KI-Anwendungen zu erstellen. Diese Gruppe reagiert am empfindlichsten auf die Agentenfähigkeit, die Genauigkeit des Funktionsaufrufs und das lange Kontextfenster des Modells. Ungeeignete Grenze: Wenn das Anwendungsszenario das multimodale Verständnis einer großen Anzahl von Bildern/Audio/Videos umfasst, sind die visuellen Modellfunktionen der DeepSeek-API begrenzt und der Gemini-API oder der GPT-API sollte Vorrang eingeräumt werden. Wenn die Anwendung eine private Bereitstellung und strenge Anforderungen an die Datensouveränität erfordert, müssen die technischen Kosten sowie der Betriebs- und Wartungsaufwand der selbst gehosteten Lösung bewertet werden.

Zusammenfassung und Ausblick

Die zentrale Wettbewerbsfähigkeit der DeepSeek-API liegt nicht darin, das Modell mit der größten Anzahl an Parametern zu haben, sondern in der technischen Fähigkeit, „ausreichend gute Inferenzfunktionen zu den niedrigsten Kosten bereitzustellen“. Es verwandelt große Modell-APIs von „Luxusgütern“ in „tägliche Notwendigkeiten“ und ermöglicht unabhängigen Entwicklern sowie kleinen und mittleren Unternehmen die Integration erstklassiger Argumentationsfunktionen in ihre Produkte zu einem Preis von mehreren zehn Yuan pro Monat.

Aktueller Kernvorteil: Der API-Preis ist 10–100 Mal niedriger als der internationaler Konkurrenzprodukte, und dieser Preisunterschied basiert auf architektonischer Innovation und nicht auf der Geldverbrennung durch Subventionen und ist nachhaltig. Durch die Kompatibilität mit dem OpenAI-Protokoll sind die Migrationskosten nahezu Null, was ein Schlüsselfaktor für eine schnelle Akzeptanz durch Entwickler ist. Die V4-Serie hat in Bezug auf Argumentation, Codierung und Agentenfähigkeiten das beste Niveau von Open-Source-Modellen erreicht und ist für die meisten Produktionsszenarien „gut genug“. Funktionen wie Kontext-Caching und JSON-Schema dienen direkt der Umsetzung des Projekts und sind kein Marketing-Gimmick.

Aktuelle Haupteinschränkungen: Unzureichende Transparenz der API-Frequenzkontrolle und des SLA – der Beamte hat keine klare Obergrenze für die RPM/TPM-Leiter und das Verfügbarkeits-SLA bekannt gegeben, was potenzielle Risiken für wichtige Geschäftsszenarien birgt. Die Genauigkeit der weltweiten Wissensabdeckung des Modells ist immer noch geringer als die des Top-Closed-Source-Modells, und seine Leistung ist in vertikalen Szenarien instabil, die einen präzisen Faktenabruf erfordern (z. B. Unterstützung bei medizinischen Diagnosen, Abruf von rechtlichen Präzedenzfällen). Die Generierungsqualität von Szenen für kreatives Schreiben und Markentexte ist nicht so gut wie die der Claude-Serie und eignet sich nicht für Anwendungen, die einen extrem hohen Ausgabestil erfordern. Die Inferenzlatenz in Szenarien mit langem Kontext (>500 KB) ist immer noch hoch, und im Think Max-Modus kann in extremen Szenarien eine Latenz für das erste Wort von 5 bis 10 Sekunden erreicht werden.

Folgebeobachtungspunkte: Ob die API nach der Veröffentlichung der offiziellen Version von V4 eine detailliertere Frequenzsteuerungsklassifizierung und regionale Beschleunigungsknoten einführen wird (derzeit nur inländische Knoten); ob der Beamte die formellen SLA-Verpflichtungen und Vergütungsbedingungen der API veröffentlichen wird; ob die weltweite Wissensinjektionsstrategie des DeepSeek-Modells weiterhin optimiert wird, um die Lücke zum Closed-Source-Modell zu schließen; ob die Open-Source-Community eine ausgereifte Lösung rund um die ökologischen Tools (Überwachung, Caching, Lastausgleich) der DeepSeek-API entwickeln kann.

Beschaffungs- und Einführungsrisikobewertung: Für einzelne Entwickler und Start-up-Teams ist DeepSeek API derzeit die kostengünstigste LLM-API-Wahl – das kostenlose Kontingent reicht aus, um den Proof of Concept abzuschließen, die Kosten für Pay-as-you-go sind extrem niedrig und es besteht kein langfristiges Lock-in-Risiko (Sie können jederzeit wieder zur OpenAI API oder anderen kompatiblen Diensten wechseln). Für Unternehmensanwender wird empfohlen, zunächst die Modellfähigkeiten und die API-Stabilität in unkritischen Prozessen zu überprüfen (interne Wissensfragen und -antworten, Erstellung von Berichtsentwürfen, codegestützte Überprüfung) und dann schrittweise auf kundenorientierte Produktionsprozesse auszuweiten. In Compliance-sensiblen Branchen sollten Sie sich auf die Bestätigung der Datenschutzbestimmungen konzentrieren, bevor Sie die API verwenden. So stellen Sie sicher, dass der an die API gesendete Text nicht für sekundäres Training des Modells verwendet wird und dass er die Compliance-Anforderungen für den Datenexport erfüllt. Wenn das API-Aufrufvolumen die monatliche Gebühr von 5.000 Yuan übersteigt, wird empfohlen, eine TCO-Bewertung der privatisierten Bereitstellung einzuleiten und die Aktualisierungsbedingungen der Modellversion (einschließlich der Übergangsfrist für den Ausfall alter Endpunkte) in den Beschaffungsvertrag aufzunehmen, um das Risiko einer Betriebsunterbrechung zu vermeiden.

Verwandte Tools: hugging-face, replicate

Versionsinfo

  • DeepSeek-V4-Pro-Vorschau (API) :Das V4-Preview-Flaggschiffmodell ist über die API offen, verfügt über 1,6T Gesamtparameter (ca. 49B aktiviert), unterstützt 1M Kontextfenster und die hybride Aufmerksamkeitsarchitektur reduziert die Kosten für lange Sequenzbegründungen erheblich.
  • DeepSeek-V4-Flash-Vorschau (API) :Das kostengünstige Modell der V4-Vorschauversion ist über die API offen, verfügt über 284B Parameter (ca. 13B aktiviert), kann auf einer einzelnen Karte A100 ausgeführt werden und ist eine wirtschaftliche Wahl für Hochfrequenzanrufe.
  • DeepSeek-V3.2 (API) :Die allgemeine Modell-API der Version 3.2 ist online, Leistungsbenchmarks mit modernsten Closed-Source-Modellen und die Wissensdatenbank wurde auf Mai 2025 aktualisiert.
  • DeepSeek-V3.1 (API) :Die API des hybriden Argumentationsarchitekturmodells ist online und unterstützt schnelle Reaktionen und Deep-Thinking-Moduswechsel mit einem Kontext von 128 KB.
  • DeepSeek-R1-0528 (API) :R1 verfügt über eine wesentlich verbesserte API mit deutlich verbesserten Argumentationsfunktionen und einer deutlich verbesserten Leistung bei mathematischen Benchmarks.
  • DeepSeek-R1 (API) :Die schlussfolgerungsspezifische Flaggschiff-Modell-API ist online, basiert auf Reinforcement Learning und verfügt über herausragende Mathematik-, Programmier- und logische Denkfähigkeiten.
  • DeepSeek-V3 (API) :Die 671B MoE-Basismodell-API ist online und legt den Grundstein für nachfolgende Serien.

Benutzerbewertungen

  • Bewertungen werden geladen...