Claude w firmie: jak zacząć od bezpiecznego zadania
Temat: Anthropic AI
Własną aplikację GenAI na Claude API zaczyna się od jednego zadania, którego wynik da się sprawdzić, i od zestawu testów — nie od wyboru najmocniejszego modelu. Ten wpis jest dla zespołu IT i twórców, którzy budują na API asystenta w systemie firmy, ekstrakcję danych z dokumentów albo agenta z narzędziami. Opisuje wybór modelu, konto i klucze, dane w API, testy i utrzymanie. Stan na 6.10.2026.
Jeśli pytanie brzmi, który plan Claude kupić pracownikom (Team czy Enterprise) i czym aplikacja Claude różni się od Claude Code, odpowiedź jest w poradniku: co to jest Claude. Kiedy aplikacja na modelu jest asystentem, a kiedy agentem z narzędziami, wyjaśnia poradnik o agentach AI dla firm.
Wybierz zadanie z wynikiem, który da się sprawdzić
Dobry pierwszy projekt na API ma jasne wejście i wynik, który program albo człowiek oceni bez dyskusji o gustach: klasyfikacja zgłoszeń do kolejek, wyciągnięcie pól z faktury do JSON, odpowiedź na pytanie z cytatem z dokumentu. Nie zaczynaj od decyzji prawnej, medycznej lub finansowej, której pomyłka ma trudne do odwrócenia skutki.
Oddziel przygotowanie wyniku od działania. Model może zaproponować kategorię albo szkic odpowiedzi, ale zapis w systemie, wysłanie wiadomości czy zmiana statusu wymagają osobnej kontroli w kodzie aplikacji.
| Element projektu | Co trzeba zapisać |
|---|---|
| Zadanie | Jednoznaczny początek i koniec pracy |
| Wejście | Dozwolone źródła i dane, których nie wolno wysłać do API |
| Wynik | Format (np. schemat JSON) i kryteria poprawności |
| Kontrola | Test automatyczny, osoba zatwierdzająca albo oba |
| Eskalacja | Sytuacje, w których aplikacja oddaje sprawę człowiekowi |
Jeśli poprawność zależy od faktów, każ modelowi wskazywać źródło. Funkcja Citations pokazuje fragmenty dokumentu, na których oparto odpowiedź, więc odbiorca może je porównać.
Wybierz model na podstawie testów
Przegląd modeli Anthropic (stan na 6.10.2026) radzi zacząć od Claude Opus 5.5, a po Fable 5.1 sięgać przy najtrudniejszym rozumowaniu albo wtedy, gdy testy na Opus 5.5 z wyższym poziomem effort nadal nie wystarczają.
| Model | Identyfikator w API | Do czego według Anthropic | Cena wejście / wyjście (USD za 1 mln tokenów) |
|---|---|---|---|
| Fable 5.1 | claude-fable-5-1 | wymagające rozumowanie i długie zadania agentowe | 10 / 50 |
| Opus 5.5 | claude-opus-5-5 | długie kodowanie agentowe i praca z wiedzą; punkt startu | 4 / 20 |
| Sonnet 5.5 | claude-sonnet-5-5 | najlepsze połączenie szybkości i jakości | 2 / 10 |
| Haiku 4.5 | claude-haiku-4-5-20251001 | najszybszy; wycofanie nie wcześniej niż 15.10.2026 | 1 / 5 |
Ceny według tej samej strony i cennika API. Batch API kosztuje o połowę mniej, a odczyt z pamięci podręcznej promptu (prompt caching) to ułamek ceny wejścia. Przy dużym wolumenie te dwie funkcje często zmieniają rachunek bardziej niż wybór modelu.
Każdy identyfikator to przypięta wersja (snapshot), więc model nie zmieni się pod aplikacją bez Waszej decyzji. Przy przejściu ze starszych modeli sprawdź przewodnik migracji: od generacji 4.7 parametry temperature, top_p i top_k z wartością inną niż domyślna kończą się błędem 400.
Dobierz funkcje API do zadania
| Potrzeba | Funkcja Claude API | Na co uważać |
|---|---|---|
| Wynik zawsze w tym samym formacie | Structured outputs (JSON według schematu) | schemat jest przechowywany do 24 godzin od ostatniego użycia |
| Model ma wywołać funkcję Waszego systemu | tool use (narzędzia po stronie klienta) | parametry od modelu sprawdza kod, który wykonuje operację |
| Ten sam długi kontekst w wielu wywołaniach | prompt caching | pamięć podręczna jest osobna dla każdego workspace’u |
| Duży wolumen bez odpowiedzi na żywo | Batch API | wyniki przychodzą asynchronicznie |
| Narzędzia z istniejącego serwera MCP | MCP connector | funkcja w becie |
| Własny agent z pętlą, narzędziami i uprawnieniami | Agent SDK (Python, TypeScript) | w produkcie dla klientów logowanie kluczem API, nie kontem claude.ai |
Pełną listę funkcji, ich status (stabilna albo beta) i dostępność w chmurach zbiera przegląd funkcji API. Funkcja w becie nie jest gwarantowana do pracy produkcyjnej i może się zmienić w sposób niezgodny wstecz. Model chętnie odda JSON „prawie” zgodny ze schematem, a „prawie” to słowo, którego parser nie zna. Dlatego przy danych do systemu włącz structured outputs i waliduj wynik w kodzie.
Konto, workspace’y i klucze
Organizacja w Claude Console dzieli się na workspace’y. Dokumentacja podpowiada osobne workspace’y dla środowisk: rozwój, testy i produkcja. Każdy workspace poza domyślnym może mieć własny miesięczny limit wydatków i limity zapytań, a klucz API przypisany do workspace’u widzi tylko jego zasoby: pliki, batche i skille.
Dla aplikacji produkcyjnej ważny jest rodzaj klucza. Klucz osobisty przestaje działać, gdy jego właściciel zostanie usunięty z workspace’u, a przy usunięciu z organizacji jest archiwizowany. Klucz konta serwisowego działa dalej, nawet gdy odejdzie osoba, która go utworzyła. Produkcja powinna więc korzystać z konta serwisowego, a organizacja i klucze należeć do firmy, nie do partnera, który buduje aplikację.
Dane w API: trening, retencja i ZDR
API to produkt komercyjny. Anthropic działa w nim jako podmiot przetwarzający, a firma jest administratorem danych. Według zasad treningu dane z produktów komercyjnych nie są używane do trenowania modeli bez wyraźnej zgody firmy. Firma nadal odpowiada za to, jakie dane wysyła i w jakim celu.
Retencję opisuje strona API i retencja danych. Standardowo API usuwa wejścia i wyjścia w ciągu 30 dni (zasady dla produktów komercyjnych). Zero Data Retention (ZDR) włącza zespół sprzedaży Anthropic, osobno dla każdej organizacji. ZDR nie obejmuje części funkcji, m.in. Files API, Batch API, wykonywania kodu i MCP connector. Modele Fable i Mythos wymagają 30-dniowej retencji i bez wyraźnej zgody Anthropic nie są dostępne w ZDR. Jeśli umowa wymaga ZDR, funkcje i model wybierz po przeczytaniu tej tabeli, nie przed.
Claude API jest też dostępne przez Amazon Bedrock, Google Cloud i Microsoft Foundry. Tam część funkcji działa inaczej albo wcale, a w Bedrock i Google Cloud za retencję odpowiada operator chmury. Porównanie kanałów jest w poradniku o Claude.
Testuj na przypadkach trudnych
Zestaw testów powinien zawierać poprawne materiały, niepełne dane, sprzeczne instrukcje, pytania wykraczające poza zakres i dokument z tekstem udającym polecenie dla modelu. Oczekuj, że aplikacja rozpozna brak podstaw albo przekaże sprawę dalej. Płynna i pewna odpowiedź nie jest równoznaczna z poprawnością.
| Przypadek | Oczekiwane zachowanie | Dowód |
|---|---|---|
| Pełny dokument | Wynik zgodny z kryteriami i schematem | Test automatyczny i lista sprawdzeń |
| Brak kluczowej informacji | Jawne wskazanie braku, bez wymyślonej wartości | Zapis odpowiedzi |
| Sprzeczne źródła | Pokazanie konfliktu | Cytaty z obu fragmentów |
| Prośba poza zakresem | Odmowa lub eskalacja | Właściwy kanał pomocy |
| Polecenie ukryte w dokumencie | Traktowanie go jak danych | Brak nieplanowanego wywołania narzędzia |
Anthropic opisuje budowę takiego zestawu w przewodniku tworzenie kryteriów i testów. Przykład syntetyczny: w 40 przypadkach testowych 29 wyników zaakceptowano bez zmian, 8 po poprawkach, a 3 odrzucono. Udział wyników bez poprawek wynosi 72,5%, a zakończenie pracy z poprawką 92,5%. Koszt ośmiu korekt i ryzyko trzech odrzuceń trzeba ocenić oddzielnie.
Mierz czas od wejścia do zatwierdzonego wyniku, a nie tylko czas odpowiedzi API. Rejestruj rodzaj błędu: fakt, format, brak źródła, ujawnienie danych albo niezastosowanie instrukcji.
Utrzymanie: zmiana modelu, operacje i awarie
Modele mają cykl życia. Według strony o wycofywaniu modeli Anthropic uprzedza o wycofaniu modelu udostępnionego publicznie co najmniej 60 dni wcześniej, mailem i w dokumentacji. Przykład z 30.09.2026: Claude Sonnet 4.5 ma zostać wyłączony 30.11.2026, a zalecanym następcą jest Sonnet 5.5. Eksport użycia w Console pokazuje zużycie według klucza i modelu, więc łatwo znaleźć aplikacje na starym modelu. Przed zmianą identyfikatora puść ten sam zestaw testów na nowym modelu.
Operacja, która zmienia dane w systemie, powinna mieć identyfikator i bezpiecznie obsługiwać ponowienie po przerwanym połączeniu, żeby awaria sieci nie zapisała zgłoszenia dwa razy. W logach zapisuj identyfikator zapytania, wersję modelu i wynik testów, a nie sekrety i pełne dane klientów. Przećwicz też niedostępność API: zadanie musi mieć ręczną ścieżkę zastępczą, a po powrocie usługi aplikacja nie może powtórzyć działań wykonanych już przez człowieka.
Raz w miesiącu sprawdź małą losową próbkę zaakceptowanych wyników. Same zgłoszone błędy pomijają odpowiedzi, których nikt nie rozpoznał jako niepoprawne. Pilotaż zakończ decyzją: rozszerzyć zakres, poprawić aplikację albo zrezygnować. Te same kryteria dla aplikacji na modelach OpenAI opisuje wpis ChatGPT w firmie: od pomysłu do kontrolowanego użycia.
- Modele i LLM
- Bezpieczeństwo
- Strategia
