{/ Эта страница автоматически создается на основе файла SKILL.md навыка с помощью сайта site/scripts/generate-skill-docs.py. Редактируйте исходный код SKILL.md, а не эту страницу. /}

Цветность

База данных с открытым исходным кодом для встраивания приложений искусственного интеллекта. Храните вложения и метаданные, выполняйте векторный и полнотекстовый поиск, фильтруйте по метаданным. Простой 4-функциональный API. Масштабируется от ноутбуков до производственных кластеров. Используйте для семантического поиска, приложений RAG или поиска документов. Лучше всего подходит для локальной разработки и проектов с открытым исходным кодом.

Метаданные навыков

Источник Необязательно — установите с помощью hermesskills installofficial/mlops/chroma
Путь optional-skills/mlops/chroma
Версия 1.0.0
Автор Исследование оркестра
Лицензия Массачусетский технологический институт
Зависимости chromadb, преобразователи предложений
Платформы Linux, MacOS, Windows
Теги RAG, Chroma, Векторная база данных, Вложения, Семантический поиск, Открытый исходный код, Самостоятельное размещение, Поиск документов, Фильтрация метаданных

Ссылка: полная версия SKILL.md:::информация

Ниже приведено полное определение навыка, которое Гермес загружает при активации этого навыка. Это то, что агент видит в качестве инструкций, когда навык активен.

Chroma — база данных для встраивания с открытым исходным кодом

Собственная база данных AI для создания приложений LLM с использованием памяти.

Когда использовать Chroma

Используйте цветность, когда: - Создание приложений RAG (генерация с расширенным поиском) - Нужна локальная/автономная база данных векторов - Хотите решение с открытым исходным кодом (Apache 2.0) - Прототипирование в блокнотах. - Семантический поиск по документам - Хранение вложений с метаданными

Показатели: - 24 300+ звезд GitHub - 1900+ вилок - v1.3.3 (стабильные, еженедельные выпуски) - Лицензия Apache 2.0

Вместо этого используйте альтернативы: - Сосновая шишка: управляемое облако, автоматическое масштабирование. - FAISS: чистый поиск по сходству, без метаданных. - Weaviate: производственная база данных машинного обучения. - Qdrant: высокая производительность, на основе Rust.

Быстрый старт

Установка

# Python
pip install chromadb

# JavaScript/TypeScript
npm install chromadb @chroma-core/default-embed

Базовое использование (Python)

import chromadb

# Create client
client = chromadb.Client()

# Create collection
collection = client.create_collection(name="my_collection")

# Add documents
collection.add(
    documents=["This is document 1", "This is document 2"],
    metadatas=[{"source": "doc1"}, {"source": "doc2"}],
    ids=["id1", "id2"]
)

# Query
results = collection.query(
    query_texts=["document about topic"],
    n_results=2
)

print(results)

Основные операции

1. Создать коллекцию

# Simple collection
collection = client.create_collection("my_docs")

# With custom embedding function
from chromadb.utils import embedding_functions

openai_ef = embedding_functions.OpenAIEmbeddingFunction(
    api_key="your-key",
    model_name="text-embedding-3-small"
)

collection = client.create_collection(
    name="my_docs",
    embedding_function=openai_ef
)

# Get existing collection
collection = client.get_collection("my_docs")

# Delete collection
client.delete_collection("my_docs")

2. Добавьте документы

# Add with auto-generated IDs
collection.add(
    documents=["Doc 1", "Doc 2", "Doc 3"],
    metadatas=[
        {"source": "web", "category": "tutorial"},
        {"source": "pdf", "page": 5},
        {"source": "api", "timestamp": "2025-01-01"}
    ],
    ids=["id1", "id2", "id3"]
)

# Add with custom embeddings
collection.add(
    embeddings=[[0.1, 0.2,...], [0.3, 0.4,...]],
    documents=["Doc 1", "Doc 2"],
    ids=["id1", "id2"]
)

3. Запрос (поиск по сходству)

# Basic query
results = collection.query(
    query_texts=["machine learning tutorial"],
    n_results=5
)

# Query with filters
results = collection.query(
    query_texts=["Python programming"],
    n_results=3,
    where={"source": "web"}
)

# Query with metadata filters
results = collection.query(
    query_texts=["advanced topics"],
    where={
        "$and": [
            {"category": "tutorial"},
            {"difficulty": {"$gte": 3}}
        ]
    }
)

# Access results
print(results["documents"])      # List of matching documents
print(results["metadatas"])      # Metadata for each doc
print(results["distances"])      # Similarity scores
print(results["ids"])            # Document IDs

4. Получите документы

# Get by IDs
docs = collection.get(
    ids=["id1", "id2"]
)

# Get with filters
docs = collection.get(
    where={"category": "tutorial"},
    limit=10
)

# Get all documents
docs = collection.get()

5. Обновить документы

# Update document content
collection.update(
    ids=["id1"],
    documents=["Updated content"],
    metadatas=[{"source": "updated"}]
)

6. Удаление документов

# Delete by IDs
collection.delete(ids=["id1", "id2"])

# Delete with filter
collection.delete(
    where={"source": "outdated"}
)

Постоянное хранилище

# Persist to disk
client = chromadb.PersistentClient(path="./chroma_db")

collection = client.create_collection("my_docs")
collection.add(documents=["Doc 1"], ids=["id1"])

# Data persisted automatically
# Reload later with same path
client = chromadb.PersistentClient(path="./chroma_db")
collection = client.get_collection("my_docs")

Функции внедрения

По умолчанию (Преобразователи предложений)

# Uses sentence-transformers by default
collection = client.create_collection("my_docs")
# Default model: all-MiniLM-L6-v2

OpenAI

from chromadb.utils import embedding_functions

openai_ef = embedding_functions.OpenAIEmbeddingFunction(
    api_key="your-key",
    model_name="text-embedding-3-small"
)

collection = client.create_collection(
    name="openai_docs",
    embedding_function=openai_ef
)

Обнимающее лицо

huggingface_ef = embedding_functions.HuggingFaceEmbeddingFunction(
    api_key="your-key",
    model_name="sentence-transformers/all-mpnet-base-v2"
)

collection = client.create_collection(
    name="hf_docs",
    embedding_function=huggingface_ef
)

Пользовательская функция внедрения

from chromadb import Documents, EmbeddingFunction, Embeddings

class MyEmbeddingFunction(EmbeddingFunction):
    def __call__(self, input: Documents) -> Embeddings:
        # Your embedding logic
        return embeddings

my_ef = MyEmbeddingFunction()
collection = client.create_collection(
    name="custom_docs",
    embedding_function=my_ef
)

Фильтрация метаданных

# Exact match
results = collection.query(
    query_texts=["query"],
    where={"category": "tutorial"}
)

# Comparison operators
results = collection.query(
    query_texts=["query"],
    where={"page": {"$gt": 10}}  # $gt, $gte, $lt, $lte, $ne
)

# Logical operators
results = collection.query(
    query_texts=["query"],
    where={
        "$and": [
            {"category": "tutorial"},
            {"difficulty": {"$lte": 3}}
        ]
    }  # Also: $or
)

# Contains
results = collection.query(
    query_texts=["query"],
    where={"tags": {"$in": ["python", "ml"]}}
)

Интеграция с LangChain

from langchain_chroma import Chroma
from langchain_openai import OpenAIEmbeddings
from langchain.text_splitter import RecursiveCharacterTextSplitter

# Split documents
text_splitter = RecursiveCharacterTextSplitter(chunk_size=1000)
docs = text_splitter.split_documents(documents)

# Create Chroma vector store
vectorstore = Chroma.from_documents(
    documents=docs,
    embedding=OpenAIEmbeddings(),
    persist_directory="./chroma_db"
)

# Query
results = vectorstore.similarity_search("machine learning", k=3)

# As retriever
retriever = vectorstore.as_retriever(search_kwargs={"k": 5})

Интеграция LlamaIndex

from llama_index.vector_stores.chroma import ChromaVectorStore
from llama_index.core import VectorStoreIndex, StorageContext
import chromadb

# Initialize Chroma
db = chromadb.PersistentClient(path="./chroma_db")
collection = db.get_or_create_collection("my_collection")

# Create vector store
vector_store = ChromaVectorStore(chroma_collection=collection)
storage_context = StorageContext.from_defaults(vector_store=vector_store)

# Create index
index = VectorStoreIndex.from_documents(
    documents,
    storage_context=storage_context
)

# Query
query_engine = index.as_query_engine()
response = query_engine.query("What is machine learning?")

Режим сервера

# Run Chroma server
# Terminal: chroma run --path./chroma_db --port 8000

# Connect to server
import chromadb
from chromadb.config import Settings

client = chromadb.HttpClient(
    host="localhost",
    port=8000,
    settings=Settings(anonymized_telemetry=False)
)

# Use as normal
collection = client.get_or_create_collection("my_docs")

Лучшие практики

  1. Использовать постоянный клиент – не терять данные при перезапуске.
  2. Добавить метаданные – включает фильтрацию и отслеживание.
  3. Пакетные операции – добавление нескольких документов одновременно.
  4. Выберите правильную модель встраивания – баланс скорости и качества.
  5. Используйте фильтры – сузьте пространство поиска.
  6. Уникальные идентификаторы. Избегайте коллизий.
  7. Регулярное резервное копирование. Скопируйте каталог chroma_db.
  8. Отслеживание размера коллекции. При необходимости увеличивайте масштаб.
  9. Протестируйте функции внедрения – обеспечьте качество
  10. Используйте режим сервера для производства – лучше для многопользовательской работы.

Производительность

Операция Задержка Заметки
Добавить 100 документов ~1–3 с С вложением
Запрос (топ-10) ~50-200мс Зависит от размера коллекции
Фильтр метаданных ~10–50 мс Быстро при правильной индексации

Ресурсы