Даже самые продвинутые языковые модели (LLM) могут допускать ошибки — от фактических неточностей до «галлюцинаций», когда модель уверенно выдает вымышленные данные. Для выявления и анализа таких ошибок существует инструмент Cleanlab TLM (Trustworthy Language Model), который можно интегрировать с MLflow для отслеживания и оценки надежности ответов ИИ.
А для того, чтобы познакомиться с нейросетями для жизни и карьеры есть бесплатный онлайн-практикум от Зерокодера!
Что такое Cleanlab TLM
Cleanlab TLM — это инструмент, который анализирует входные данные (промпт) и ответ модели, чтобы вычислить оценку надежности (trustworthiness_score). Это позволяет автоматически выявлять потенциально ошибочные или ненадежные ответы без необходимости в ручной проверке. TLM также может предоставлять объяснения своих оценок, что помогает лучше понять причины низкой надежности.

- ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросети DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ
- Где и как применять? Потестируем модель после установки на разных задачах
- Как дообучить модель под себя?
Интеграция с MLflow
MLflow — это платформа для управления жизненным циклом моделей машинного обучения. С помощью MLflow Tracing можно записывать взаимодействия с LLM, включая промпты и ответы.
Интеграция Cleanlab TLM с MLflow позволяет систематически логировать и отслеживать оценки надежности ответов, анализировать и визуализировать результаты в интерфейсе MLflow, автоматически выявлять и помечать потенциально ошибочные ответы.
Как начать использовать
1. Установите необходимые библиотеки: (bash) pip install mlflow openai cleanlab-tlm —upgrade
2. Для работы понадобятся API-ключи OpenAI и Cleanlab TLM. Их можно установить как переменные окружения или ввести вручную:
import os
from getpass import getpass
openai_api_key = os.getenv("OPENAI_API_KEY") or getpass("Введите OpenAI API ключ: ")
cleanlab_tlm_api_key = os.getenv("CLEANLAB_TLM_API_KEY") or getpass("Введите Cleanlab TLM API ключ: ")
os.environ["OPENAI_API_KEY"] = openai_api_key
os.environ["CLEANLAB_TLM_API_KEY"] = cleanlab_tlm_api_key3. Запустите локальный сервер MLflow для отслеживания экспериментов:
mlflow server —host 127.0.0.1 —port 8080
Интерфейс будет доступен по адресу http://localhost:8080.
4. Пример генерации ответов на вопросы и логирования их в MLflow:
import mlflow
from openai import OpenAI
client = OpenAI()
questions = [
"What is the capital of France?",
"How many seconds are in 100 years?",
"When was the Declaration of Independence signed?"
]
mlflow.set_tracking_uri("http://localhost:8080")
mlflow.set_experiment("LLM Evaluation with TLM")
for question in questions:
with mlflow.start_run():
response = client.chat.completions.create(
messages=[{"role": "user", "content": question}],
model="gpt-4"
)
answer = response.choices[0].message.content
mlflow.log_param("question", question)
mlflow.log_param("answer", answer)5. После получения ответов можно оценить их надежность:
from cleanlab.tlm import TLM
tlm = TLM()
for question, answer in zip(questions, answers):
score = tlm.get_trustworthiness_score(prompt=question, response=answer)
mlflow.log_metric("trustworthiness_score", score["trustworthiness_score"])Анализ результатов
В интерфейсе MLflow можно просматривать промпты и ответы моделей, оценки надежности (trustworthiness_score), сравнение различных запусков и параметров. Это позволяет быстро выявлять ответы с низкой надежностью и анализировать причины таких результатов.
Для более подробной информации и примеров вы можете ознакомиться с официальным руководством.
- Освой нейросеть Perplexity и узнай, как пользоваться функционалом остальных ИИ в одном
- УЧАСТВОВАТЬ ЗА 0 РУБ.
- Расскажем, как получить подписку
- ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросеть DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ
