HuggingFace hosts 500K+ models, 100K+ datasets, and Spaces for demo deployment. Use Colab with free GPUs for inference.
pip install transformers torch diffusers accelerate
Quick inference for common tasks without boilerplate.
from transformers import pipeline
# Sentiment
classifier = pipeline("sentiment-analysis")
result = classifier("I love AI agents!")
print(result)
# NER
ner = pipeline("ner")
print(ner("John works at Microsoft in Redmond."))
# Question Answering
qa = pipeline("question-answering")
result = qa(question="What is AI?", context="AI is the simulation of human intelligence.")
print(result)
# Image generation
from diffusers import StableDiffusionPipeline
pipe = StableDiffusionPipeline.from_pretrained("runwayml/stable-diffusion-v1-5")
image = pipe("A robot writing code").images[0]
Tokenizers convert text to token IDs and back. Different models use different tokenizers.
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("bert-base-uncased")
tokens = tokenizer("Hello, how are you?", return_tensors="pt")
print(tokenizer.decode(tokens["input_ids"][0]))
Use 8-bit or 4-bit quantization to run large models on limited hardware.
from transformers import BitsAndBytesConfig
quant_config = BitsAndBytesConfig(load_in_4bit=True)
model = AutoModelForCausalLM.from_pretrained(
"meta-llama/Llama-2-7b-chat-hf",
quantization_config=quant_config
)