steel-browser
steel-dev/cli
Cloud browser for AI agents: JavaScript rendering, form filling, CAPTCHA bypass, and multi-step web automation.
What is steel-browser?
Steel is a cloud browser infrastructure that executes JavaScript, maintains session state, and handles anti-bot measures. Use it when WebFetch or curl fail—for JS-rendered pages, form submission, login flows, screenshots, PDFs, and interactive navigation tasks.
- Scrape JS-rendered pages and extract content as Markdown or HTML
- Take screenshots and generate PDFs of live pages
- Fill forms, click buttons, and navigate multi-step workflows
- Maintain persistent session state across interactions
- Bypass CAPTCHA and anti-bot protections with stealth mode
- Execute custom JavaScript and extract structured data
How to install steel-browser
npx skills add null --skill steel-browser- Steel CLI installed (via curl setup script)
- Steel API key (obtained by running `steel login` and clicking auth link)
- Bash environment with curl available
How to use steel-browser
- 1.Run `steel --version` to check if Steel CLI is installed; if not, run the install script from setup.steel.dev
- 2.Execute `steel login` and click the authentication link provided to obtain your API key
- 3.Verify setup with `steel scrape https://example.com`
- 4.For simple content extraction, use `steel scrape <url>` (returns Markdown by default)
- 5.For interactive tasks: start a session with `steel browser start --session <name>`, navigate with `steel browser navigate <url>`, snapshot with `steel browser snapshot -i`, interact using element refs (@eN), and stop with `steel browser stop --session <name>`
- 6.Use `steel browser batch` to combine multiple commands (navigate, fill, click, snapshot) in one call for efficiency
- 7.Always re-snapshot after navigation or DOM changes since element refs expire
Use cases
- Log into a website, navigate to a dashboard, and extract data across multiple pages
- Scrape a JavaScript-heavy SPA that returns empty HTML to simple GET requests
- Fill out and submit a form, then capture a screenshot of the confirmation page
- Bypass bot detection on a protected site using stealth mode
- Automate a multi-step checkout or registration flow with form filling and button clicks
- AI agents automating web tasks
- Developers building browser automation workflows
- Teams needing to extract data from JS-rendered or protected sites
- Anyone automating login flows or form submissions at scale
steel-browser FAQ
Use `steel scrape` for one-shot content extraction from any URL (returns Markdown). Use `steel browser` for multi-step interactions, form filling, login flows, or pages requiring JavaScript execution and session persistence.
Start a session with `steel browser start --session <name> --stealth` to enable stealth mode, which bypasses common bot-detection measures.
Element refs like @e1, @e3 are identifiers returned by `steel browser snapshot -i`. They expire after any navigation or DOM change, so you must run a fresh snapshot before using new refs.
Yes, use `steel browser batch` to combine commands (navigate, fill, click, snapshot) in a single CLI call, reducing overhead and improving performance.
Use `steel browser snapshot -i` to get element refs, then use `steel browser get text @eN`, `steel browser get html @eN`, or `steel browser get attr @eN <attr>` to extract content.
Full instructions (SKILL.md)
Source of truth, from steel-dev/cli.
name: steel-browser allowed-tools:
- "Bash(steel:*)" description: >- Use this skill for any web task where WebFetch or curl would fail or be insufficient — pages that require JavaScript to render, forms to fill and submit, screenshots or PDFs of live pages, CAPTCHA/bot-protection bypass, login flows, and multi-step browser navigation with persistent session state. WebFetch returns empty HTML for JS-rendered pages; this skill runs a real cloud browser that executes JavaScript, maintains cookies, clicks buttons, and handles anti-bot measures. Trigger when the user wants you to actually perform a web task (visit, interact, extract, capture) rather than just write code for it. Skip only for: static pages a simple GET can fetch, localhost or private-network targets, writing browser automation code the user will run themselves, or conceptual questions about browser tools.
Steel
Cloud browser infrastructure for AI agents. Steel gives your agent a real browser that can navigate pages, fill forms, solve CAPTCHAs, and extract content.
If Steel is not installed yet, execute the setup steps below autonomously. Only ask the user to do one thing: click the authentication link.
OBJECTIVE: Install the Steel CLI, authenticate, and verify everything works.
DONE WHEN: steel scrape https://example.com returns page content successfully.
Setup
Step 1: Install Steel CLI
Check if steel is already available:
steel --version
If the command is not found, install it:
curl -sSf https://setup.steel.dev/install.sh | sh
export PATH="$HOME/.steel/bin:$PATH"
Step 2: Authenticate
If STEEL_API_KEY is already set in the environment, skip this step.
Otherwise, run:
steel login
This will print a URL. Ask the user to click the link to complete authentication. Wait for the command to finish — it will print "Authentication successful" when the user has approved.
Step 3: Verify
steel scrape https://example.com
This should return Markdown content. If it does, setup is complete.
Choose the right tool
| Task | Tool |
|---|---|
| Extract text/HTML from a page | steel scrape <url> |
| Take a screenshot | steel screenshot <url> |
| Generate a PDF | steel pdf <url> |
| Multi-step interaction, login, forms, JS-heavy pages | steel browser session |
| Anti-bot / CAPTCHA sites | steel browser --stealth session |
Start with steel scrape when you only need page content. Escalate to steel browser when the page requires interaction or JavaScript rendering.
API tools (one-shot, no session needed)
# Scrape — returns Markdown by default (use --json flag for structured output)
steel scrape https://example.com
steel scrape https://example.com --format html
steel scrape https://example.com --use-proxy
# Screenshot
steel screenshot https://example.com
steel screenshot https://example.com --full-page
# PDF
steel pdf https://example.com
Interactive browser session
Core workflow
- Start a named session
- Navigate to the target URL
- Snapshot to get page state and element refs
- Interact using
@eNrefs from the snapshot - Re-snapshot after every navigation or DOM change (refs expire)
- Stop the session when done
steel browser start --session my-task --session-timeout 3600000
steel browser navigate https://example.com --session my-task
steel browser snapshot -i --session my-task
steel browser fill @e3 "search term" --session my-task
steel browser click @e7 --session my-task
steel browser wait --load networkidle --session my-task
steel browser snapshot -i --session my-task
steel browser stop --session my-task
Rules:
- Always use the same
--session <name>on every command. - Never use an
@eNref without a fresh snapshot — refs expire after navigation or DOM changes. - Prefer element refs from
snapshot -iover CSS selectors. Use-cfor large DOMs,-d 3to limit depth. - Use
batchto combine multiple commands into a single invocation for efficiency.
Batch execution
Run multiple commands in one CLI call. Each quoted string is one command.
# Navigate and snapshot in one call
steel browser batch "navigate https://example.com" "snapshot -i" --session my-task
# Action + re-snapshot (no separate snapshot call needed)
steel browser batch "click @e3" "snapshot -i" --session my-task
# Multiple actions without intermediate snapshots
steel browser batch "fill @e1 Seoul" "fill @e2 Tokyo" "click @e5" --session my-task
# Stop on first error with --bail
steel browser batch "click @e3" "snapshot -i" --session my-task --bail
Use batch when:
- You need to snapshot after an action (most common case)
- You are filling multiple form fields in sequence
- You want to reduce the number of CLI invocations
Use separate commands when you need to read the output of one command before deciding the next.
Session lifecycle
steel browser start --session <name> --session-timeout 3600000
steel browser start --session <name> --stealth
steel browser start --session <name> --proxy <url>
steel browser sessions
steel browser live --session <name>
steel browser stop --session <name>
steel browser stop --all
Navigation and inspection
steel browser navigate <url> --session <name>
steel browser snapshot # full accessibility tree
steel browser snapshot -i # interactive elements + refs
steel browser snapshot -c # compact output
steel browser snapshot -i -c -d 3 # combine flags
steel browser get url --session <name>
steel browser get title --session <name>
steel browser get text @e1 --session <name>
steel browser back --session <name>
steel browser forward --session <name>
steel browser reload --session <name>
Interaction
steel browser click @e1 --session <name>
steel browser dblclick @e1 --session <name>
steel browser fill @e2 "value" --session <name>
steel browser type @e2 "value" --delay 50 --session <name>
steel browser press Enter --session <name>
steel browser press Control+a --session <name>
steel browser hover @e1 --session <name>
steel browser select @e1 "option" --session <name>
steel browser scroll down 500 --session <name>
steel browser scrollintoview @e1 --session <name>
steel browser drag @e1 @e2 --session <name>
steel browser tab new --session <name>
steel browser tab switch 2 --session <name>
steel browser tab list --session <name>
steel browser tab close --session <name>
Synchronization
steel browser wait --load networkidle --session <name>
steel browser wait --selector ".loaded" --state visible --session <name>
steel browser wait -t "Success" --session <name>
steel browser wait -u "/dashboard" --session <name>
Extraction
steel browser get text @e1 --session <name>
steel browser get html @e1 --session <name>
steel browser get value @e1 --session <name>
steel browser get attr @e1 href --session <name>
steel browser get count ".item" --session <name>
steel browser content --session <name>
steel browser eval "document.querySelectorAll('a').length" --session <name>
steel browser find ".item" --session <name>
Screenshots (in-session)
steel browser screenshot -o ./page.png --session <name>
steel browser screenshot --full --session <name>
steel browser screenshot --selector "#chart" --session <name>
Top-level steel screenshot <url> and steel pdf <url> are stateless one-shot API calls — they do not take --session or -o flags. Use steel browser screenshot for in-session captures.
Cookies and storage
steel browser cookies --session <name>
steel browser cookies set <name> <value> --session <name>
steel browser cookies set <name> <value> --domain .example.com
steel browser cookies clear --session <name>
steel browser storage session --session <name>
steel browser storage session set authToken "abc123" --session <name>
Browser settings
steel browser set viewport 1920 1080 --session <name>
steel browser set geo 37.7749 -122.4194 --session <name>
steel browser set offline on --session <name>
steel browser set useragent "Custom UA" --session <name>
CAPTCHA
steel browser start --session <name> --stealth
steel browser captcha status --wait --session <name>
steel browser captcha solve --session <name>
eval for capability gaps
Use steel browser eval "<js>" --session <name> when no direct command exists. Common uses: network interception, DOM state injection, complex form widgets.
Commands that do NOT exist
Do not attempt these — they will fail.
| Does NOT exist | Use instead |
|---|---|
steel browser record / video | steel browser live for viewer URL |
steel browser network / route | eval with fetch monkey-patch |
steel browser console / errors | eval with console interceptor |
steel browser frame | eval with iframe contentDocument |
steel browser tabs (plural) | steel browser tab list (singular) |
steel browser execute / run | steel browser eval |
steel browser resize | steel browser set viewport W H |
steel browser geolocation | steel browser set geo LAT LON |
steel browser pdf | Top-level steel pdf <url> |
SDK integration (programmatic)
If you need to use Steel from code instead of the CLI:
Python (Playwright)
pip install steel-sdk playwright
from playwright.sync_api import sync_playwright
from steel import Steel
import os
client = Steel(steel_api_key=os.environ["STEEL_API_KEY"])
session = client.sessions.create()
try:
pw = sync_playwright().start()
browser = pw.chromium.connect_over_cdp(session.websocket_url)
page = browser.contexts[0].pages[0]
page.goto("https://example.com")
print(page.title())
finally:
browser.close()
pw.stop()
client.sessions.release(session.id)
Node.js (Puppeteer)
npm install steel-sdk puppeteer
import Steel from 'steel-sdk';
import puppeteer from 'puppeteer';
const client = new Steel({ steelAPIKey: process.env.STEEL_API_KEY });
const session = await client.sessions.create();
try {
const browser = await puppeteer.connect({
browserWSEndpoint: `${session.websocketUrl}?apiKey=${process.env.STEEL_API_KEY}`,
});
const page = await browser.newPage();
await page.goto('https://example.com');
console.log(await page.title());
await browser.disconnect();
} finally {
await client.sessions.release(session.id);
}
Key pattern: Create session → connect via CDP websocket URL → use any browser library → release session.
Troubleshooting
| Symptom | Fix |
|---|---|
steel: command not found | curl -sSf https://setup.steel.dev/install.sh | sh && export PATH="$HOME/.steel/bin:$PATH" |
Missing browser auth | steel login or set STEEL_API_KEY env var |
| Authentication error in SDK | export STEEL_API_KEY="your_key" |
No running session | Check session name; steel browser stop --all then restart |
| Stale element refs | Re-run steel browser snapshot -i before interacting |
| CAPTCHA blocking | steel browser start --stealth --session <name> |
| Session timeout | Add --session-timeout 3600000 for tasks over 5 minutes |
If you run into issues, refer to https://docs.steel.dev or run steel --help.
Related skills
More from steel-dev/cli and the wider catalog.

pyautogui-automation
Agent skill from steelan9199/wechat-publisher.

brave-search
Web search and content extraction via Brave Search API. Use for searching documentation, facts, or any web content. Lightweight, no browser required.

video-transcript-downloader
yt-dlp downloads: video, audio, subtitles, transcripts, clips, playlists.

1password
Set up and use 1Password CLI for sign-in, desktop integration, and reading or injecting secrets.

apple-notes
Create, view, edit, delete, search, move, and export Apple Notes from the terminal on macOS.

apple-reminders
Manage Apple Reminders from the terminal with remindctl.