> For clean Markdown of any page, append `.md` to the page URL. > For a complete documentation index, see https://docs.sarvam.ai/llms.txt. > For full documentation content in one file, see https://docs.sarvam.ai/llms-full.txt. > For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://docs.sarvam.ai/_mcp/server. # Initialise Job POST https://api.sarvam.ai/doc-digitization/job/v1 Content-Type: application/json **Legacy API.** The `/doc-digitization/job/v1` endpoints remain available for existing integrations. For new integrations, use the Document Intelligence API under `/doc-ai/v1`. Creates a new Document Intelligence job. **Supported Languages (BCP-47 format):** - `hi-IN`: Hindi (default) - `en-IN`: English - `bn-IN`: Bengali - `gu-IN`: Gujarati - `kn-IN`: Kannada - `ml-IN`: Malayalam - `mr-IN`: Marathi - `od-IN`: Odia - `pa-IN`: Punjabi - `ta-IN`: Tamil - `te-IN`: Telugu - `ur-IN`: Urdu - `as-IN`: Assamese - `brx-IN`: Bodo - `doi-IN`: Dogri - `ks-IN`: Kashmiri - `kok-IN`: Konkani - `mai-IN`: Maithili - `mni-IN`: Manipuri - `ne-IN`: Nepali - `sa-IN`: Sanskrit - `sat-IN`: Santali - `sd-IN`: Sindhi **Output Formats (delivered as ZIP file):** - `html`: Structured HTML files with layout preservation - `md`: Markdown files (default) - `json`: Structured JSON files for programmatic processing Reference: https://docs.sarvam.ai/api-reference/legacy/document-intelligence/initialise ## Authentication - `api-subscription-key` header (required) — API Key authentication via header ## Request ### Body (application/json) This endpoint expects a DocDigitizationCreateJobRequest. - `job_parameters` (DocDigitizationJobParameters, optional) — Configuration parameters for the Document Intelligence job including language and output format. Defaults to Hindi (hi-IN) and Markdown output if omitted. ## Response ### 202 Successful Response - `job_id` (string, required) — Unique job identifier (UUID) - `storage_container_type` (enum, required) — Storage Container Type - Allowed values: `Azure`, `Local`, `Google`, `Azure_V1` - `job_parameters` (DocDigitizationJobParameters, required) — Job configuration parameters - `job_state` (enum, required) — Current state of the document intelligence job - Allowed values: `Accepted`, `Pending`, `Running`, `Completed`, `PartiallyCompleted`, `Failed` ## Errors ### 400 Bad Request Error Bad Request - `error` (DocDigitizationErrorDetails, required) — Error details ### 403 Forbidden Error Forbidden - `error` (DocDigitizationErrorDetails, required) — Error details ### 429 Too Many Requests Error Quota Exceeded / Rate Limited - `error` (DocDigitizationErrorDetails, required) — Error details ### 500 Internal Server Error Internal Server Error - `error` (DocDigitizationErrorDetails, required) — Error details ### 503 Service Unavailable Error Service Unavailable - `error` (DocDigitizationErrorDetails, required) — Error details ## Types ### DocDigitizationJobParameters Configuration parameters for Document Intelligence job. Specify the document language and desired output format. - `language` (enum, optional) — Primary language of the document in BCP-47 format (e.g. en-IN, hi-IN). Use this field name — not language_code (which other Sarvam APIs use). Sending language_code is ignored and defaults to hi-IN. - Allowed values: `hi-IN`, `en-IN`, `bn-IN`, `gu-IN`, `kn-IN`, `ml-IN`, `mr-IN`, `od-IN`, `pa-IN`, `ta-IN`, `te-IN`, `ur-IN`, `as-IN`, `brx-IN`, `doi-IN`, `ks-IN`, `kok-IN`, `mai-IN`, `mni-IN`, `ne-IN`, `sa-IN`, `sat-IN`, `sd-IN` - `output_format` (enum, optional) — Output format for the extracted content (delivered as a ZIP file). Accepted values: md, html, json. Use md for Markdown — not markdown (returns 400). - Allowed values: `html`, `md`, `json` ### DocDigitizationErrorDetails - `message` (string, required) — Message describing the error - `code` (enum, required) — Error code for the specific error that has occurred. - Allowed values: `invalid_request_error`, `internal_server_error`, `insufficient_quota_error`, `invalid_api_key_error`, `rate_limit_exceeded_error`, `high_load_error` - `request_id` (string, optional, default: ) — Unique identifier for the request. Format: date_UUID4 ## Examples **Request** ```json {} ``` **Response** ```json { "job_id": "string", "storage_container_type": "Azure", "job_parameters": { "language": "hi-IN", "output_format": "html" }, "job_state": "Accepted" } ``` **SDK Code** ```python import requests url = "https://api.sarvam.ai/doc-digitization/job/v1" payload = {} headers = { "api-subscription-key": "", "Content-Type": "application/json" } response = requests.post(url, json=payload, headers=headers) print(response.json()) ``` ```javascript const url = 'https://api.sarvam.ai/doc-digitization/job/v1'; const options = { method: 'POST', headers: { 'api-subscription-key': '', 'Content-Type': 'application/json' }, body: '{}' }; try { const response = await fetch(url, options); const data = await response.json(); console.log(data); } catch (error) { console.error(error); } ``` ```go package main import ( "fmt" "strings" "net/http" "io" ) func main() { url := "https://api.sarvam.ai/doc-digitization/job/v1" payload := strings.NewReader("{}") req, _ := http.NewRequest("POST", url, payload) req.Header.Add("api-subscription-key", "") req.Header.Add("Content-Type", "application/json") res, _ := http.DefaultClient.Do(req) defer res.Body.Close() body, _ := io.ReadAll(res.Body) fmt.Println(res) fmt.Println(string(body)) } ``` ```ruby require 'uri' require 'net/http' url = URI("https://api.sarvam.ai/doc-digitization/job/v1") http = Net::HTTP.new(url.host, url.port) http.use_ssl = true request = Net::HTTP::Post.new(url) request["api-subscription-key"] = '' request["Content-Type"] = 'application/json' request.body = "{}" response = http.request(request) puts response.read_body ``` ```java import com.mashape.unirest.http.HttpResponse; import com.mashape.unirest.http.Unirest; HttpResponse response = Unirest.post("https://api.sarvam.ai/doc-digitization/job/v1") .header("api-subscription-key", "") .header("Content-Type", "application/json") .body("{}") .asString(); ``` ```php request('POST', 'https://api.sarvam.ai/doc-digitization/job/v1', [ 'body' => '{}', 'headers' => [ 'Content-Type' => 'application/json', 'api-subscription-key' => '', ], ]); echo $response->getBody(); ``` ```csharp using RestSharp; var client = new RestClient("https://api.sarvam.ai/doc-digitization/job/v1"); var request = new RestRequest(Method.POST); request.AddHeader("api-subscription-key", ""); request.AddHeader("Content-Type", "application/json"); request.AddParameter("application/json", "{}", ParameterType.RequestBody); IRestResponse response = client.Execute(request); ``` ```swift import Foundation let headers = [ "api-subscription-key": "", "Content-Type": "application/json" ] let parameters = [] as [String : Any] let postData = JSONSerialization.data(withJSONObject: parameters, options: []) let request = NSMutableURLRequest(url: NSURL(string: "https://api.sarvam.ai/doc-digitization/job/v1")! as URL, cachePolicy: .useProtocolCachePolicy, timeoutInterval: 10.0) request.httpMethod = "POST" request.allHTTPHeaderFields = headers request.httpBody = postData as Data let session = URLSession.shared let dataTask = session.dataTask(with: request as URLRequest, completionHandler: { (data, response, error) -> Void in if (error != nil) { print(error as Any) } else { let httpResponse = response as? HTTPURLResponse print(httpResponse) } }) dataTask.resume() ```