Data Marketplace

Use verified, licensed data with confidence. You can download right away or check the data through inquiry.

Sell your data on Flitto

Simply register your data and check its sale eligibility.

A total of 326 datasets
  • Pre-training DataText

    Parenting Counseling Chatbot Dataset

    A chatbot text dataset consisting of user queries related to childcare and AI-generated counseling responses.

  • Pre-training DataText

    Parenting Community Dataset

    A childcare community text dataset containing real users’ questions, discussions, and shared experiences related to pregnancy, childbirth, and parenting.

  • Pre-training DataText

    Greek Literary Book Dataset

    A text dataset consisting of professionally edited Greek literary books across various genres, including novels, literary nonfiction, poetry, essays, and historical narratives.

  • Pre-training DataAudio

    English-Vietnamese Parallel Speech Dataset

    A parallel speech dataset consisting of sentence-level aligned English and Vietnamese utterances, designed for training Speech-to-Speech translation models.

  • Pre-training DataAudio

    English-Indonesian Parallel Speech Dataset

    A parallel speech dataset consisting of sentence-level aligned English and Indonesian utterances, designed for training Speech-to-Speech translation models.

  • Pre-training DataAudio

    Japanese Natural Dialogue Speech Dataset

    A speech dataset containing natural two-party dialogues in Japanese. It captures everyday conversational flow, intonation, and turn-taking timing, suitable for training general-purpose speech recognition and dialogue models.

  • Pre-training DataAudio

    English-Korean Parallel Speech Dataset

    A parallel speech dataset consisting of sentence-level aligned English and Korean utterances, designed for training Speech-to-Speech translation models.

  • Pre-training DataVideo

    Physical AI: Human-Object Interaction Egocentric Dataset

    An egocentric human-object manipulation video dataset collected for training Physical AI models in everyday environments. Includes original footage, ECoT annotations, hand keypoint and skeleton visualization videos, and structured metadata such as trajectory data.

  • Frontier DataText

    Multilingual Chain-of-Thought Reasoning Text Dataset

    A multilingual chain-of-thought reasoning dataset built from complex problems requiring step-by-step decomposition and coherent answer generation, with AI-generated drafts reviewed by expert-level annotators.

  • Frontier DataText

    Expert CoT Text Dataset

    An expert chain-of-thought text dataset built from expert verbal reasoning to support LLM training for step-by-step reasoning.