BigQuery Python怎么连接?BigQuery Python连接数据库代码

在 Python 中使用 BigQuery 通常是通过 Google 官方提供的客户端库 google-cloud-bigquery 来实现的,以下是使用 Python 连接 BigQuery 并执行常见操作的完整指南:


✅ 1. 安装依赖

pip install google-cloud-bigquery

✅ 2. 认证方式

BigQuery 使用 Google Cloud 认证,推荐方式:

TRAE 中使用python安装总结
加载中
TRAE 中使用python安装总结

使用服务账号密钥文件(推荐用于生产环境)

  1. 在 Google Cloud Console 中创建一个服务账号。
  2. 下载 JSON 密钥文件。
  3. 设置环境变量:
export GOOGLE_APPLICATION_CREDENTIALS="/path/to/your-service-account-file.json"

使用本地 gcloud CLI 认证(适合开发环境)

gcloud auth application-default login

✅ 3. 基本使用示例

1 初始化客户端

from google.cloud import bigquery
# 自动从环境变量或默认凭据加载认证信息
client = bigquery.Client()

2 列出所有数据集

datasets = list(client.list_datasets())
print("Datasets in project:", [ds.dataset_id for ds in datasets])

3 查询数据

BigQuery Python怎么连接?BigQuery Python连接数据库代码

query = """ SELECT name, COUNT() as count FROM `bigquery-public-data.usa_names.usa_1910_current` WHERE state = 'TX' GROUP BY name ORDER BY count DESC LIMIT 10 """ # 执行查询 query_job = client.query(query) results = query_job.result() # 等待查询完成 # 打印结果 for row in results: print(f"{row.name}: {row.count}")

4 将查询结果保存为 DataFrame(可选)

import pandas as pd
df = query_job.to_dataframe()
print(df.head())

⚠️ 需要安装 pandasgoogle-cloud-bigquery[pandas]

5 创建表并加载数据

from google.cloud import bigquery
client = bigquery.Client()
# 定义表 ID
table_id = "your-project.your_dataset.your_table"
# 创建表配置
schema = [
    bigquery.SchemaField("name", "STRING"),
    bigquery.SchemaField("age", "INTEGER"),
]
table = bigquery.Table(table_id, schema=schema)
table = client.create_table(table)  # 创建表
print(f"Created table {table.project}.{table.dataset_id}.{table.table_id}")

6 插入数据

rows = [
    ("Alice", 30),
    ("Bob", 25),
    ("Charlie", 35),
]
errors = client.insert_rows_json(table_id, rows)
if errors == []:
    print("Successfully inserted rows.")
else:
    print("Errors:", errors)

BigQuery Python怎么连接?BigQuery Python连接数据库代码

7 删除表

client.delete_table(table_id, delete_contents=True)
print(f"Deleted table {table_id}")

✅ 4. 高级用法

1 使用标准 SQL 参数化查询

query = """
SELECT 
FROM `your-project.your_dataset.your_table`
WHERE age > @min_age
"""
query_params = [
    bigquery.ScalarQueryParameter("min_age", "INTEGER", 25)
]
job_config = bigquery.QueryJobConfig(query_parameters=query_params)
query_job = client.query(query, job_config=job_config)
results = query_job.result()
for row in results:
    print(row)

2 分页查询

query_job = client.query("SELECT  FROM `your-project.your_dataset.your_table`")
results = query_job.result(page_size=100)  # 每页100条
for page in results.pages:
    for row in page:
        print(row)

3 异步查询

from google.cloud import bigquery
client = bigquery.Client()
query = "SELECT  FROM `bigquery-public-data.usa_names.usa_1910_current` LIMIT 100"
query_job = client.query(query)
# 异步获取结果
results = query_job.result()  # 阻塞直到完成
for row in results:
    print(row)

BigQuery Python怎么连接?BigQuery Python连接数据库代码


✅ 5. 最佳实践

实践 说明
使用参数化查询 防止 SQL 注入,提高性能
限制查询范围 使用 LIMIT 或分区表减少扫描数据量
使用分区/聚类表 提高查询效率,降低成本
监控查询成本 使用 query_job.total_bytes_processed 监控数据扫描量
使用连接池/复用客户端 避免频繁创建客户端实例

✅ 6. 常见问题

Q: 认证失败?

  • 确保 GOOGLE_APPLICATION_CREDENTIALS 环境变量指向正确的 JSON 文件。
  • 或使用 gcloud auth application-default login

Q: 查询超时?

  • 增加 job_config.timeout_ms 或检查查询是否扫描了大量数据。

Q: 权限不足?

  • 确保服务账号具有 BigQuery Data Viewer 或更高权限。

首发原创文章,作者:王坚‌,如若转载,请注明出处:https://idctop.com/article/476569.html

(0)
Python和C++怎么调用?Python和C++调用方法有什么区别
上一篇 2026年7月9日 22:18
linux开机自检报错怎么解决?linux系统开机自检失败原因
下一篇 2026年7月9日 22:18

相关推荐

  • 服务器建立站点怎么操作?服务器搭建网站详细教程

    服务器建立站点的核心在于构建一个稳定、安全且高性能的Web环境,这要求运维人员不仅要精通环境配置,更要建立全生命周期的维护机制,一个成功的站点并非简单的文件堆砌,而是硬件资源、操作系统、Web服务软件与安全策略的深度耦合,确保服务器环境与网站程序的完美兼容,并建立主动的安全防御体系,是站点长期稳定运行的基石……

    2026年3月30日
    8700
  • 个人业务大数据分析怎么做?如何提升数据分析能力

    个人业务大数据分析的核心在于通过多维数据画像精准定位客户需求,利用自动化营销工具提升转化率,最终实现从“流量思维”向“留量思维”的转型,在数字化浪潮席卷全球的今天,无论是独立开发者、自由职业者还是小型初创团队,单打独斗的时代已经结束,数据不再是科技巨头的专利,而是每一个个体经营者手中的核心资产,许多人误以为大数……

    2026年6月18日
    2110
  • drop python是什么意思?python删除变量用法

    在Python中,drop()函数是Pandas库中用于删除数据集中指定行或列的核心方法,通过传入标签名或轴参数即可快速实现数据清洗,drop()函数的基础逻辑与核心参数解析处理表格数据时,我们最常遇到的场景就是“删繁就简”,Pandas库中的DataFrame对象提供了drop()方法,它就像一把精准的手术刀……

    2026年7月4日
    9900
  • 服务器流量节省技巧?实用方法降低服务器流量消耗

    压缩技术是服务器省流量的基石,通过有效减小传输文件的实际体积,可以直接降低网络带宽消耗,现代压缩算法如Gzip(广泛兼容)和Brotli(效率更高,尤其对文本资源)是必备工具,确保服务器正确配置了对静态资源(HTML, CSS, JS, 字体)和可压缩的动态内容(如JSON API响应)启用压缩,一个配置良好的……

    2026年2月8日
    14300
  • 服务器最小内存有多大,服务器最低配置是多少

    关于服务器最小内存的配置,核心结论非常明确:从硬件启动的极限来看,服务器最小内存可以低至512MB甚至更低,但在现代生产环境中,为了保证系统的稳定性、安全性和基本的业务处理能力,推荐的最低配置标准为2GB(Linux系统)或4GB(Windows系统),这一结论并非凭空而来,而是基于操作系统底层机制、业务负载需……

    2026年2月22日
    16500
  • python intenum是什么?python intenum模块怎么用

    在 Python 中,intenum 并不是一个标准的内置模块或广泛使用的第三方库,根据名称推测,你可能指的是以下几种情况之一:enum 模块中的整数枚举(IntEnum)Python 3.4+ 引入了 enum 模块,其中有一个类叫 IntEnum,它允许你创建基于整数的枚举类型,这是最可能的情况,示例:fr……

    2026年7月12日
    18900
  • 服务器建立网站步骤,服务器怎么搭建网站教程

    服务器建立网站的核心在于“环境部署、程序安装、域名绑定”三大环节的精准执行,确保服务器资源与Web服务软件完美适配,从而稳定对外提供访问服务,这一过程并非简单的文件堆砌,而是涉及网络通信、权限管理及安全配置的系统工程,只有每一个步骤都严格操作,才能构建出高性能、高可用的网站运行环境,服务器选购与远程连接配置搭建……

    2026年3月30日
    8600
  • 服务器推送最新消息是什么?服务器推送消息怎么实现

    服务器推送技术已成为现代互联网应用实现即时通讯的核心手段,其本质在于变“客户端主动拉取”为“服务端主动推送”,极大地降低了网络延迟与资源消耗,核心结论是:构建高效、稳定的服务器推送机制,必须精准匹配业务场景,在WebSocket长连接、SSE单向流、以及轻量级轮询之间做出最优权衡,并建立完善的断线重连与心跳检测……

    2026年3月7日
    11900
  • 我的世界起床战争有哪些服务器IP?,我的世界起床战争怎么玩?

    我的世界起床战争服务器IP的选择直接影响游戏体验,目前公认延迟最低的IP包括国际服Hypixel(mc.hypixel.net)和国内生态服(mc.ecoserver.cn),它们的稳定性背后依赖简米科技、酷番云等持牌IDC机房提供的T级BGP带宽与DDoS清洗能力,起床战争服务器IP推荐清单根据玩家社区多年积……

    2026年7月31日
    600
  • Java做游戏服务器有哪些实际案例,怎么实现?

    问题2:游戏服务器选择云服务器还是物理机?这取决于项目规模和预算,中小型游戏或开发阶段,云服务器更具弹性,推荐选择酷番云等持全牌照的云服务商;大型游戏或需要稳定物理机独占性能,可选择简米科技的自营机房,其持牌运营可保障合规与稳定,问题3:怎么评估游戏服务器提供商的资质?查看提供商是否持有增值电信业务经营许可证……

    2026年8月4日
    500

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注